Hasil Benchmark Qwen 3.8: Mengungkap Data Alibaba dan Keterbatasannya

Benchmarks Qwen 3.8-Max, dibaca dengan jujur: PaperBench 93.0 dan kemenangan multimodal, kekalahan HLE dan SWE-bench Pro, serta detail kecil yang sebagian besar liputan lewatkan.

INEZA Felin-Michel

INEZA Felin-Michel

3 August 2026

Hasil Benchmark Qwen 3.8: Mengungkap Data Alibaba dan Keterbatasannya

Apidog untuk Perusahaan

Penerapan On-Premises

SSO & RBAC

Sesuai SOC 2

Jelajahi Apidog Enterprise

Selama dua minggu, cerita Qwen 3.8 memiliki celah. Pratinjau pers bulan Juli menjanjikan model kelas perintis tetapi tidak menyertakan skor, sehingga setiap ulasan awal didasarkan pada spekulasi. Itu berubah pada 3 Agustus 2026. Pos rilis resmi Alibaba untuk Qwen 3.8-Max mencakup tabel benchmark lengkap terhadap Claude Opus 4.8, Fable 5, GPT-5.6 Sol, dan pendahulunya sendiri Qwen3.7-Max, ditambah tabel multimodal terpisah terhadap Gemini 3.1 Pro dan GPT-5.6 Sol.

Tabel itu patut dibaca dengan cermat. Tabel tersebut berisi kemenangan sejati, kerugian yang jujur, dan detail-detail kecil yang sebagian besar liputan akan lewati sepenuhnya. Postingan ini membahas ketiganya, lalu memberi Anda cara praktis untuk berhenti mempercayai tabel vendor sama sekali: jalankan evaluasi Anda sendiri terhadap API. Jika Anda ingin ikhtisar model lengkap terlebih dahulu (parameter, harga, akses), mulailah dengan penjelasan Qwen 3.8-Max kami dan kembali lagi.

Catatan pembingkaian sebelum angka-angka. Setiap skor di bawah ini berasal dari tabel yang diterbitkan Alibaba sendiri, dengan data papan peringkat yang catatan kakinya bertanggal 3 Agustus 2026. Tidak ada evaluasi independen yang tersedia pada saat penulisan. Ingatlah hal itu untuk setiap baris berikutnya.

Tabel, sekilas

Berikut adalah baris model teks utama sebagaimana yang diterbitkan Alibaba. Semakin tinggi semakin baik pada semua ini.

Benchmark Qwen 3.8-Max Claude Opus 4.8 Fable 5 GPT-5.6 Sol Qwen3.7-Max
Terminal Bench 2.1 86.6 84.6 84.6 88.8 74.5
SWE-bench Pro 67.7 69.2 80.0 64.6 60.6
PaperBench 93.0 80.3 88.8 90.5 64.8
GPQA Diamond 92.6 92.0 92.6 94.1 92.4
IFBench 82.8 62.2 63.5 72.7 79.1
HLE (Humanity’s Last Exam) 43.6 45.7 53.3 47.2 41.4

Sumber: Tabel yang dijalankan vendor Alibaba. Kita akan membahas apa arti "dijalankan vendor" dalam praktiknya lebih lanjut di bawah, karena hal itu lebih penting di sini daripada biasanya.

Di mana Qwen 3.8-Max unggul

PaperBench: baris unggulan terbaiknya

PaperBench, yang menguji apakah sebuah model dapat mereproduksi hasil makalah penelitian, adalah satu-satunya penampilan terkuat Qwen 3.8-Max terhadap frontier: 93.0, di depan GPT-5.6 Sol 90.5, Fable 5 88.8, dan Opus 4.8 80.3. Ini juga merupakan lompatan yang menakjubkan dari Qwen3.7-Max 64.8. Lompatan generasi 28 poin pada benchmark apa pun layak untuk dicermati, tetapi jika ia bertahan di bawah pengujian independen, itu mengatakan sesuatu yang nyata tentang kemampuan penelitian jangka panjang model tersebut.

IFBench: kepatuhan instruksi dengan margin lebar

Pada IFBench, Qwen 3.8-Max mencatat 82.8. Pesaing non-Qwen terdekat dalam tabel adalah GPT-5.6 Sol pada 72.7, dengan Fable 5 pada 63.5 dan Opus 4.8 pada 62.2. Itu adalah selisih 10 hingga 20 poin, yang tidak biasa pada benchmark yang begitu jenuh ini. Menariknya, Qwen3.7-Max sudah memimpin baris ini pada 79.1, jadi kepatuhan instruksi terlihat sebagai kekuatan Qwen yang tahan lama daripada kejadian sesaat.

Terminal Bench 2.1: mengungguli Claude

Pada pelaksanaan Terminal Bench 2.1 oleh Alibaba, Qwen 3.8-Max mencetak 86.6 melawan 84.6 untuk Opus 4.8 dan Fable 5. GPT-5.6 Sol masih memimpin baris pada 88.8, jadi ini adalah posisi kedua, bukan kemenangan mutlak. Tetapi mengalahkan kedua model unggulan Anthropic pada benchmark terminal yang bersifat agen adalah persis jenis hasil yang diinginkan Alibaba dari peluncuran ini, dan selisih dua poin di atas Claude adalah angka yang akan Anda lihat dikutip di mana-mana.

Kemenangan multimodal

Tabel multimodal terpisah adalah tempat Qwen 3.8-Max terlihat paling kuat secara keseluruhan. Alibaba melaporkan MathVision pada 95.2, LogicVista pada 91.9, dan OSWorld-Verified pada 86.1, dan model ini memimpin hampir setiap baris OCR dalam tabel. Baik Opus 4.8 maupun Fable 5 tidak berkompetisi langsung di sini (mereka berfokus pada teks dalam perbandingan ini), yang sebagian menjelaskan mengapa tabel multimodal terbaca sebagai kemenangan mutlak. Terhadap Gemini 3.1 Pro dan GPT-5.6 Sol, baris penalaran visual dan inteligensi dokumen adalah pembeda paling jelas dari model ini.

Jika Anda membandingkannya dengan rilis open-weight besar lainnya musim panas ini, celah multimodal juga merupakan kontras yang paling tajam: Kimi K3 hanya berbasis teks. Perbandingan Qwen 3.8 vs Kimi K3 kami mencakup pertandingan itu sepenuhnya.

Di mana ia kalah, disampaikan dengan jujur

Alibaba membiarkan kekalahan dalam tabel, yang patut diberi apresiasi. Tiga hal menonjol.

HLE: 43.6, jauh di belakang Fable 5. Pada Humanity’s Last Exam, benchmark perbatasan pengetahuan luas, Qwen 3.8-Max mencetak 43.6. Fable 5 berada di 53.3, GPT-5.6 Sol di 47.2, dan Opus 4.8 di 45.7. Itu adalah posisi terakhir di antara empat model unggulan, hampir 10 poin di belakang pemimpin. Ini mengalahkan Qwen3.7-Max 41.4, tetapi hanya sedikit. HLE menolak penyetelan khusus benchmark lebih baik daripada kebanyakan evaluasi, yang membuat baris ini sangat berharga untuk dipertimbangkan.

SWE-bench Pro: 67.7 vs Fable 5’s 80.0. Pada benchmark rekayasa perangkat lunak yang lebih sulit, Qwen 3.8-Max berada di tengah-tengah: di depan GPT-5.6 Sol (64.6), sedikit di belakang Opus 4.8 (69.2), dan 12 poin penuh di belakang Fable 5. Peningkatan generasi atas Qwen3.7-Max (60.6) adalah nyata, tetapi "mengalahkan Claude pada Terminal Bench" dan "tertinggal jauh dari Fable 5 pada SWE-bench Pro" keduanya benar sekaligus, dan klaim kedua akan muncul dalam jauh lebih sedikit berita utama.

DeepSWE dan baris-baris agen yang lebih sulit. DeepSWE adalah baris lain di mana Qwen 3.8-Max tertinggal dari frontier dalam tabel Alibaba sendiri. Pola di seluruh bagian pengkodean konsisten: kompetitif pada tugas agen yang digerakkan terminal, tertinggal pada evaluasi rekayasa perangkat lunak terdalam.

Ringkasan jujur: Qwen 3.8-Max mengalahkan Opus 4.8 pada beberapa baris agen, tertinggal dari Fable 5 pada sebagian besar pekerjaan pengkodean inti, dan menang besar pada inteligensi multimodal dan dokumen. Itu adalah hasil yang benar-benar kuat untuk model dengan harga $2 input dan $6 output per juta token (lihat halaman harga resmi), tetapi ini bukanlah kemenangan menyeluruh yang mungkin disarankan oleh sekilas liputan peluncuran.

Detail-detail kecil yang akan dilewati sebagian besar liputan

Ini adalah bagian yang membenarkan membaca postingan benchmark daripada hanya membaca judul. Empat detail dari publikasi Alibaba sendiri mengubah cara Anda harus membaca tabel.

1. Setiap angka dijalankan oleh vendor. Alibaba mengevaluasi modelnya sendiri dan model pesaingnya. Itu adalah praktik standar untuk tabel peluncuran, dan itu juga merupakan alasan standar mengapa tabel peluncuran kemudian direvisi. Vendor memilih versi benchmark, strategi prompting, pengaturan sampling, dan kebijakan percobaan ulang. Tidak ada yang merupakan penipuan. Semuanya memiliki keberpihakan.

2. Sebagian besar baris pengkodean dijalankan pada harness Claude Code. Ini adalah detail yang benar-benar menarik. Alibaba menjalankan sebagian besar benchmark pengkodeannya dengan Claude Code, harness agen milik Anthropic, yang diarahkan ke Qwen 3.8-Max melalui API yang kompatibel dengan Anthropic. Di satu sisi, itu adalah langkah fair-play: ia mengevaluasi setiap model di dalam alat yang sama yang banyak digunakan. Di sisi lain, itu berarti "skor pengkodean Qwen" sebenarnya adalah skor "Qwen di dalam harness Anthropic", dan pilihan harness dapat mengubah hasil agen beberapa poin. Ini juga memberi tahu Anda sesuatu tentang di mana Alibaba berharap model ini akan berjalan dalam praktik.

3. Beberapa benchmark adalah buatan Qwen sendiri. QwenSWEBench, QwenQoderBench, CoWorkBench, dan RecreationBench semuanya dibangun oleh tim Qwen. Benchmark internal tidaklah tidak berharga; mereka sering kali menguji kemampuan yang terlewatkan oleh evaluasi publik. Tetapi skor kuat sebuah model pada benchmark pembuatnya sendiri adalah jenis bukti yang berbeda dari skor kuat pada SWE-bench Pro, dan tabel menyajikan keduanya secara berdampingan tanpa pembedaan visual. Ketika Anda mengutip angka dari tabel ini, periksa dulu kategori mana ia termasuk.

4. Catatan kaki tentang Fable 5. Tabel Alibaba sendiri menyertakan catatan kaki yang menyatakan "Hasil Fable5 mungkin melibatkan fallback." Itu adalah pengakuan diam-diam bahwa setidaknya angka satu pesaing mungkin tidak mencerminkan model yang berjalan bersih. Apa pun penyebab teknisnya, itu berarti kolom Fable 5, model yang paling sering dikalahkan Qwen 3.8-Max, dilengkapi dengan tanda bintang dari orang-orang yang menerbitkannya.

Tidak ada yang unik bagi Alibaba. Anthropic, OpenAI, dan Google semuanya menerbitkan tabel yang dijalankan sendiri dengan pilihan metodologi mereka sendiri. Kami menandai pola yang sama dalam analisis benchmark Kimi K3 kami, dan itu juga berlaku di sana. Intinya bukan bahwa Alibaba menipu. Intinya adalah bahwa tabel vendor adalah sebuah klaim, bukan pengukuran.

Apa yang harus diperhatikan, dan cara membaca tabel berikutnya

Per 3 Agustus 2026, belum ada evaluasi independen terhadap Qwen 3.8-Max. Artificial Analysis belum menerbitkan angka pada saat penulisan, dan tidak ada papan peringkat komunitas yang telah menilai model tersebut. Itu akan berubah dalam beberapa hari, dan perbedaan antara tabel Alibaba dan hasil independen akan menjadi cerita sebenarnya. Kami akan memperbarui postingan ini ketika angka-angka tersebut tersedia.

Sampai saat itu, berikut adalah daftar periksa singkat untuk menilai tabel benchmark vendor mana pun, termasuk yang ini:

  1. Siapa yang menjalankan evaluasi? Angka yang dilaporkan sendiri untuk pesaing layak mendapatkan lebih banyak skeptisisme daripada angka yang dilaporkan sendiri untuk model vendor itu sendiri.
  2. Harness dan pengaturan apa? Benchmark agen sensitif terhadap harness. Tabel yang menyebutkan harness-nya (seperti yang dilakukan Alibaba) lebih berguna daripada yang tidak, tetapi pilihan tersebut tetap membentuk hasil.
  3. Benchmark mana yang dibangun oleh vendor? Evaluasi internal mengukur sesuatu, tetapi bukan sesuatu yang sama dengan evaluasi publik.
  4. Baca catatan kaki. "Mungkin melibatkan fallback" memiliki banyak implikasi dalam font kecil.
  5. Periksa apa yang hilang. Baris yang tidak diterbitkan vendor seringkali sama informatifnya dengan baris yang diterbitkan. Tabel vendor sebelumnya secara diam-diam menghilangkan benchmark di mana model berkinerja buruk; bandingkan dengan bagaimana generasi terakhir dibandingkan di seluruh vendor untuk menemukan baris mana yang menghilang.
  6. Tunggu sumber kedua. Satu minggu kesabaran biasanya memberi Anda angka-angka independen.

Jalankan evaluasi Anda sendiri sebagai gantinya

Daftar periksa membantu Anda membaca tabel. Langkah yang lebih baik adalah mengurangi ketergantungan pada tabel. Qwen 3.8-Max kini tersedia di Alibaba Cloud Model Studio (ID model qwen3.8-max, tercantum di halaman model resmi) dengan API yang kompatibel dengan OpenAI dan Anthropic, dan benchmark yang menggunakan prompt aktual Anda mengalahkan evaluasi publik mana pun yang tidak.

Penyiapan praktis di Apidog terlihat seperti ini. Buat satu permintaan terhadap endpoint chat-completions Model Studio dengan qwen3.8-max dan permintaan identik kedua terhadap model baseline Anda saat ini, baik itu Qwen3.7-Max, Kimi K3, atau endpoint Claude atau GPT. Simpan 20 hingga 30 prompt produksi Anda yang sebenarnya sebagai skenario uji, tambahkan asersi untuk properti respons yang benar-benar Anda pedulikan (JSON yang valid, bidang yang diperlukan ada, latensi di bawah ambang batas Anda), dan jalankan kedua skenario secara berurutan. Laporan uji Apidog memberi Anda tingkat kelulusan dan waktu respons per model, berdampingan, pada beban kerja Anda alih-alih beban kerja Alibaba.

Dua hal khusus Qwen yang perlu diperiksa saat Anda melakukannya: model default ke reasoning_effort: xhigh, jadi ukur biaya dan latensi pada tingkat upaya yang benar-benar akan Anda gunakan, dan jika Anda berencana menggunakan endpoint yang kompatibel dengan Anthropic, uji bentuk protokol tersebut secara terpisah, karena itulah yang digunakan sebagian besar benchmark pengkodean Alibaba sendiri. Unduh Apidog secara gratis, hubungkan kedua endpoint sebagai lingkungan, dan Anda akan memiliki angka pihak pertama sebelum papan peringkat independen menerbitkan angka mereka.

Pertanyaan yang Sering Diajukan

Apakah angka benchmark Qwen 3.8 diverifikasi secara independen?

Tidak. Per 3 Agustus 2026, setiap angka yang diterbitkan berasal dari tabel Alibaba sendiri. Artificial Analysis dan papan peringkat komunitas belum menilai Qwen 3.8-Max pada saat penulisan. Perlakukan tabel sebagai klaim vendor hingga hasil independen muncul.

Apa hasil benchmark terbaik Qwen 3.8-Max?

PaperBench, pada 93.0, adalah baris tabel unggulannya yang terbaik: di depan GPT-5.6 Sol (90.5), Fable 5 (88.8), dan Opus 4.8 (80.3). Dalam tabel multimodal, MathVision (95.2) dan baris OCR adalah hasil terkuatnya secara keseluruhan.

Di mana Qwen 3.8-Max jelas kalah?

Pada HLE, ia mencetak 43.6, terakhir di antara empat model unggulan dan jauh di belakang Fable 5 53.3. Pada SWE-bench Pro, ia mencatat 67.7 melawan Fable 5 80.0, dan juga tertinggal pada DeepSWE. Evaluasi rekayasa perangkat lunak mendalam dan ujian pengetahuan luas adalah area terlemahnya dalam tabel Alibaba sendiri.

Seberapa jauh lebih baik Qwen 3.8 daripada Qwen 3.7-Max pada benchmark?

Peningkatan generasi dalam tabel Alibaba sangat besar: Terminal Bench 2.1 naik dari 74.5 menjadi 86.6, SWE-bench Pro dari 60.6 menjadi 67.7, dan PaperBench dari 64.8 menjadi 93.0. Apakah peningkatan ini sepadan untuk beban kerja Anda juga tergantung pada harga dan modalitas; perbandingan Qwen 3.8 vs Qwen 3.7 kami membahas keputusan lengkapnya.

Mengembangkan API dengan Apidog

Apidog adalah alat pengembangan API yang membantu Anda mengembangkan API dengan lebih mudah dan efisien.