Sebagian besar peluncuran model menggambarkan kemampuan pengodean dengan cara yang sama: inilah skor HumanEval kami, inilah cuplikan model yang menulis pencarian biner. Alibaba mengambil rute yang berbeda dengan Qwen 3.8-Max. Klaimnya bukan "ini menulis fungsi yang bagus." Klaimnya adalah bahwa ia dapat menjalankan proyek perangkat lunak sendiri selama berminggu-minggu: membuka masalah, menggabungkan permintaan pull (pull requests), dan mengirimkan fitur tanpa campur tangan manusia.
Itu adalah klaim yang berani, dan patut dicermati. Artikel ini membahas tiga pameran pengodean yang diterbitkan Alibaba saat peluncuran (semua demo vendor, salah satunya dengan repo publik yang dapat Anda audit), angka benchmark pengodean di baliknya, dan kemudian bagian yang dapat Anda lakukan hari ini: bagaimana cara benar-benar mengode dengan qwen3.8-max di Claude Code, Codex, Qoder, Qwen Code, dan OpenClaw, serta cara menguji output API yang dihasilkan oleh kode Anda.
Jika Anda baru mengenal model ini, mulailah dengan gambaran umum tentang apa itu Qwen 3.8: total 2.4T parameter, 95B aktif, jendela konteks 1M-token, dan bobot terbuka yang dijanjikan seminggu setelah peluncuran. Di sini kami akan tetap fokus pada cerita pengodean. Semua yang di bawah ini mencerminkan keadaan per tanggal 3 Agustus 2026.
tombol
Apa yang Sebenarnya Diklaim Alibaba
Pembingkaian dalam postingan rilis resmi Qwen 3.8 adalah otonomi dibandingkan cuplikan. Alibaba memposisikan Qwen 3.8-Max sebagai model yang dapat menangani tugas rekayasa jangka panjang: merencanakan pekerjaan, melaksanakannya selama berhari-hari, pulih dari kesalahannya sendiri, dan menghasilkan sesuatu yang dapat ditinjau pada akhirnya.

Tiga hal membuat klaim ini lebih menarik daripada pemasaran hari peluncuran biasa:
- Demo-nya panjang. Enam belas hari adalah rezim yang berbeda dari benchmark agen 20 menit. Pemulihan kesalahan, manajemen konteks, dan pergeseran jauh lebih penting pada skala tersebut.
- Satu demo bersifat publik. Anda dapat menelusuri repo, membaca komit, dan menilai kualitas kode sendiri. Sebagian besar pameran vendor tidak menawarkan hal itu.
- Harness-nya adalah milik pesaing. Alibaba menjalankan sebagian besar benchmark pengodean menggunakan harness Claude Code, dan menerbitkan konfigurasi resmi sehingga Anda dapat melakukan hal yang sama. Lebih lanjut tentang itu di bawah.
Peringatan standar, dan ini berlaku untuk seluruh artikel ini: setiap angka di sini berasal dari materi peluncuran Alibaba sendiri. Belum ada verifikasi independen hingga awal Agustus 2026. Perlakukan pameran ini sebagai demo, bukan audit.
Tiga Pameran Pengodean
oh-my-cli: 16 Hari Pengembangan Otonom
Demo utama. Alibaba membiarkan Qwen 3.8-Max untuk membangun alat baris perintah dan membiarkannya berjalan tanpa pengawasan. Hingga 30 Juli, proses tersebut telah berjalan selama 16 hari dan menghasilkan 265 commit, 127 pull request, dan 151 masalah, semuanya dibuka, dikerjakan, dan ditutup oleh model itu sendiri.
Repo tersebut bersifat publik di qwen-code-dev-bot/oh-my-cli, yang merupakan bagian paling berguna dari seluruh pameran. Anda tidak perlu mempercayai jumlah commit. Anda dapat membaca deskripsi PR, memeriksa apakah masalahnya adalah bug nyata atau pekerjaan sia-sia, dan melihat apakah kode tersebut bertahan. Output enam belas hari dari sebuah model tanpa tinjauan manusia adalah artefak yang benar-benar langka, apa pun yang Anda simpulkan tentang kualitasnya.
Hal yang perlu dicari saat Anda mengauditnya: apakah PR benar-benar memperbaiki masalah yang mereka referensikan, apakah model menciptakan pekerjaan artifisial untuk ditutup, dan bagaimana ia menangani regresinya sendiri. Pola-pola tersebut memberi tahu Anda lebih banyak tentang keandalan jangka panjang daripada skor benchmark tunggal.
Proses Reproduksi Makalah: Kode Penelitian, Bukan Kode Aplikasi
Demo kedua menargetkan kelas pengodean yang lebih sulit: mereproduksi makalah penelitian pembelajaran mesin dari awal. Menurut angka Alibaba, proses tersebut memakan waktu sekitar 125 jam, menghasilkan sekitar 7.600 baris kode, dan menjalankan 33 putaran pelatihan GPU.

Hasilnya: model tersebut mereproduksi 6 temuan makalah, kemudian melangkah lebih jauh dan mengalahkan hasil yang dilaporkan makalah sebesar 2,7 poin pada AIME24. Mereproduksi penelitian adalah pekerjaan yang sangat berat. Lingkungan bisa rusak, hiperparameter tersembunyi di catatan kaki, dan satu bug yang diam dapat membatalkan proses pelatihan yang baru Anda ketahui beberapa jam kemudian. Model yang dapat melewati 33 putaran pelatihan dan menghasilkan angka yang cocok melakukan sesuatu di luar pelengkapan otomatis.
Demo ini berpasangan dengan baris benchmark terkuat Qwen 3.8-Max, PaperBench, yang dibahas di bawah.
Kontes Tianchi: 24 Jam Melawan Tim Manusia
Pameran ketiga menempatkan model dalam kompetisi ilmu data langsung di platform Tianchi Alibaba dengan batas waktu 24 jam. Model tersebut melakukan 45 submisi dalam jangka waktu tersebut, mengulang pendekatannya setiap kali, dan berakhir dengan akurasi akhir 0.853. Ini menempatkannya di depan 458 dari 526 tim manusia yang bersaing.

Perlu dicatat bentuk hasil ini: model tidak menang. Ia mengalahkan 87% peserta, yang mengesankan sekaligus jujur. Ini juga menunjukkan kemampuan yang tidak dimiliki dua demo lainnya: iterasi cepat di bawah tenggat waktu, di mana skor setiap submisi menjadi masukan untuk percobaan berikutnya.
Satu peringatan lagi yang berlaku dengan kekuatan ekstra di sini: Tianchi adalah platform Alibaba sendiri. Demo ini nyata, tetapi vendor mengontrol tempatnya.
Benchmark Pengodean di Balik Demo
Alibaba menerbitkan tabel benchmark lengkap saat peluncuran. Berikut adalah baris yang relevan dengan pengodean, dengan bagian yang jujur disertakan. Semua angka adalah hasil uji Alibaba sendiri.
| Benchmark | Qwen 3.8-Max | Pesaing Terbaik (berdasarkan tabel Alibaba) |
|---|---|---|
| Terminal Bench 2.1 | 86.6 | 88.8 (GPT-5.6 Sol) |
| SWE-bench Pro | 67.7 | 80.0 (Fable 5) |
| PaperBench | 93.0 | 90.5 (GPT-5.6 Sol) |
Tiga poin penting:
- Terminal Bench 2.1 (86.6) menempatkan Qwen 3.8-Max di depan Claude Opus 4.8 dan Fable 5 (keduanya 84.6 dalam tabel Alibaba) pada pekerjaan agentik berbasis terminal. Ini adalah angka yang mendukung demo oh-my-cli.
- SWE-bench Pro (67.7) adalah kerugian, dan tidak mendekati. Fable 5 mencetak 80.0 pada tabel yang sama. Pada perbaikan bug skala repositori, benchmark yang paling langsung memetakan ke "perbaiki masalah ini di basis kode saya," Qwen 3.8-Max tertinggal dari pemimpin lebih dari 12 poin. Alibaba tetap menerbitkan angka ini, yang merupakan penghargaan bagi mereka.
- PaperBench (93.0) adalah baris unggulan terbaik model ini, mengalahkan segalanya dalam kumpulan perbandingan. Ini secara langsung mendukung demo reproduksi makalah.
Sekarang detail kecil yang akan dilewatkan sebagian besar liputan: Alibaba menjalankan sebagian besar benchmark pengodean ini pada harness Claude Code, termasuk untuk model pesaing, dan catatan kaki tabel menunjukkan bahwa hasil Fable 5 mungkin melibatkan fallback. Pilihan harness secara material memengaruhi skor benchmark agentik, jadi tabel yang dijalankan vendor pada harness tertentu adalah satu titik data, bukan keputusan akhir.
Namun, detail Claude Code memiliki dua sisi. Itu berarti Alibaba mengoptimalkan untuk harness yang mungkin sudah Anda gunakan, dan mereka menerbitkan konfigurasi untuk membuktikannya.
Cara Mengode dengan Qwen 3.8 Hari Ini
Ini adalah bagian praktisnya. Qwen 3.8-Max sudah GA di Alibaba Cloud Model Studio, dan Alibaba menerbitkan konfigurasi resmi untuk lima alat pengodean saat peluncuran. Anda memerlukan kunci API DashScope (dari home.qwencloud.com) untuk semuanya. Harga adalah $2 per juta token masukan dan $6 per juta token keluaran, datar di seluruh konteks 1M, sesuai halaman harga resmi Model Studio.
Claude Code
Model ini dilengkapi dengan endpoint API yang kompatibel dengan Anthropic, jadi mengarahkan Claude Code ke sana membutuhkan tiga variabel lingkungan:
export ANTHROPIC_BASE_URL=https://dashscope-intl.aliyuncs.com/apps/anthropic
export ANTHROPIC_AUTH_TOKEN=kunci-api-dashscope-anda
export ANTHROPIC_MODEL=qwen3.8-max
Mulai Claude Code seperti biasa dan itu akan mengarahkan setiap permintaan ke Qwen 3.8-Max alih-alih Claude. Mengingat bahwa Alibaba menjalankan benchmark pengodeannya pada harness yang persis sama ini, ini adalah konfigurasi dengan perbedaan paling sedikit antara apa yang diukur dan apa yang akan Anda alami.
Codex
Codex membutuhkan entri penyedia dalam konfigurasinya. Sketsa dari dokumen resmi:
model = "qwen3.8-max"
model_provider = "qwencloud"
[model_providers.qwencloud]
name = "QwenCloud"
base_url = "https://dashscope-intl.aliyuncs.com/compatible-mode/v1"
env_key = "DASHSCOPE_API_KEY"
context_window = 1000000
Ini menggunakan endpoint yang kompatibel dengan OpenAI daripada yang Anthropic. Model yang sama, kunci yang sama, bentuk protokol yang berbeda.
Qoder, Qwen Code, dan OpenClaw
Tiga sisanya lebih cepat diringkas:
- Qoder CLI: Alat pengodean agentik milik Alibaba sendiri. Pilih
qwen3.8-maxsebagai model; ini adalah integrasi pihak pertama, jadi pengaturannya adalah nilai konfigurasi. - Qwen Code: CLI sumber terbuka dari tim Qwen. Atur
DASHSCOPE_API_KEYdan pilih model. Jika Anda pernah menggunakannya dengan model pengodean Qwen sebelumnya, tidak ada yang lain yang berubah. - OpenClaw: Konfigurasi resmi menetapkan ID model dan
maxTokenssebesar 65.536, yang juga merupakan batas panjang output maksimum model.
Kelima konfigurasi ada di postingan peluncuran, jadi ambil versi terbaru yang persis di sana daripada terpaku pada tangkapan layar blog.
Atur Upaya Penalaran dengan Sengaja
Qwen 3.8-Max mendukung parameter reasoning_effort dengan tiga tingkatan: xhigh (default), medium, dan low. Untuk pengodean, pengaturan ini lebih penting daripada sebagian besar pengaturan lain:
- Pertahankan
xhighuntuk pekerjaan agentik: refaktor multi-file, sesi debugging, apa pun yang membutuhkan model untuk merencanakan sebelum mengedit. Proses pameran mewakili mode ini. - Turunkan ke
lowuntuk edit cepat: penggantian nama, melewati docstring, perubahan mekanis di mana penalaran mendalam membuang waktu dan token.
Ingat bahwa token "berpikir" ditagih sebagai token keluaran sebesar $6 per juta, dan xhigh adalah defaultnya. Sesi agentik yang panjang dengan upaya penuh akan memakan biaya yang nyata; edit mekanis pada mode xhigh akan memakan biaya tanpa manfaat.
Jika Qwen 3.8-Max adalah model yang lebih dari yang Anda butuhkan, lini Qwen3 Coder yang lebih lama masih ada untuk pekerjaan pengodean khusus, dan Qwen3 Coder Flash mencakup segmen yang cepat dan murah. Untuk model bobot terbuka besar lainnya di bidang ini, lihat bagaimana Kimi K3 menangani pekerjaan pengodean.
Menguji Apa yang Dibangun Model: Langkah Apidog
Inilah celah dalam setiap demo pengodean otonom, termasuk milik Alibaba: model menulis kode yang memanggil API, dan tidak ada yang berbicara tentang memverifikasi panggilan tersebut. Seorang agen dapat menghasilkan 7.600 baris kode yang mengompilasi dengan bersih namun tetap memukul endpoint yang salah, salah menangani kesalahan 429, atau mengirim badan permintaan yang gagal validasi di produksi.
Dua kebiasaan menutup celah itu.
Uji endpoint yang dipanggil oleh kode yang Anda hasilkan. Saat Qwen 3.8-Max membuat kerangka layanan atau menulis klien API, impor spesifikasi yang relevan ke Apidog dan jalankan endpoint secara langsung: alur otentikasi, respons kesalahan, payload kasus ekstrem. Jauh lebih murah untuk menemukan asumsi yang salah dalam uji coba daripada dalam stack trace dua hari setelah sesi otonom. Jika Anda mengevaluasi API model itu sendiri sebelum menggunakannya, panduan API Qwen 3.8 membahas pengaturan protokol ganda OpenAI dan Anthropic secara rinci, dan Apidog adalah tempat yang nyaman untuk memeriksa kedua bentuk protokol secara berdampingan, termasuk respons streaming dan delta penalaran.
Mengejek API agar agen tidak mengenai produksi. Hal ini menjadi lebih penting semakin lama proses Anda berjalan. Sesi otonom 16 hari yang membuat panggilan langsung terhadap infrastruktur produksi adalah ide yang benar-benar buruk: batas kecepatan, mutasi data, tagihan tak terduga. Server mock di Apidog memberikan respons realistis kepada agen tanpa menyentuh sistem nyata. Arahkan kode yang dihasilkan ke URL mock selama proses, tukar dengan URL dasar yang sebenarnya setelah manusia meninjau hasilnya. Unduh Apidog secara gratis untuk menyiapkan mock dalam beberapa menit; ini adalah asuransi termurah yang bisa dimiliki proses agen yang tidak diawasi.
Pola ini berlaku secara umum: semakin banyak otonomi yang Anda berikan pada model pengodean, semakin banyak lapisan API menjadi permukaan kendali Anda. Anda tidak dapat meninjau setiap commit secara real-time, tetapi Anda dapat mengontrol dengan apa kode diizinkan untuk berkomunikasi.
Pertanyaan yang Sering Diajukan
Apakah Qwen 3.8 Bagus untuk Pengodean?
Berdasarkan angka Alibaba sendiri, ia kuat dalam pengodean agentik dan gaya penelitian (Terminal Bench 2.1 pada 86.6, PaperBench pada 93.0) dan berada di tengah-tengah untuk perbaikan bug skala repositori (SWE-bench Pro pada 67.7 dibandingkan Fable 5 pada 80.0). Semua angka adalah hasil uji vendor tanpa verifikasi independen hingga saat ini. Pembacaan jujur: sangat baik untuk pekerjaan otonom jangka panjang, bukan yang terdepan untuk perbaikan masalah klasik.
Bisakah Saya Menggunakan Qwen 3.8 di Claude Code?
Ya, secara resmi. Atur ANTHROPIC_BASE_URL ke https://dashscope-intl.aliyuncs.com/apps/anthropic, ANTHROPIC_AUTH_TOKEN ke kunci DashScope Anda, dan ANTHROPIC_MODEL ke qwen3.8-max. Alibaba menerbitkan konfigurasi ini sendiri dan menjalankan sebagian besar benchmark pengodeannya pada harness Claude Code.
Berapa Biaya Pengodean dengan Qwen 3.8?
$2 per juta token masukan dan $6 per juta token keluaran, datar di seluruh konteks 1M. Token "berpikir" ditagih sebagai keluaran, dan upaya penalaran xhigh default menghasilkan banyak di antaranya, jadi anggarkan di atas harga tertera untuk sesi agentik. Perhitungan biaya penuh dan perbandingan ada di rincian benchmark Qwen 3.8 dan liputan harga yang terhubung di sana.
Apakah Proses oh-my-cli Selama 16 Hari Benar-benar Otonom?
Itu adalah klaim Alibaba, dan tidak seperti sebagian besar demo vendor, Anda dapat memeriksa artefaknya: repo tersebut bersifat publik di qwen-code-dev-bot/oh-my-cli dengan 265 commit, 127 PR, dan 151 masalah per tanggal 30 Juli 2026. Apakah kualitas kode membenarkan pembingkaiannya adalah penilaian yang dapat Anda buat sendiri dengan membacanya, dan itulah yang membuat pameran ini lebih kredibel daripada tangkapan layar.
