Qwen 3.8 untuk Pemrograman: Operasi Mandiri 16 Hari dan Koneksi Kode Claude

Qwen 3.8-Max untuk pengodean: uji coba otonom 16 hari Alibaba, hasil benchmark, dan konfigurasi resmi untuk Claude Code, Codex, Qoder, Qwen Code, dan OpenClaw.

Ashley Innocent

Ashley Innocent

3 August 2026

Qwen 3.8 untuk Pemrograman: Operasi Mandiri 16 Hari dan Koneksi Kode Claude

Apidog untuk Perusahaan

Penerapan On-Premises

SSO & RBAC

Sesuai SOC 2

Jelajahi Apidog Enterprise

Sebagian besar peluncuran model menggambarkan kemampuan pengodean dengan cara yang sama: inilah skor HumanEval kami, inilah cuplikan model yang menulis pencarian biner. Alibaba mengambil rute yang berbeda dengan Qwen 3.8-Max. Klaimnya bukan "ini menulis fungsi yang bagus." Klaimnya adalah bahwa ia dapat menjalankan proyek perangkat lunak sendiri selama berminggu-minggu: membuka masalah, menggabungkan permintaan pull (pull requests), dan mengirimkan fitur tanpa campur tangan manusia.

Itu adalah klaim yang berani, dan patut dicermati. Artikel ini membahas tiga pameran pengodean yang diterbitkan Alibaba saat peluncuran (semua demo vendor, salah satunya dengan repo publik yang dapat Anda audit), angka benchmark pengodean di baliknya, dan kemudian bagian yang dapat Anda lakukan hari ini: bagaimana cara benar-benar mengode dengan qwen3.8-max di Claude Code, Codex, Qoder, Qwen Code, dan OpenClaw, serta cara menguji output API yang dihasilkan oleh kode Anda.

Jika Anda baru mengenal model ini, mulailah dengan gambaran umum tentang apa itu Qwen 3.8: total 2.4T parameter, 95B aktif, jendela konteks 1M-token, dan bobot terbuka yang dijanjikan seminggu setelah peluncuran. Di sini kami akan tetap fokus pada cerita pengodean. Semua yang di bawah ini mencerminkan keadaan per tanggal 3 Agustus 2026.

tombol

Apa yang Sebenarnya Diklaim Alibaba

Pembingkaian dalam postingan rilis resmi Qwen 3.8 adalah otonomi dibandingkan cuplikan. Alibaba memposisikan Qwen 3.8-Max sebagai model yang dapat menangani tugas rekayasa jangka panjang: merencanakan pekerjaan, melaksanakannya selama berhari-hari, pulih dari kesalahannya sendiri, dan menghasilkan sesuatu yang dapat ditinjau pada akhirnya.

Tiga hal membuat klaim ini lebih menarik daripada pemasaran hari peluncuran biasa:

  1. Demo-nya panjang. Enam belas hari adalah rezim yang berbeda dari benchmark agen 20 menit. Pemulihan kesalahan, manajemen konteks, dan pergeseran jauh lebih penting pada skala tersebut.
  2. Satu demo bersifat publik. Anda dapat menelusuri repo, membaca komit, dan menilai kualitas kode sendiri. Sebagian besar pameran vendor tidak menawarkan hal itu.
  3. Harness-nya adalah milik pesaing. Alibaba menjalankan sebagian besar benchmark pengodean menggunakan harness Claude Code, dan menerbitkan konfigurasi resmi sehingga Anda dapat melakukan hal yang sama. Lebih lanjut tentang itu di bawah.

Peringatan standar, dan ini berlaku untuk seluruh artikel ini: setiap angka di sini berasal dari materi peluncuran Alibaba sendiri. Belum ada verifikasi independen hingga awal Agustus 2026. Perlakukan pameran ini sebagai demo, bukan audit.

Tiga Pameran Pengodean

oh-my-cli: 16 Hari Pengembangan Otonom

Demo utama. Alibaba membiarkan Qwen 3.8-Max untuk membangun alat baris perintah dan membiarkannya berjalan tanpa pengawasan. Hingga 30 Juli, proses tersebut telah berjalan selama 16 hari dan menghasilkan 265 commit, 127 pull request, dan 151 masalah, semuanya dibuka, dikerjakan, dan ditutup oleh model itu sendiri.

Repo tersebut bersifat publik di qwen-code-dev-bot/oh-my-cli, yang merupakan bagian paling berguna dari seluruh pameran. Anda tidak perlu mempercayai jumlah commit. Anda dapat membaca deskripsi PR, memeriksa apakah masalahnya adalah bug nyata atau pekerjaan sia-sia, dan melihat apakah kode tersebut bertahan. Output enam belas hari dari sebuah model tanpa tinjauan manusia adalah artefak yang benar-benar langka, apa pun yang Anda simpulkan tentang kualitasnya.

Hal yang perlu dicari saat Anda mengauditnya: apakah PR benar-benar memperbaiki masalah yang mereka referensikan, apakah model menciptakan pekerjaan artifisial untuk ditutup, dan bagaimana ia menangani regresinya sendiri. Pola-pola tersebut memberi tahu Anda lebih banyak tentang keandalan jangka panjang daripada skor benchmark tunggal.

Proses Reproduksi Makalah: Kode Penelitian, Bukan Kode Aplikasi

Demo kedua menargetkan kelas pengodean yang lebih sulit: mereproduksi makalah penelitian pembelajaran mesin dari awal. Menurut angka Alibaba, proses tersebut memakan waktu sekitar 125 jam, menghasilkan sekitar 7.600 baris kode, dan menjalankan 33 putaran pelatihan GPU.

Hasilnya: model tersebut mereproduksi 6 temuan makalah, kemudian melangkah lebih jauh dan mengalahkan hasil yang dilaporkan makalah sebesar 2,7 poin pada AIME24. Mereproduksi penelitian adalah pekerjaan yang sangat berat. Lingkungan bisa rusak, hiperparameter tersembunyi di catatan kaki, dan satu bug yang diam dapat membatalkan proses pelatihan yang baru Anda ketahui beberapa jam kemudian. Model yang dapat melewati 33 putaran pelatihan dan menghasilkan angka yang cocok melakukan sesuatu di luar pelengkapan otomatis.

Demo ini berpasangan dengan baris benchmark terkuat Qwen 3.8-Max, PaperBench, yang dibahas di bawah.

Kontes Tianchi: 24 Jam Melawan Tim Manusia

Pameran ketiga menempatkan model dalam kompetisi ilmu data langsung di platform Tianchi Alibaba dengan batas waktu 24 jam. Model tersebut melakukan 45 submisi dalam jangka waktu tersebut, mengulang pendekatannya setiap kali, dan berakhir dengan akurasi akhir 0.853. Ini menempatkannya di depan 458 dari 526 tim manusia yang bersaing.

Perlu dicatat bentuk hasil ini: model tidak menang. Ia mengalahkan 87% peserta, yang mengesankan sekaligus jujur. Ini juga menunjukkan kemampuan yang tidak dimiliki dua demo lainnya: iterasi cepat di bawah tenggat waktu, di mana skor setiap submisi menjadi masukan untuk percobaan berikutnya.

Satu peringatan lagi yang berlaku dengan kekuatan ekstra di sini: Tianchi adalah platform Alibaba sendiri. Demo ini nyata, tetapi vendor mengontrol tempatnya.

Benchmark Pengodean di Balik Demo

Alibaba menerbitkan tabel benchmark lengkap saat peluncuran. Berikut adalah baris yang relevan dengan pengodean, dengan bagian yang jujur disertakan. Semua angka adalah hasil uji Alibaba sendiri.

Benchmark Qwen 3.8-Max Pesaing Terbaik (berdasarkan tabel Alibaba)
Terminal Bench 2.1 86.6 88.8 (GPT-5.6 Sol)
SWE-bench Pro 67.7 80.0 (Fable 5)
PaperBench 93.0 90.5 (GPT-5.6 Sol)

Tiga poin penting:

Sekarang detail kecil yang akan dilewatkan sebagian besar liputan: Alibaba menjalankan sebagian besar benchmark pengodean ini pada harness Claude Code, termasuk untuk model pesaing, dan catatan kaki tabel menunjukkan bahwa hasil Fable 5 mungkin melibatkan fallback. Pilihan harness secara material memengaruhi skor benchmark agentik, jadi tabel yang dijalankan vendor pada harness tertentu adalah satu titik data, bukan keputusan akhir.

Namun, detail Claude Code memiliki dua sisi. Itu berarti Alibaba mengoptimalkan untuk harness yang mungkin sudah Anda gunakan, dan mereka menerbitkan konfigurasi untuk membuktikannya.

Cara Mengode dengan Qwen 3.8 Hari Ini

Ini adalah bagian praktisnya. Qwen 3.8-Max sudah GA di Alibaba Cloud Model Studio, dan Alibaba menerbitkan konfigurasi resmi untuk lima alat pengodean saat peluncuran. Anda memerlukan kunci API DashScope (dari home.qwencloud.com) untuk semuanya. Harga adalah $2 per juta token masukan dan $6 per juta token keluaran, datar di seluruh konteks 1M, sesuai halaman harga resmi Model Studio.

Claude Code

Model ini dilengkapi dengan endpoint API yang kompatibel dengan Anthropic, jadi mengarahkan Claude Code ke sana membutuhkan tiga variabel lingkungan:

export ANTHROPIC_BASE_URL=https://dashscope-intl.aliyuncs.com/apps/anthropic
export ANTHROPIC_AUTH_TOKEN=kunci-api-dashscope-anda
export ANTHROPIC_MODEL=qwen3.8-max

Mulai Claude Code seperti biasa dan itu akan mengarahkan setiap permintaan ke Qwen 3.8-Max alih-alih Claude. Mengingat bahwa Alibaba menjalankan benchmark pengodeannya pada harness yang persis sama ini, ini adalah konfigurasi dengan perbedaan paling sedikit antara apa yang diukur dan apa yang akan Anda alami.

Codex

Codex membutuhkan entri penyedia dalam konfigurasinya. Sketsa dari dokumen resmi:

model = "qwen3.8-max"
model_provider = "qwencloud"

[model_providers.qwencloud]
name = "QwenCloud"
base_url = "https://dashscope-intl.aliyuncs.com/compatible-mode/v1"
env_key = "DASHSCOPE_API_KEY"
context_window = 1000000

Ini menggunakan endpoint yang kompatibel dengan OpenAI daripada yang Anthropic. Model yang sama, kunci yang sama, bentuk protokol yang berbeda.

Qoder, Qwen Code, dan OpenClaw

Tiga sisanya lebih cepat diringkas:

Kelima konfigurasi ada di postingan peluncuran, jadi ambil versi terbaru yang persis di sana daripada terpaku pada tangkapan layar blog.

Atur Upaya Penalaran dengan Sengaja

Qwen 3.8-Max mendukung parameter reasoning_effort dengan tiga tingkatan: xhigh (default), medium, dan low. Untuk pengodean, pengaturan ini lebih penting daripada sebagian besar pengaturan lain:

Ingat bahwa token "berpikir" ditagih sebagai token keluaran sebesar $6 per juta, dan xhigh adalah defaultnya. Sesi agentik yang panjang dengan upaya penuh akan memakan biaya yang nyata; edit mekanis pada mode xhigh akan memakan biaya tanpa manfaat.

Jika Qwen 3.8-Max adalah model yang lebih dari yang Anda butuhkan, lini Qwen3 Coder yang lebih lama masih ada untuk pekerjaan pengodean khusus, dan Qwen3 Coder Flash mencakup segmen yang cepat dan murah. Untuk model bobot terbuka besar lainnya di bidang ini, lihat bagaimana Kimi K3 menangani pekerjaan pengodean.

Menguji Apa yang Dibangun Model: Langkah Apidog

Inilah celah dalam setiap demo pengodean otonom, termasuk milik Alibaba: model menulis kode yang memanggil API, dan tidak ada yang berbicara tentang memverifikasi panggilan tersebut. Seorang agen dapat menghasilkan 7.600 baris kode yang mengompilasi dengan bersih namun tetap memukul endpoint yang salah, salah menangani kesalahan 429, atau mengirim badan permintaan yang gagal validasi di produksi.

Dua kebiasaan menutup celah itu.

Uji endpoint yang dipanggil oleh kode yang Anda hasilkan. Saat Qwen 3.8-Max membuat kerangka layanan atau menulis klien API, impor spesifikasi yang relevan ke Apidog dan jalankan endpoint secara langsung: alur otentikasi, respons kesalahan, payload kasus ekstrem. Jauh lebih murah untuk menemukan asumsi yang salah dalam uji coba daripada dalam stack trace dua hari setelah sesi otonom. Jika Anda mengevaluasi API model itu sendiri sebelum menggunakannya, panduan API Qwen 3.8 membahas pengaturan protokol ganda OpenAI dan Anthropic secara rinci, dan Apidog adalah tempat yang nyaman untuk memeriksa kedua bentuk protokol secara berdampingan, termasuk respons streaming dan delta penalaran.

Mengejek API agar agen tidak mengenai produksi. Hal ini menjadi lebih penting semakin lama proses Anda berjalan. Sesi otonom 16 hari yang membuat panggilan langsung terhadap infrastruktur produksi adalah ide yang benar-benar buruk: batas kecepatan, mutasi data, tagihan tak terduga. Server mock di Apidog memberikan respons realistis kepada agen tanpa menyentuh sistem nyata. Arahkan kode yang dihasilkan ke URL mock selama proses, tukar dengan URL dasar yang sebenarnya setelah manusia meninjau hasilnya. Unduh Apidog secara gratis untuk menyiapkan mock dalam beberapa menit; ini adalah asuransi termurah yang bisa dimiliki proses agen yang tidak diawasi.

Pola ini berlaku secara umum: semakin banyak otonomi yang Anda berikan pada model pengodean, semakin banyak lapisan API menjadi permukaan kendali Anda. Anda tidak dapat meninjau setiap commit secara real-time, tetapi Anda dapat mengontrol dengan apa kode diizinkan untuk berkomunikasi.

Pertanyaan yang Sering Diajukan

Apakah Qwen 3.8 Bagus untuk Pengodean?

Berdasarkan angka Alibaba sendiri, ia kuat dalam pengodean agentik dan gaya penelitian (Terminal Bench 2.1 pada 86.6, PaperBench pada 93.0) dan berada di tengah-tengah untuk perbaikan bug skala repositori (SWE-bench Pro pada 67.7 dibandingkan Fable 5 pada 80.0). Semua angka adalah hasil uji vendor tanpa verifikasi independen hingga saat ini. Pembacaan jujur: sangat baik untuk pekerjaan otonom jangka panjang, bukan yang terdepan untuk perbaikan masalah klasik.

Bisakah Saya Menggunakan Qwen 3.8 di Claude Code?

Ya, secara resmi. Atur ANTHROPIC_BASE_URL ke https://dashscope-intl.aliyuncs.com/apps/anthropic, ANTHROPIC_AUTH_TOKEN ke kunci DashScope Anda, dan ANTHROPIC_MODEL ke qwen3.8-max. Alibaba menerbitkan konfigurasi ini sendiri dan menjalankan sebagian besar benchmark pengodeannya pada harness Claude Code.

Berapa Biaya Pengodean dengan Qwen 3.8?

$2 per juta token masukan dan $6 per juta token keluaran, datar di seluruh konteks 1M. Token "berpikir" ditagih sebagai keluaran, dan upaya penalaran xhigh default menghasilkan banyak di antaranya, jadi anggarkan di atas harga tertera untuk sesi agentik. Perhitungan biaya penuh dan perbandingan ada di rincian benchmark Qwen 3.8 dan liputan harga yang terhubung di sana.

Apakah Proses oh-my-cli Selama 16 Hari Benar-benar Otonom?

Itu adalah klaim Alibaba, dan tidak seperti sebagian besar demo vendor, Anda dapat memeriksa artefaknya: repo tersebut bersifat publik di qwen-code-dev-bot/oh-my-cli dengan 265 commit, 127 PR, dan 151 masalah per tanggal 30 Juli 2026. Apakah kualitas kode membenarkan pembingkaiannya adalah penilaian yang dapat Anda buat sendiri dengan membacanya, dan itulah yang membuat pameran ini lebih kredibel daripada tangkapan layar.

Mengembangkan API dengan Apidog

Apidog adalah alat pengembangan API yang membantu Anda mengembangkan API dengan lebih mudah dan efisien.