Alibaba merilis Qwen 3.8-Max pada awal Agustus 2026, dan API-nya sudah tersedia di Model Studio. Model ini memiliki total 2.4T parameter (95B aktif), jendela konteks 1M token, dan harga tetap $2 input / $6 output per juta token. Jika Anda ingin latar belakang lengkap tentang model itu sendiri, mulailah dengan penjelasan Qwen 3.8 kami. Panduan ini mencakup sisi praktis: mendapatkan kunci, memilih wilayah, melakukan panggilan pertama Anda, dan menghubungkan model ke alat Anda.
Satu detail membedakan API ini dari sebagian besar peluncuran model. Qwen 3.8 hadir dengan dua protokol sejak hari pertama: endpoint yang kompatibel dengan OpenAI dan endpoint yang kompatibel dengan Anthropic. Kode OpenAI SDK Anda yang sudah ada berfungsi. Pengaturan Kode Claude Anda juga berfungsi, dengan tiga variabel lingkungan. Desain dual-protokol tersebut juga membuat API ini menyenangkan untuk dicoba di Apidog, di mana Anda dapat meluncurkan prompt yang sama pada kedua bentuk protokol dan melihat bagaimana masing-masing mengalir kembali. Lebih lanjut tentang itu di bawah.
Berikut panduan lengkapnya.
Apa yang Anda Butuhkan Sebelum Memulai
Referensi singkat agar tidak ada yang mengejutkan Anda di bawah ini:
| Item | Nilai |
|---|---|
| ID Model | qwen3.8-max |
| Jendela konteks | 1.000.000 token |
| Output Maks | 65.536 token |
| Tipe input | Teks dan gambar |
| Harga | $2 input / $6 output per 1M token, rata di seluruh konteks penuh |
| Kontrol penalaran | reasoning_effort: xhigh (default), medium, low |
| Protokol | Penyelesaian chat OpenAI + respons, Pesan Anthropic |
| Variabel lingkungan kunci | DASHSCOPE_API_KEY |

Semua ini berasal dari postingan rilis resmi Qwen 3.8 dan dokumen Alibaba Cloud Model Studio. Satu catatan tentang bobot: Alibaba menjanjikan bobot terbuka di Hugging Face dan ModelScope untuk minggu depan, tetapi hingga awal Agustus 2026, bobot tersebut belum dapat diunduh. Semua yang ada dalam panduan ini berjalan melawan API yang di-host.
Langkah 1: Dapatkan kunci API dari QwenCloud
Kunjungi home.qwencloud.com dan masuk atau buat akun. Setelah Anda berada di konsol, buat kunci API. Platform Alibaba masih menggunakan nama DashScope secara internal, jadi konvensi variabel lingkungannya adalah DASHSCOPE_API_KEY:
export DASHSCOPE_API_KEY="sk-your-key-here"
Simpan di profil shell atau file .env Anda, bukan di kode sumber Anda. Setiap cuplikan dalam panduan ini membaca kunci dari variabel tersebut.
Jika Anda ingin menguji model sebelum mengeluarkan uang sungguhan, ada kuota gratis: 1M token, berlaku selama 90 hari, hanya tersedia di wilayah Singapura. Itu sudah cukup untuk uji evaluasi yang serius.
Langkah 2: Pilih URL dasar regional
Model Studio melayani API yang kompatibel dengan OpenAI dari tiga wilayah. Pilih yang terdekat dengan server Anda:
| Wilayah | URL Dasar |
|---|---|
| Beijing | https://dashscope.aliyuncs.com/compatible-mode/v1 |
| Singapura | https://dashscope-intl.aliyuncs.com/compatible-mode/v1 |
| AS (Virginia) | https://dashscope-us.aliyuncs.com/compatible-mode/v1 |
Endpoint Singapura (dashscope-intl) adalah pilihan default bagi sebagian besar pengguna internasional, dan di sinilah kuota gratis berada. Daftar model Model Studio mengonfirmasi bahwa qwen3.8-max tersedia untuk pembuatan teks serta pemahaman gambar dan video, dan menduduki puncak tabel model yang direkomendasikan per pembaruan 3 Agustus.
Contoh di bawah ini menggunakan Singapura. Tukar URL dasar jika Anda lebih dekat ke Beijing atau Virginia.
Langkah 3: Lakukan panggilan pertama Anda
Endpoint ini berbicara dalam format penyelesaian chat OpenAI, sehingga OpenAI Python SDK resmi berfungsi apa adanya. Arahkan ke URL dasar DashScope:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.getenv("DASHSCOPE_API_KEY"),
base_url="https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
)
completion = client.chat.completions.create(
model="qwen3.8-max",
messages=[
{"role": "system", "content": "You are a precise technical assistant."},
{"role": "user", "content": "Explain idempotency in REST APIs in two sentences."},
],
)
print(completion.choices[0].message.content)
Panggilan yang sama di cURL:
curl https://dashscope-intl.aliyuncs.com/compatible-mode/v1/chat/completions \
-H "Authorization: Bearer $DASHSCOPE_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3.8-max",
"messages": [
{"role": "user", "content": "Explain idempotency in REST APIs in two sentences."}
]
}'
Jika Anda pernah menggunakan penyedia yang kompatibel dengan OpenAI sebelumnya, tidak ada yang baru di sini. Itulah intinya. Migrasi dari model lain adalah penggantian URL dasar dan perubahan ID model. Jika Anda berasal dari generasi sebelumnya, alur kerjanya identik dengan yang ada di panduan API Qwen 3.7 Plus kami, hanya dengan ID model baru dan angka yang lebih baik di baliknya.
Langkah 4: Streaming respons dan membaca penalaran
Qwen 3.8-Max adalah model penalaran, dan ia berpikir secara default. Dalam mode streaming, pemikiran tiba sebagai delta reasoning_content sebelum jawaban akhir tiba sebagai delta content biasa. Tangani keduanya:
stream = client.chat.completions.create(
model="qwen3.8-max",
messages=[
{"role": "user", "content": "Design a rate limiting strategy for a public API."}
],
stream=True,
)
thinking_done = False
for chunk in stream:
delta = chunk.choices[0].delta
reasoning = getattr(delta, "reasoning_content", None)
if reasoning:
print(reasoning, end="", flush=True)
elif delta.content:
if not thinking_done:
print("\n--- answer ---")
thinking_done = True
print(delta.content, end="", flush=True)
Dua hal yang perlu diketahui tentang aliran pemikiran. Pertama, token pemikiran ditagih sebagai token output dengan tarif yang sama seperti yang lainnya, jadi rantai penalaran yang panjang akan muncul di tagihan Anda. Kedua, pada tingkat upaya default, model ini berpikir keras, yang sangat baik untuk kebenaran dan lambat untuk UI chat. Itu membawa kita ke kontrol.
Langkah 5: Sesuaikan reasoning_effort dan flag pemikiran
API ini mengekspos tiga tingkat resmi reasoning_effort: xhigh (default), medium, dan low. Upaya yang lebih tinggi berarti lebih banyak token pemikiran, hasil yang lebih baik pada masalah yang sulit, dan latensi serta biaya yang lebih tinggi. Upaya yang lebih rendah adalah pilihan yang tepat untuk klasifikasi, ekstraksi, dan chat sederhana.
Dua flag terkait mengontrol perilaku pemikiran itu sendiri: enable_thinking mengaktifkan atau menonaktifkan proses penalaran, dan preserve_thinking (aktif secara default) mempertahankan konteks penalaran di seluruh giliran. Teruskan melalui extra_body saat Anda menggunakan OpenAI SDK, karena ini adalah ekstensi DashScope:
completion = client.chat.completions.create(
model="qwen3.8-max",
messages=[{"role": "user", "content": "Classify this ticket: 'Login page 500s on Safari.'"}],
extra_body={
"reasoning_effort": "low",
"enable_thinking": True,
},
)
Penagihan identik apakah pemikiran diaktifkan atau dinonaktifkan, per token. Tuas yang mengubah biaya Anda adalah berapa banyak token pemikiran yang dihasilkan model, yang dikontrol langsung oleh reasoning_effort. Default yang masuk akal: xhigh untuk pengkodean dan analisis agen, low untuk endpoint produksi volume tinggi, medium ketika Anda tidak yakin. Benchmark beban kerja Anda sendiri daripada mempercayai default siapa pun, termasuk Alibaba.
Endpoint yang Kompatibel dengan Anthropic
Ini adalah bagian yang tidak biasa. Di samping API yang kompatibel dengan OpenAI, Qwen 3.8 mengirimkan endpoint protokol Anthropic:
https://dashscope-intl.aliyuncs.com/apps/anthropic
Ini berbicara dalam format Pesan Anthropic, yang berarti alat apa pun yang dibuat untuk API Claude dapat berbicara dengan Qwen 3.8-Max tanpa perubahan kode. Kasus penggunaan utamanya adalah Claude Code. Alibaba menerbitkan konfigurasi resmi, dan itu adalah tiga variabel lingkungan:
export ANTHROPIC_BASE_URL=https://dashscope-intl.aliyuncs.com/apps/anthropic
export ANTHROPIC_AUTH_TOKEN=$DASHSCOPE_API_KEY
export ANTHROPIC_MODEL=qwen3.8-max
Luncurkan claude setelah mengatur itu, dan Claude Code menjalankan siklus agen penuhnya terhadap Qwen 3.8-Max. Ada detail yang perlu diperhatikan di sini: Alibaba menjalankan sebagian besar benchmark pengkodean mereka sendiri dengan Claude Code harness. Endpoint Anthropic bukanlah kompatibilitas yang terlewatkan; itu adalah konfigurasi yang digunakan vendor itu sendiri untuk menghasilkan angka pengkodean. Jika pengkodean agen adalah kasus penggunaan Anda, analisis Qwen 3.8 untuk pengkodean kami menjelaskan baris benchmark tersebut dan harness lain yang didukung (Codex, Qoder, Qwen Code, dan OpenClaw semuanya juga memiliki konfigurasi resmi).
Mengapa protokol ganda penting di luar Claude Code? Karena tim Anda mungkin memiliki kode dan peralatan yang terbagi di kedua ekosistem. Satu API yang menjawab kedua format berarti Anda dapat menguji migrasi ke salah satu arah tanpa menulis ulang klien terlebih dahulu.
Berapa Biayanya
Singkatnya: $2 per juta token input, $6 per juta token output, satu tingkatan datar dari 0 hingga 1M konteks. Tidak ada biaya tambahan konteks panjang, yang jarang terjadi di antara model konteks 1M. Caching konteks memotong input berulang menjadi 10% dari harga input pada cache hits, dengan pembuatan cache eksplisit ditagih 125%. Halaman harga resmi memiliki angka saat ini.

Sebagai perbandingan, harga peluncuran itu lebih rendah dari harga daftar Qwen 3.7-Max sebesar $2.5/$7.5. Namun, ingat catatan penagihan dari bagian streaming: token pemikiran dihitung sebagai output, dan tingkat upaya default adalah xhigh, jadi tagihan riil akan lebih tinggi dari perhitungan stiker yang naif. Untuk contoh biaya yang diuraikan dan cetak biru kuota gratis, lihat rincian harga Qwen 3.8 lengkap.
Uji dan Debug API Qwen 3.8 di Apidog
API penalaran streaming dengan dual-protokol dan tiga wilayah adalah jenis permukaan yang tepat di mana sebuah workbench API yang sesuai akan sangat bermanfaat. Berikut adalah pengaturan praktis di Apidog:

Impor spesifikasi yang kompatibel dengan OpenAI. Buat proyek dan tambahkan endpoint penyelesaian chat (POST /chat/completions) dengan skema badan permintaan. Karena API mengikuti format OpenAI, Anda dapat mengimpor spesifikasi OpenAI yang sudah ada dan tidak mengubah apa pun kecuali URL server. Tambahkan endpoint Pesan Anthropic sebagai API kedua di proyek yang sama agar kedua bentuk protokol berada berdampingan.
Modelkan wilayah sebagai lingkungan. Buat tiga lingkungan Apidog (Beijing, Singapura, AS-Virginia), masing-masing dengan variabel base_url yang diatur ke URL mode kompatibel yang cocok dan rahasia DASHSCOPE_API_KEY bersama. Mengganti wilayah menjadi klik dropdown daripada mengedit setiap permintaan. Ini juga merupakan cara yang bersih untuk memeriksa latensi dari lokasi Anda terhadap setiap wilayah sebelum Anda menerapkan satu ke produksi.
Periksa aliran SSE. Kirim permintaan dengan "stream": true dan lihat peristiwa server-sent mentah di tampilan respons. Anda akan melihat delta reasoning_content tiba lebih dulu, lalu delta content. Ketika parser streaming Anda bermasalah dalam produksi, membandingkan outputnya dengan urutan peristiwa mentah di Apidog adalah cara tercepat untuk mengetahui apakah bug itu milik Anda atau penyedia.
Bandingkan model secara berdampingan. Duplikat permintaan, ubah ID model menjadi qwen3.7-max, dan jalankan keduanya terhadap prompt yang sama. Trik yang sama berfungsi di seluruh penyedia: simpan permintaan Kimi K3 API di proyek yang sama dan lakukan A/B dua flagship open-weight pada beban kerja aktual Anda, dengan waktu respons dan jumlah token dicatat untuk setiap eksekusi. Tabel benchmark vendor adalah titik awal; prompt Anda sendiri adalah ujian sesungguhnya.
Unduh Apidog secara gratis untuk mengikuti; seluruh penyiapan di atas membutuhkan waktu sekitar sepuluh menit.
FAQ
Apakah ada cara gratis untuk mencoba API Qwen 3.8? Ya. Akun Model Studio baru mendapatkan kuota gratis 1M token untuk qwen3.8-max, berlaku selama 90 hari, hanya di wilayah Singapura. Itu adalah keseluruhan penawaran, jadi arahkan lalu lintas evaluasi Anda melalui dashscope-intl untuk menggunakannya.
Bisakah saya menjalankan Qwen 3.8 secara lokal alih-alih menggunakan API? Belum. Alibaba menjanjikan bobot terbuka di Hugging Face dan ModelScope untuk minggu depan, tetapi hingga awal Agustus 2026, bobot tersebut belum dapat diunduh. Dan dengan total parameter 2.4T, self-hosting akan menjadi proyek multi-node bahkan jika terkuantisasi. Untuk saat ini, API yang di-host adalah satu-satunya cara untuk menjalankan model.
Apakah endpoint Anthropic mendukung fitur yang sama dengan endpoint OpenAI? Endpoint Anthropic berbicara protokol Pesan Anthropic dan ada terutama untuk mendukung alat dari ekosistem tersebut, dengan Claude Code sebagai integrasi yang didokumentasikan secara resmi. Untuk kode aplikasi langsung, endpoint yang kompatibel dengan OpenAI adalah jalur yang lebih terdokumentasi, dengan reasoning_effort, enable_thinking, dan streaming reasoning_content semuanya telah dibahas di atas.
Bagaimana qwen3.8-max dibandingkan dengan Qwen3-Coder untuk pekerjaan pengkodean? Keduanya adalah alat yang berbeda. Qwen3-Coder adalah lini model pengkodean khusus; qwen3.8-max adalah flagship umum yang kebetulan mencatat angka pengkodean agen yang kuat pada tabel Alibaba sendiri (86.6 pada Terminal Bench 2.1, per benchmark yang dijalankan vendor). Jika Anda memilih di antara keduanya, uji keduanya melalui antarmuka API yang sama: panggilannya identik kecuali untuk ID model.
Kesimpulan
API Qwen 3.8 adalah salah satu peluncuran flagship yang lebih mudah untuk diadopsi. Kode OpenAI SDK Anda berfungsi setelah penggantian URL dasar, pengaturan Claude Code Anda berfungsi setelah tiga variabel lingkungan, dan harga datar $2/$6 berarti Anda tidak memerlukan spreadsheet untuk memprediksi biaya di seluruh konteks 1M. Hal utama yang perlu diperhatikan: token pemikiran ditagih sebagai output pada upaya default xhigh, dan pembagian regional pada kuota gratis.
Mulailah dengan kuota gratis Singapura, streaming beberapa permintaan untuk melihat bagaimana perilaku delta penalaran, dan masukkan prompt Anda sendiri sebelum mempercayai tabel benchmark mana pun, termasuk milik Alibaba. Menyiapkan semuanya sebagai proyek di Apidog, dengan wilayah sebagai lingkungan dan kedua protokol sebagai permintaan yang disimpan, mengubah evaluasi tersebut dari sore cURL ad-hoc menjadi sesuatu yang dapat dijalankan kembali oleh seluruh tim Anda saat model berikutnya dirilis.
