Penjelasan Harga Qwen 3.8: $2 Masukan / $6 Keluaran untuk Konteks 1 Juta

Harga Qwen 3.8 saat ketersediaan umum: $2 masukan / $6 keluaran per 1 juta token, tarif tetap di seluruh konteks 1 juta. Diskon cache, detail kuota gratis, dan perhitungan biaya terperinci.

INEZA Felin-Michel

INEZA Felin-Michel

3 August 2026

Penjelasan Harga Qwen 3.8: $2 Masukan / $6 Keluaran untuk Konteks 1 Juta

Apidog untuk Perusahaan

Penerapan On-Premises

SSO & RBAC

Sesuai SOC 2

Jelajahi Apidog Enterprise

Alibaba merilis Qwen 3.8-Max pada awal Agustus 2026, dan pertanyaan mengenai harga akhirnya memiliki jawaban yang nyata. Selama jendela pratinjau Juli, cerita yang beredar adalah promosi "harga pratinjau 10%". Kisah itu sudah berakhir. Pada ketersediaan umum, halaman harga resmi Model Studio mencantumkan qwen3.8-max seharga $2 per 1 juta token masukan dan $6 per 1 juta token keluaran, satu tingkatan datar yang mencakup seluruh jendela konteks 1 juta token.

Tingkatan harga datar itulah bagian yang menarik. Kebanyakan model mutakhir mengenakan biaya lebih per token setelah prompt Anda melampaui ambang batas konteks. Qwen 3.8-Max tidak demikian: kirim 5.000 token atau 900.000, tarifnya tetap $2/$6.

Artikel ini mencakup gambaran lengkap: desain tingkatan datar, perbandingan dengan Qwen 3.7-Max, Kimi K3, Claude Opus 5, dan GPT-5.6 Terra, diskon caching, detail kuota gratis, dan contoh biaya yang dikerjakan dengan perhitungan nyata. Untuk gambaran model yang lebih luas, mulailah dengan apa itu Qwen 3.8 dan mengapa itu penting, lalu kembali untuk melihat angka-angkanya.

Satu catatan terlebih dahulu: harga yang tertera hanya memberi Anda perkiraan. Qwen 3.8-Max secara default menggunakan penalaran dengan upaya xhigh, dan token pemikiran ditagih sebagai keluaran. Cara yang andal untuk memperkirakan biaya adalah dengan mengirim permintaan nyata dan mengukur penggunaan token. Apidog menunjukkan rincian token lengkap dari setiap respons saat Anda menguji, yang mengubah perkiraan biaya menjadi perhitungan aritmatika. Lebih lanjut tentang itu di bawah.

Angka GA: $2 masukan, $6 keluaran, satu tingkatan

Berikut adalah daftar harga resmi untuk qwen3.8-max, yang diverifikasi terhadap halaman harga Model Studio per 3 Agustus 2026:

Item Harga (per 1 Juta token)
Masukan $2.00
Keluaran (termasuk token pemikiran) $6.00
Masukan cache (cache hit) 10% dari tarif masukan
Pembuatan cache eksplisit 125% dari tarif masukan
Tingkatan konteks Satu tingkatan, 0 hingga 1 Juta token
Pemikiran vs non-pemikiran Ditagih sama

Tiga detail yang patut diperhatikan: jendela konteks 1 juta token sepenuhnya ditanggung oleh satu harga, tanpa biaya tambahan untuk prompt panjang. Mode pemikiran dan non-pemikiran memiliki tarif yang sama, meskipun token pemikiran dihitung sebagai keluaran (lihat bagian kejujuran di bawah). Dan keluaran maksimal adalah 65.536 token per permintaan, jadi satu respons paling banyak ditagih sekitar $0.39 dalam keluaran.

Pengumuman resmi Qwen 3.8 menempatkan model ini sebagai yang paling mumpuni dari Alibaba: total 2,4T parameter dengan 95B aktif, jendela konteks 1 juta token, masukan multimodal. Mendapatkan itu dengan harga $2/$6 mengalahkan sebagian besar model mutakhir, termasuk flagship Alibaba sebelumnya.

Mengapa harga datar untuk 1 juta token itu tidak biasa

Harga konteks bertingkat adalah norma industri: satu tarif di bawah ambang batas konteks, tarif yang lebih tinggi di atasnya, karena konteks yang panjang lebih mahal untuk dilayani.

Alibaba sendiri melakukan ini. Di halaman harga Model Studio yang sama, model seperti qwen3-max dan qwen3-coder-plus diberi harga dalam tingkatan panjang konteks, dengan tarif per token meningkat seiring bertambahnya masukan. Qwen 3.8-Max menyimpang dari pola itu dalam katalog Alibaba sendiri: tabel harganya menunjukkan satu baris, “0<Token≤1M”, dan hanya itu.

Mengapa ini penting: dengan harga bertingkat, beban kerja konteks panjang membawa pengganda tersembunyi. Sebuah pipeline RAG yang sesekali memasukkan dokumen 300 ribu token ke dalam prompt dapat menghabiskan biaya beberapa kali lipat dari tarif biasanya untuk permintaan tersebut. Dengan Qwen 3.8-Max, token marjinal selalu berharga sama, sehingga penganggaran bersifat linier: token dikalikan tarif, selesai. Untuk analisis dokumen panjang, agen basis kode besar, atau pipeline pengambilan data yang berat, prediktabilitas itu sama berharganya dengan tarif rendah itu sendiri.

Lebih murah dari Qwen 3.7-Max pada harga daftar

Itu adalah pemotongan 20% di kedua sisi sementara model memperoleh jendela konteks yang lebih besar, masukan multimodal, dan skor benchmark yang lebih baik.

Satu komplikasi: Qwen 3.7-Max saat ini sedang menjalankan promosi 50%, yang menurunkannya menjadi $1.25/$3.75. Pada tarif promosi, flagship yang lebih lama lebih murah dari yang baru. Jika beban kerja Anda tidak memerlukan konteks 1 juta token Qwen 3.8 atau keuntungan multimodal dan agennya, 3.7-Max yang didiskon adalah pilihan nilai yang sah selama promosi berlangsung; namun jangan menyusun model biaya Anda berdasarkan promosi. Lebih jauh ke bawah, Qwen 3.7-Plus tetap menjadi pekerja keras anggaran pada $0.4/$1.6, dengan promosinya sendiri sebesar 20%.

Bagian kejujuran: token pemikiran ditagih sebagai keluaran

Ini adalah bagian yang dilewati sebagian besar tulisan mengenai harga, dan bagian yang paling mungkin mengejutkan Anda pada tagihan.

Qwen 3.8-Max mendukung parameter reasoning_effort dengan tiga tingkatan: xhigh, medium, dan low. Defaultnya adalah xhigh, pengaturan yang paling agresif. Dalam mode pemikiran, model menghasilkan token penalaran internal sebelum jawaban akhirnya, dan token penalaran tersebut ditagih dengan tarif keluaran $6, sama seperti teks yang terlihat.

Konsekuensinya: pada pengaturan default, permintaan yang membutuhkan penalaran berat berbiaya lebih mahal daripada perkiraan "token prompt ditambah token jawaban" yang naif. Sebuah respons yang menunjukkan 800 token jawaban yang terlihat mungkin telah mengonsumsi beberapa ribu token pemikiran untuk masalah yang sulit.

Tiga mitigasi: turunkan reasoning_effort ke medium atau low untuk tugas yang tidak memerlukan penalaran mendalam (klasifikasi, ekstraksi, pemformatan); ukur penggunaan aktual per jenis tugas sebelum memproyeksikan pengeluaran bulanan, karena objek usage di setiap respons melaporkan jumlah sebenarnya termasuk penalaran; dan perhatikan token keluaran secara khusus, karena biaya keluaran di sini 3x masukan dan pemikiran menggelembungkan keluaran.

Caching konteks: 10% hit, 125% pembuatan

Jika aplikasi Anda mengirim ulang awalan prompt yang sama berulang kali (prompt sistem yang panjang, dokumen yang stabil, definisi alat), caching konteks mengubah ekonomi secara signifikan:

Perhitungan titik impasnya sederhana. Pembuatan berbiaya ekstra 25% sekali; setiap hit berikutnya menghemat 90%. Jika awalan digunakan kembali bahkan dua kali, caching sudah membayar sendiri. Untuk agen frekuensi tinggi atau aplikasi obrolan dengan prompt sistem yang berat, penghematan bertambah cepat (contoh yang dikerjakan di bawah).

Rincian kuota gratis: 1 juta token, Singapura, 90 hari

Model Studio menawarkan kuota gratis untuk qwen3.8-max, dan rinciannya penting:

Token pemikiran diambil dari kuota ini seperti keluaran lainnya, jadi beberapa lusin tugas penalaran sulit pada xhigh dapat menguras 1 juta token lebih cepat dari yang Anda kira. Jika akses gratis adalah tujuan utama Anda, kami telah mengumpulkan setiap jalur tanpa biaya, termasuk Qwen Chat, di cara menggunakan Qwen 3.8 secara gratis.

Bagaimana perbandingan harga Qwen 3.8

Berikut adalah gambaran saat ini, menggunakan harga daftar per 1 juta token. Tarif promosi ditandai, karena promo akan kedaluwarsa.

Model Masukan Keluaran Catatan
Qwen 3.8-Max $2.00 $6.00 Datar di seluruh konteks 1 Juta; cache hit 10%
Qwen 3.7-Max $2.50 $7.50 Saat ini diskon 50%: $1.25/$3.75 (promo)
Qwen 3.7-Plus $0.40 $1.60 Saat ini diskon 20% (promo)
Kimi K3 $3.00 $15.00 Cache hit $0.30
Claude Opus 5 $5.00 $25.00
GPT-5.6 Terra $2.00 $12.00

Membaca tabel:

Harga bukanlah kualitas, dan tabel benchmark vendor adalah tabel benchmark vendor. Namun pada tingkat daftar harga murni, Qwen 3.8-Max adalah flagship kelas mutakhir termurah dalam daftar ini.

Contoh yang dikerjakan: berapa biaya tugas nyata

Harga yang tertera tidak berarti banyak tanpa perhitungan yang sesuai dengan tugas. Tiga skenario, dihitung pada $2/$6:

Contoh 1: sesi agen 50K token

Sebuah agen berjalan mengonsumsi 38.000 token masukan (instruksi, skema alat, hasil alat) dan menghasilkan 12.000 token keluaran:

Sekarang tambahkan penalaran xhigh default. Misalkan model menghabiskan 8.000 token pemikiran selama proses berjalan. Keluaran menjadi 20.000 token: 20.000 × $6 / 1.000.000 = $0.12, dan total sesi sekitar $0.20. Itu adalah peningkatan 33% hanya dari penalaran, itulah mengapa Anda harus mengukur sebelum menganggarkan.

Contoh 2: analisis dokumen panjang pada 800 ribu token

Anda memuat 800.000 token dokumen ke dalam konteks dan meminta ringkasan terstruktur 5.000 token:

Tingkatan harga datar sedang melakukan tugasnya di sini. Setiap 800 ribu token itu berharga sama $2/1 juta dengan seribu token pertama. Pada model bertingkat, inilah bentuk permintaan yang memicu tingkatan harga yang mahal.

Contoh 3: prompt sistem 100K token yang di-cache, 50 panggilan per hari

Aplikasi Anda memuat di muka 100.000 token prompt sistem, dokumen produk, dan definisi alat pada setiap panggilan, 50 kali sehari.

Tanpa caching: 100.000 × $2 / 1.000.000 = $0.20 per panggilan, jadi $10.00 per hari hanya untuk awalan.

Dengan caching eksplisit: biaya pembuatan 100.000 × $2.50 / 1.000.000 = $0.25 sekali, lalu 49 cache hit pada 100.000 × $0.20 / 1.000.000 = $0.02 masing-masing, atau $0.98. Total harian: sekitar $1.23, penghematan 88%. Selama sebulan, itu kira-kira $300 versus di bawah $40.

Perkirakan biaya dari penggunaan terukur, bukan perkiraan

Ketiga contoh tersebut didasarkan pada jumlah token yang diasumsikan. Angka riil Anda akan berbeda, dan dengan token penalaran yang berperan, perbedaannya akan tidak dapat Anda prediksi hanya dari panjang prompt. Solusinya adalah dengan mengukur.

Alur kerja praktis: dapatkan kunci API Anda, atur endpoint (panduan API Qwen 3.8 mencakup ketiga URL dasar regional dan protokol yang kompatibel dengan OpenAI serta Anthropic), dan kirim permintaan representatif untuk setiap jenis tugas di aplikasi Anda. Setiap respons mengembalikan objek usage dengan jumlah token masukan, keluaran, dan penalaran yang tepat.

Di Apidog, simpan tiga URL dasar regional sebagai lingkungan, kirim permintaan yang sama pada setiap level reasoning_effort, dan baca penggunaan token langsung dari pemeriksa respons. Jalankan sepuluh permintaan representatif per jenis tugas, rata-ratakan jumlahnya, kalikan dengan $2/$6, dan Anda memiliki model biaya yang dibangun di atas data terukur. Anda juga dapat melakukan A/B testing prompt yang sama terhadap qwen3.7-max atau Kimi K3 di ruang kerja yang sama untuk melihat apakah model yang lebih murah sesuai dengan beban kerja Anda. Unduh Apidog secara gratis dan Anda bisa mendapatkan angka biaya per tugas yang nyata dalam waktu satu jam.

Intinya

Qwen 3.8-Max pada harga $2/$6 adalah harga agresif untuk flagship kelas mutakhir: di bawah harga daftar pendahulunya, setengah dari tarif keluaran GPT-5.6 Terra, sebagian kecil dari Opus 5, dan datar di seluruh konteks 1 juta token di mana sebagian besar pasar memiliki tingkatan harga. Tambahkan 10% cache hit dan ekonomi untuk beban kerja konteks panjang, pengulangan tinggi terlihat sangat kuat.

Dua peringatan: penalaran xhigh default menggelembungkan tagihan keluaran di atas perkiraan naif, dan penawaran di sekitarnya (3.7-Max diskon 50%, kuota gratis Singapura) bersifat terbatas waktu. Ukur penggunaan token riil Anda, atur reasoning_effort secara sengaja, dan daftar harga akan menyimpan sedikit kejutan.

button

Pertanyaan yang sering diajukan

Apakah Qwen 3.8 berbiaya lebih mahal untuk prompt panjang?

Tidak. Harga resmi mencantumkan satu tingkatan yang mencakup 0 hingga 1 juta token, jadi prompt 900 ribu token ditagih dengan tarif masukan $2 per 1 juta yang sama dengan prompt pendek. Ini berbeda dari model bertingkat, termasuk beberapa dalam katalog Alibaba sendiri di daftar model Model Studio, di mana tarif meningkat seiring panjang konteks.

Apakah token pemikiran berbiaya tambahan pada Qwen 3.8?

Tidak ada tarif pemikiran terpisah: mode pemikiran dan non-pemikiran ditagih dengan tarif $2/$6 yang sama. Namun token pemikiran dihitung sebagai token keluaran seharga $6 per 1 juta, dan reasoning_effort secara default adalah xhigh. Oleh karena itu, permintaan yang membutuhkan penalaran berat berbiaya lebih mahal daripada yang disarankan oleh jawaban yang terlihat. Turunkan tingkat upaya untuk tugas-tugas sederhana, dan periksa objek usage di setiap respons untuk melihat apa yang sebenarnya Anda bayar.

Apakah ada cara gratis untuk mencoba Qwen 3.8?

Ya. Model Studio menyertakan kuota gratis 1 juta token, berlaku selama 90 hari, hanya pada endpoint wilayah Singapura. Qwen Chat juga menawarkan akses tanpa biaya di browser. Kedua jalur ini, beserta rinciannya, dibahas dalam cara menggunakan Qwen 3.8 secara gratis.

Apakah "harga pratinjau 10%" yang lama masih tersedia?

Tidak. Itu adalah promosi era pratinjau yang dilaporkan dalam liputan pers Juli 2026; ketersediaan umum menggantinya dengan daftar harga standar $2/$6. Anggap halaman harga Model Studio sebagai sumber kebenaran.

Mengembangkan API dengan Apidog

Apidog adalah alat pengembangan API yang membantu Anda mengembangkan API dengan lebih mudah dan efisien.