Tiga API terdepan diluncurkan atau harganya disesuaikan dalam rentang waktu seminggu satu sama lain, dan ketiganya berada dalam tiga kategori harga yang berbeda. Google merilis Gemini 3.8 Flash pada 2 September 2026 dengan harga $0.75 per juta token masukan dan $3.75 per juta token keluaran. Anthropic merilis Claude Fable 5.1 sehari sebelumnya dengan harga $10 dan $50. GPT-5.6 Sol dari OpenAI berada di antara keduanya dengan harga $5 dan $30. Pada Indeks Kecerdasan independen Artificial Analysis, ketiganya mencetak skor 59, 57, dan 59. Itulah seluruh perbandingan dalam satu kalimat: sebuah model dengan harga sekitar sepertiga belas dari tingkatan teratas mendapatkan skor yang setara di satu indeks yang menguji ketiganya dengan cara yang sama.
Kuncinya terletak pada kata "indeks". Tolok ukur menghitung jawaban per tugas. Tagihan Anda menghitung token per tugas, dan Gemini 3.8 Flash dibangun untuk menghabiskan lebih banyak token. Panduan ini membandingkan ketiganya berdasarkan spesifikasi, tabel tolok ukur Google sendiri (di mana Fable 5.1 tidak ada, dan kami jelaskan alasannya), angka independen Artificial Analysis, dan perhitungan harganya. Kemudian, panduan ini memberikan aturan sederhana tentang API mana yang cocok untuk beban kerja mana. Pilar Gemini 3.8 Flash mencakup model tersebut dengan caranya sendiri, dan pos peluncuran Google adalah sumber utama untuk setiap klaim Google di bawah ini.
Satu catatan tentang waktu. Perbandingan Gemini 3.7 Flash vs Claude vs GPT kami dari bulan Agustus membandingkan dengan Claude Fable 5, bukan 5.1. Anthropic mengganti model itu pada 1 September, jadi ini adalah pasangan baru, bukan penyegaran.
Spesifikasi Sekilas
| Gemini 3.8 Flash | Claude Fable 5.1 | GPT-5.6 Sol | |
|---|---|---|---|
| Vendor | Anthropic | OpenAI | |
| Jendela konteks | 1,048,576 token | 1M token | 1M token |
| Keluaran maksimal | 65,536 token | 128K token | 128K token |
| Harga masukan (per 1M) | $0.75 perkenalan, $1.50 mulai 1 Januari 2027 | $10 | $5 |
| Harga keluaran (per 1M) | $3.75 perkenalan, $7.50 mulai 1 Januari 2027 | $50 | $30 |
| Baca cache (per 1M) | $0.075 perkenalan, $0.15 mulai 1 Januari | $0.25 | $0.50 |
| Batasan pengetahuan | Maret 2026 | Juni 2026 | Tidak tercantum di sini |
| Kontrol penalaran | thinking_level rendah / sedang / tinggi (sedang adalah standar) |
Pemikiran diperluas, selalu aktif | Tingkat upaya hingga xhigh |
| Indeks Artificial Analysis | 59 (tinggi) | 57 (sedang) | 59 (sangat tinggi) |
Dua hal menonjol sebelum tolok ukur apa pun. Gemini 3.8 Flash memiliki setengah keluaran maksimum dari dua model lainnya, 65.536 token dibandingkan 128K, yang lebih penting untuk dokumen panjang sekali jalan daripada untuk loop agen yang mengeluarkan langkah-langkah pendek. Dan harga perkenalannya berakhir pada 31 Desember 2026: mulai 1 Januari, kedua tarif Gemini berlipat ganda, yang mengubah setiap rasio dalam artikel ini. Panduan harga Gemini 3.8 Flash membahas secara lengkap tentang penggandaan, caching, batch, dan tarif grounding.
Angka independen: 59, 57, 59
Artificial Analysis menjalankan sembilan evaluasi yang sama terhadap setiap model dan menerbitkan satu skor Indeks Kecerdasan. Gemini 3.8 Flash pada tingkat pemikiran tinggi mencetak skor 59, naik dari 56 untuk 3.7 Flash dan 52 untuk 3.6 Flash. GPT-5.6 Sol pada upaya xhigh juga mencetak skor 59. Claude Fable 5.1 pada upaya sedang mencetak skor 57, setara dengan GPT-5.6 Terra pada maksimal dan Muse Spark 1.2 pada xhigh. Grok 4.6 pada sedang adalah model lain dengan skor 59.
Baca label tingkat penalaran sebelum membaca angkanya. Fable 5.1 diuji pada sedang, bukan pengaturan tertingginya, dan Sol pada xhigh, pengaturan tertingginya. Selisih dua poin pada tingkat upaya yang berbeda bukanlah peringkat, dan Artificial Analysis mencantumkannya dengan cara itu karena suatu alasan. Pernyataan yang dapat dipertahankan lebih sempit: pada pengaturan yang diuji, Gemini 3.8 Flash setara dengan dua model premium pada indeks ini, dan itu adalah model termurah dengan skor 59 dengan selisih yang lebar.
Artikel yang sama mengukur berapa biaya skor tersebut. Gemini 3.8 Flash pada tingkat tinggi menggunakan rata-rata 48.000 token keluaran per tugas, 30 persen lebih banyak dari 3.7 Flash, dan $0.58 per tugas dalam pengeluaran API. Waktu per tugas adalah 2.5 menit, kecepatan keluaran sekitar 300 token per detik, dan waktu hingga token pertama 13.3 detik pada eksekusi penalaran tinggi karena model berpikir sebelum menulis. Pada τ³-Banking, evaluasi penggunaan alat, ia mencetak 45 persen, 12 poin di atas 3.7 Flash. Ingatlah angka-angka itu ketika harga per token terlihat terlalu bagus.
Tabel tolok ukur Google, dan siapa yang hilang
Halaman Flash Google menerbitkan tiga baris lintas vendor dalam bentuk teks. Claude Fable 5.1 tidak ada di dalamnya. Tabel Google menampilkan Opus 5 dan Sonnet 5 dari Anthropic sebagai gantinya, dan Fable 5.1 telah tersedia untuk umum selama satu hari saat tabel tersebut dimuat. Jadi kolom Anthropic di bawah adalah Opus 5 ($5 / $25) dan Sonnet 5 ($2 / $10), bukan model $10 / $50 yang dibahas dalam artikel ini. Perlakukan ini sebagai proxy terbaik yang tersedia, bukan kecocokan langsung.
| Tolok Ukur (Dijalankan Google) | Gemini 3.8 Flash | Claude Opus 5 | Claude Sonnet 5 | GPT-5.6 Sol | GPT-5.6 Terra |
|---|---|---|---|---|---|
| HLE-Verified | 54.9% | 54.4% | 31.0% | 54.5% | 51.1% |
| Vals Finance Agent v2 | 61.4% | 58.6% | 53.9% | 53.8% | 54.4% |
| Harvey Legal Agent Benchmark | 10.0% | 6.7% | 5.0% | 2.5% | 0.8% |
HLE-Verified adalah seri tiga arah: 54.9, 54.4, dan 54.5 berada dalam jarak setengah poin satu sama lain, dengan Sonnet 5 jauh tertinggal. Vals Finance Agent v2 adalah tempat 3.8 Flash memisahkan diri, 2.8 poin di atas Opus 5 dan 7.6 di atas Sol pada tugas keuangan agen multi-langkah. Harvey Legal adalah pengecualian: setiap model mencetak skor di bawah 11 persen, sehingga urutan lebih berbicara daripada selisihnya.
Apa yang tidak diterbitkan Google dalam bentuk teks juga sama pentingnya. Tidak ada angka SWE-Bench Pro, Terminal-bench, atau OSWorld untuk 3.8 Flash, dan hasil DeepSWE v1.1 hanya muncul sebagai klaim bahwa model tersebut "mengungguli sebagian besar model terdepan yang lebih besar" dengan "sebagian kecil dari biaya", dengan angka dalam tabel gambar, bukan dalam teks. Untuk perbandingan penggunaan kode dan komputer, Anda harus melihat pengujian masing-masing vendor, yang tidak saling tumpang tindih. Hasil Anthropic ada di uraian tolok ukur Claude Fable 5.1; hasil OpenAI ada di tolok ukur GPT-5.6 Sol. Tidak ada vendor yang menjalankan model vendor lain, jadi Artificial Analysis tetap menjadi satu-satunya sumber perbandingan yang setara.
Selisih harga, baris per baris
Pada tarif perkenalan, perhitungannya lugas. Masukan $10 Fable 5.1 adalah 13.3x dari $0.75 Gemini 3.8 Flash, dan keluarannya $50 adalah 13.3x dari $3.75. Masukan $5 GPT-5.6 Sol adalah 6.7x, dan keluarannya $30 adalah 8x. Pembacaan cache mempersempit selisih: $0.075 pada 3.8 Flash, $0.25 pada Fable 5.1 (3.3x), dan $0.50 pada Sol (6.7x). Pembacaan cache Fable 5.1 adalah setengah dari Sol, yang merupakan satu-satunya poin di mana model termahal bukanlah yang termahal.
Contoh yang dikerjakan membuatnya konkret. Ambil satu eksekusi yang mengonsumsi 1 juta token masukan dan 200.000 token keluaran, semuanya tanpa cache.
- Gemini 3.8 Flash: $0.75 + $0.75 = $1.50
- GPT-5.6 Sol: $5.00 + $6.00 = $11.00
- Claude Fable 5.1: $10.00 + $10.00 = $20.00
Mulai 1 Januari 2027, eksekusi Gemini yang sama berharga $3.00, dan selisihnya menyusut menjadi 3.7x untuk Sol dan 6.7x untuk Fable 5.1. Penggandaan ini juga berlaku untuk 3.6 Flash dan 3.7 Flash, jadi tidak ada Gemini Flash yang lebih murah untuk mundur. Halaman harga Anthropic mencantumkan tarif Fable 5.1, dan panduan harga Claude Fable 5.1 serta panduan harga GPT-5.6 kami mencakup tingkatan batch dan cache untuk masing-masing.
Biaya per tugas, bukan per token
Inilah peringatan yang membatalkan versi sederhana dari perhitungan tersebut. Google menyatakan Gemini 3.8 Flash "dapat menggunakan lebih banyak token pada tugas yang lebih panjang dan kompleks, sesuai desainnya". Pada masalah yang sulit, ia mengambil langkah-langkah penalaran yang lebih kecil, memverifikasi pekerjaannya, dan memanggil alat secara iteratif. Artificial Analysis mengukur efeknya: 48.000 token keluaran per tugas pada tingkat tinggi, naik 30 persen dari 3.7 Flash, sehingga biaya untuk menjalankan indeksnya naik dari $0.40 per tugas pada 3.7 Flash menjadi $0.58 pada 3.8 Flash dengan harga per token yang tidak berubah. Pada tingkat sedang biayanya $0.41 per tugas dan pada tingkat rendah $0.24.
Dua konsekuensi mengikuti. Pertama, selisih per token 13.3x bukanlah selisih tagihan 13.3x jika model premium selesai dengan token lebih sedikit atau putaran alat lebih sedikit. Artificial Analysis belum menerbitkan angka per tugas yang setara untuk Fable 5.1 atau Sol dalam teks yang kami miliki, jadi ukurlah pada prompt Anda sendiri sebelum mempercayai salah satu arah pengali. Kedua, pada Gemini, tingkat pemikiran adalah tuas biaya. Menurunkan rute dari tinggi ke rendah mengurangi biaya per tugas lebih dari setengah pada set Artificial Analysis, dan panduan tingkat pemikiran menunjukkan cara mengaturnya per titik akhir. Perbandingan 3.8 Flash vs 3.7 Flash mencakup kasus di mana model yang lebih lama, dengan biaya 31 persen lebih rendah per tugas, masih merupakan pilihan yang lebih baik.
Kapan memilih masing-masing
Pilih Gemini 3.8 Flash untuk volume dan agen dengan biaya rendah
Jika Anda menjalankan ribuan tugas agen sehari, 3.8 Flash adalah standar. Ini setara dengan model premium pada indeks independen, memimpin baris agen keuangan dan hukum Google, dan biayanya hanya sebagian kecil per token bahkan setelah penggandaan di bulan Januari. Ini juga menerima masukan video, audio, dan PDF secara native, menawarkan Batch dengan diskon 50 persen, menyertakan 5.000 permintaan grounding Google Search gratis setiap bulan, dan memiliki tingkatan gratis untuk prototipe. Kekurangannya: keluaran hanya teks, tidak ada Live API, batas keluaran 65.536 token, dan kebutuhan token yang harus Anda anggarkan pada tingkat sedang atau tinggi.
Pilih Claude Fable 5.1 untuk penalaran horizon panjang yang paling sulit
Fable 5.1 adalah model untuk ditingkatkan, bukan untuk dimulai. Kasusnya adalah pekerjaan di mana jawaban yang salah lebih mahal daripada token: agen penelitian multi-jam, sesi terminal panjang, rantai penalaran di mana evaluasi model yang lebih murah tidak memadai. Keluaran 128K dan pembacaan cache $0.25 cocok untuk loop agen yang banyak menggunakan prefiks yang menggunakan kembali konteks besar yang sama setiap giliran; pada kasus tersebut, baris cache membuat pengali efektif jauh lebih kecil dari 13.3x. Lihat apa itu Claude Fable 5.1 untuk lembar spesifikasi model itu sendiri.
Pilih GPT-5.6 Sol untuk eksekusi agen ekosistem OpenAI
Sol mencetak 59 pada xhigh, setara dengan 3.8 Flash pada HLE-Verified, dan dilengkapi dengan keluaran 128K pada $5 / $30. Jika agen, evaluasi, dan perangkat Anda sudah berada dalam tumpukan OpenAI, Sol adalah tingkatan premium yang tidak memerlukan vendor kedua. Ini memiliki pembacaan cache termahal di antara ketiganya, jadi lebih cocok untuk eksekusi konteks baru daripada sesi cache yang panjang. Perbandingan Grok 4.6 vs GPT-5.6 vs Claude Fable 5 menunjukkan bagaimana Sol bertahan melawan model unggulan Anthropic sebelumnya.
Uji ketiga model dalam satu ruang kerja Apidog
Setiap argumen di atas berakhir dengan cara yang sama: ukur pada prompt Anda sendiri. Apidog adalah klien API dan platform pengujian, jadi tidak menjalankan model-model ini, tetapi ini adalah cara cepat untuk mengirim permintaan yang sama ke ketiga penyedia dan membandingkan hasilnya.
Pengaturannya adalah satu proyek dengan tiga lingkungan. Setiap lingkungan menyimpan URL dasar dan variabel kunci: https://generativelanguage.googleapis.com dengan GEMINI_API_KEY, basis Anthropic dengan kunci Claude Anda, dan basis OpenAI dengan kunci OpenAI Anda. Kunci tetap dalam variabel lingkungan, tidak pernah dalam badan permintaan atau koleksi bersama.
Kemudian bangun satu skenario pengujian dengan tiga langkah permintaan yang membawa prompt yang sama. Langkah Gemini mengirimkan ke /v1beta/interactions dengan "model": "gemini-3.8-flash" dan "thinking_level": "medium"; dua lainnya mengirimkan ke endpoint chat atau pesan penyedia masing-masing. Pada setiap langkah, tambahkan pernyataan yang penting untuk perbandingan: HTTP 200, jalur JSON yang mengonfirmasi bahwa jawaban ada, dan batas atas pada bidang penggunaan token sehingga eksekusi yang tiba-tiba menghabiskan dua kali lebih banyak token berpikir akan gagal dengan jelas. Pada Gemini, bidang tersebut adalah usageMetadata.thoughtsTokenCount untuk endpoint lama; asumsikan pada blok penggunaan yang setara untuk dua lainnya.
Jalankan skenario terhadap serangkaian prompt emas, lalu jadwalkan agar berjalan setiap hari. Ketika vendor mengubah pengaturan default atau model mulai menghabiskan lebih banyak token, pernyataan yang gagal akan memberi tahu Anda sebelum tagihan datang. Panduan pengujian API agen AI mencakup versi multi-putaran dari pola ini, dan penjadwalan pengujian API di Apidog mencakup eksekusi berulang. Unduh Apidog untuk menyiapkan ketiga lingkungan.
FAQ
Apakah Gemini 3.8 Flash lebih baik dari Claude Fable 5.1?
Pada indeks Artificial Analysis, 3.8 Flash pada tingkat tinggi mencetak 59 dan Fable 5.1 pada tingkat sedang mencetak 57, sehingga keduanya dekat pada pengaturan yang diuji. Tabel Google tidak menyertakan Fable 5.1, dan tolok ukur Anthropic tidak menyertakan 3.8 Flash, jadi tidak ada perbandingan langsung yang lebih luas. Per token, Flash 13.3x lebih murah pada tarif perkenalan.
Manakah dari ketiganya yang termurah untuk beban kerja agen?
Gemini 3.8 Flash dengan selisih yang lebar per token, yaitu $0.75 / $3.75 hingga 31 Desember 2026. Per tugas, Artificial Analysis mengukur $0.58 pada tingkat tinggi, $0.41 pada tingkat sedang, dan $0.24 pada tingkat rendah, karena model ini menghabiskan sekitar 30 persen lebih banyak token keluaran daripada 3.7 Flash. Ukur biaya per tugas yang diselesaikan, bukan per token, sebelum berkomitmen.
Apakah ketiganya memiliki jendela konteks 1M?
Ya. Gemini 3.8 Flash menerima 1.048.576 token masukan, dan Fable 5.1 serta GPT-5.6 Sol keduanya mencantumkan 1M. Keluaran maksimal berbeda: 65.536 token pada 3.8 Flash dibandingkan 128K pada dua lainnya.
Mengapa Claude Fable 5.1 tidak ada dalam tabel tolok ukur Google?
Baris yang diterbitkan Google mencantumkan Claude Opus 5 dan Claude Sonnet 5 sebagai entri Anthropic. Fable 5.1 dirilis pada 1 September, sehari sebelum 3.8 Flash, jadi tidak disertakan. Untuk angka Fable 5.1 yang dijalankan Anthropic sendiri, lihat perbandingan Claude Fable 5.1 vs Opus 5.
Apakah keunggulan harga Gemini bertahan hingga 2027?
Sebagian. Mulai 1 Januari 2027, Gemini 3.8 Flash beralih ke $1.50 / $7.50, yang membuat Fable 5.1 menjadi 6.7x pada kedua baris dan Sol 3.3x pada masukan dan 4x pada keluaran. Masih lebih murah, tetapi setengah dari selisihnya.
Mana yang harus dipanggil lebih dulu
Mulailah dengan Gemini 3.8 Flash untuk apa pun yang Anda jalankan dalam volume besar, atur thinking_level per rute, dan perhatikan token per tugas, bukan harga label. Tingkatkan ke Claude Fable 5.1 di mana evaluasi Anda pada model yang lebih murah tidak memadai dan konteks di-cache di seluruh putaran. Gunakan GPT-5.6 Sol ketika sisa tumpukan Anda adalah OpenAI dan Anda menginginkan tingkatan premium tanpa vendor kedua. Apa pun yang Anda pilih, jalankan prompt yang sama melalui ketiganya dalam satu skenario pengujian terlebih dahulu; rasio harga bersifat publik, tetapi rasio biaya per tugas pada prompt Anda adalah milik Anda untuk diukur.
