Cara Menggunakan API GPT-5.6: Sol, Terra, dan Luna

Pelajari cara menggunakan API GPT-5.6: ID model Sol, Terra, dan Luna, permintaan pertama di Python dan curl, upaya penalaran, penembolokan prompt, dan pengujian biaya.

Ashley Innocent

Ashley Innocent

10 July 2026

Cara Menggunakan API GPT-5.6: Sol, Terra, dan Luna

Apidog untuk Perusahaan

Penerapan On-Premises

SSO & RBAC

Sesuai SOC 2

Jelajahi Apidog Enterprise

OpenAI merilis GPT-5.6 untuk ketersediaan umum pada 9 Juli 2026, dan akses API bersifat swalayan: akun API mana pun dapat memanggilnya hari ini, tanpa daftar tunggu dan tanpa pembatasan paket. Pratinjau terbatas yang berlangsung hingga awal Juli sudah menjadi sejarah. Yang berubah bagi pengembang adalah bentuk peluncuran itu sendiri. Alih-alih satu model, Anda mendapatkan tiga: Sol, Terra, dan Luna, masing-masing dengan titik harga sendiri, ditambah enam tingkat upaya penalaran dan kontrol caching prompt eksplisit.

Itu lebih banyak keputusan daripada pertukaran model biasa, dan pengaturan default yang Anda pilih di minggu pertama cenderung akan tetap digunakan. Panduan ini membahas ID model dan kapan masing-masing model mendapatkan tempatnya, permintaan pertama Anda dalam Python dan curl, upaya penalaran, pengaturan caching, permukaan API Respons yang baru, dan cara bermigrasi dari GPT-5.5 tanpa kejutan. Jika Anda menginginkan latar belakang lengkap tentang tingkatan unggulan terlebih dahulu, ringkasan GPT-5.6 Sol mencakup posisi dan tolok ukur; tulisan ini tetap praktis.

Pada akhirnya Anda akan memiliki panggilan yang berfungsi ke ketiga tingkatan dan cara yang dapat diulang untuk membandingkannya pada prompt Anda sendiri di Apidog, sehingga keputusan biaya dan kualitas berasal dari data Anda sendiri daripada postingan peluncuran.

TL;DR

Tiga ID model dan kapan harus memilih masing-masing

GPT-5.6 menyimpang dari penamaan OpenAI yang biasa. Angka tersebut adalah generasi; Sol, Terra, dan Luna adalah tingkatan kemampuan yang tahan lama yang akan berkembang dengan irama mereka sendiri, seperti yang dijelaskan oleh liputan peluncuran MarkTechPost. Tingkatan yang Anda standarisasi hari ini mempertahankan maknanya pada generasi berikutnya.

ID Model Tingkat Input / output per 1 Juta token Pilih saat
gpt-5.6-sol Unggulan $5 / $30 Penalaran mendalam, orkestrasi agen, debugging sulit
gpt-5.6-terra Seimbang $2.50 / $15 Fitur produk sehari-hari, pekerjaan setara GPT-5.5 dengan biaya lebih rendah
gpt-5.6-luna Cepat $1 / $6 Klasifikasi, ekstraksi, perutean, draf awal

Sol adalah unggulan. OpenAI melaporkannya sekitar 53 pada Agents’ Last Exam dibandingkan 46.9 untuk GPT-5.5, jadi anggap itu sebagai klaim hari peluncuran dan verifikasi pada tugas Anda sendiri. Terra adalah pilihan pragmatis: OpenAI memposisikannya bersaing dengan GPT-5.5 dengan biaya sekitar setengahnya. Luna ada untuk pekerjaan bervolume tinggi, sensitif latensi di mana Anda lebih mementingkan ekonomi unit daripada kedalaman.

Default yang masuk akal: prototipe di Terra, tingkatkan ke Sol hanya jika Terra terbukti gagal, dan dorong jalur bervolume tinggi ke Luna setelah prompt stabil. Pembagian harga GPT-5.6 membahas lebih dalam tentang bagaimana tarif ini dibandingkan lintas generasi dan pesaing.

Satu alias yang patut diketahui: gpt-5.6 tanpa sufiks mengarah ke Sol. Sematkan ID tingkatan eksplisit dalam kode produksi sehingga setiap panggilan menyatakan dengan tepat berapa biayanya.

Permintaan pertama Anda

ID model di bawah ini cocok dengan dokumen pengembang OpenAI secara harfiah. Anda memerlukan kunci API OpenAI dengan penagihan diaktifkan; tidak ada yang lain.

Chat Completions berfungsi tidak berubah, jadi kode yang ada hanya memerlukan pertukaran model:

from openai import OpenAI

client = OpenAI()

response = client.chat.completions.create(
    model="gpt-5.6-sol",
    messages=[
        {"role": "system", "content": "Anda adalah peninjau kode yang ringkas."},
        {"role": "user", "content": "Tinjau ini untuk kasus-kasus ekstrem: def parse_price(raw): return float(raw.strip('$'))"}
    ]
)

print(response.choices[0].message.content)

Panggilan yang sama dalam curl:

curl https://api.openai.com/v1/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $OPENAI_API_KEY" \
  -d '{
    "model": "gpt-5.6-sol",
    "messages": [
      {"role": "user", "content": "Jelaskan kunci idempoten dalam satu paragraf."}
    ]
  }'

Untuk pembangunan baru, targetkan Responses API sebagai gantinya. Setiap penambahan GA ada di sana, dan ia menerima blok penalaran secara langsung:

response = client.responses.create(
    model="gpt-5.6-terra",
    input="Ringkaslah pertukaran antara webhook dan polling.",
    reasoning={"effort": "low"}
)

print(response.output_text)

Jalankan prompt yang sama terhadap ketiga tingkatan sebelum Anda menulis baris kode integrasi lainnya. Perbedaan dalam nada, panjang, dan latensi lebih mudah dirasakan daripada dibaca.

Memilih upaya penalaran

GPT-5.6 menyediakan enam tingkat upaya penalaran: none, low, medium, high, xhigh, dan max.

none mematikan penalaran. Gunakan ini ketika tugas bersifat mekanis dan latensi lebih penting daripada kedalaman: pemformatan ulang, ekstraksi terhadap skema yang jelas, pengisian templat. Luna pada none berperilaku seperti model penyelesaian klasik yang cepat, dan pasangan itulah yang membuat tarif input $1-nya bersinar.

max berada di ujung yang lain. Cadangkan ini untuk masalah di mana jawaban yang salah lebih mahal daripada jawaban yang lambat: bug konkurensi yang halus, tinjauan arsitektur, perencanaan multi-langkah. Harapkan waktu tunggu yang lebih lama dan tagihan yang lebih besar.

Sebagian besar beban kerja berada di tengah. Mulai dari medium, bergerak satu tingkat pada satu waktu, dan ukur kualitas sebelum Anda menerima biaya tambahan untuk naik. Bergerak turun seringkali gratis: panduan migrasi OpenAI sendiri mengatakan banyak beban kerja GPT-5.5 mempertahankan kualitas satu tingkat lebih rendah pada GPT-5.6.

Mode Pro terpisah dari upaya. Atur reasoning.mode: "pro" dan model memprioritaskan kualitas jawaban di atas kecepatan. Ini berfungsi di ketiga tingkatan dan merupakan pengaturan, bukan ID model yang berbeda, jadi tidak ada slug khusus pro yang perlu dicari. Beban kerja yang mengutamakan kualitas seperti ringkasan hukum atau postmortem insiden adalah jalurnya. Untuk bentuk permintaan dan batasan yang tepat, lihat referensi API OpenAI.

Menyiapkan caching prompt

GPT-5.6 menambahkan kontrol cache eksplisit. Atur prompt_cache_options.mode ke `"explicit"` dan Anda memutuskan apa yang di-cache alih-alih mengandalkan deteksi awalan otomatis:

response = client.responses.create(
    model="gpt-5.6-luna",
    input=[
        {"role": "system", "content": SUPPORT_PLAYBOOK},
        {"role": "user", "content": ticket_text}
    ],
    prompt_cache_options={"mode": "explicit"}
)

Bidang ttl pada objek opsi yang sama mengatur berapa lama awalan yang di-cache tetap hangat; apa pun yang Anda minta, batas minimumnya adalah 30 menit. Nilai ttl yang diterima dan aturan penempatan breakpoint ada dalam referensi API OpenAI.

Ekonominya sederhana. Penulisan cache dikenakan biaya 1.25x tarif input tanpa cache. Pembacaan cache mempertahankan diskon 90%. Jadi caching menguntungkan mulai dari hit kedua: dua kali akses tanpa cache ke suatu awalan berharga 2.0x harga tokennya, sedangkan satu penulisan ditambah satu pembacaan berharga 1.35x.

Contoh yang berhasil. Misalkan bot dukungan mengirimkan playbook 40.000 token pada setiap panggilan Luna. Tanpa cache, awalan tersebut berharga $0.04 per panggilan dengan tarif input Luna $1 per 1 Juta. Dengan caching eksplisit, panggilan pertama menulis dengan biaya $0.05, dan setiap pembacaan dalam `ttl` berharga $0.004. Untuk 100 panggilan yang berurutan, itu adalah $0.45 bukan $4.00, sekitar diskon 89% dari bagian statis tagihan Anda. Batas waktu minimum 30 menit berarti lalu lintas yang bersifat *bursty* dengan jeda kurang dari setengah jam juga tetap mendapatkan pembacaan murah.

Aturan praktisnya: prompt apa pun dengan awalan statis besar yang digunakan ulang setidaknya dua kali dalam `ttl` harus dijalankan dalam mode eksplisit.

Apa yang baru di Responses API saat GA

Tiga tambahan dikirimkan dengan GA, semuanya di Responses API:

Ada juga pengaturan detail visi baru, original dan auto, yang mempertahankan dimensi gambar asli. Bentuk permintaan dan parameter untuk semua ini ada di referensi API OpenAI; mekanisme di atas adalah apa yang harus dirancang.

Migrasi dari GPT-5.5

Panduan OpenAI lugas: perlakukan migrasi sebagai proses penyetelan, bukan hanya perubahan slug model. Jika integrasi Anda mengikuti alur kerja dalam panduan API GPT-5.5 kami, tiga penyesuaian penting.

Pertama, uji upaya penalaran Anda saat ini dan satu tingkat di bawahnya. GPT-5.6 seringkali mempertahankan kualitas pada satu tingkat di bawah, yang merupakan pemotongan biaya langsung pada lalu lintas yang sama.

Kedua, harapkan jawaban yang lebih pendek. GPT-5.6 menghasilkan keluaran yang jauh lebih ringkas dengan lebih sedikit intro generik. Jika prompt Anda berisi arahan seperti “singkatlah” atau “lewati pembukaan”, hapus dan uji ulang, karena instruksi singkat yang bertumpuk kini dapat berlebihan. Tulisan Simon Willison pada hari peluncuran adalah bacaan independen yang berguna tentang bagaimana keluarga model ini berperilaku dalam praktiknya.

Ketiga, perhatikan penggunaan token yang di-cache dalam respons Anda saat Anda menyetel, dan uji tolok ukur set tugas yang representatif sebelum mengalihkan lalu lintas produksi. Output yang sebanding pada Terra dengan setengah harga GPT-5.5 adalah hasil yang patut diperiksa terlebih dahulu.

Menguji API di Apidog

Curl membuktikan endpoint berfungsi. Memilih antara tiga tingkatan membutuhkan sesuatu yang dapat diulang. Unduh Apidog dan siapkan alat perbandingan kecil:

Antarmuka Apidog - Tangkapan layar dari pengaturan perbandingan model.
  1. Buat lingkungan dengan OPENAI_API_KEY Anda ditambah tiga variabel: MODEL_SOL=gpt-5.6-sol, MODEL_TERRA=gpt-5.6-terra, MODEL_LUNA=gpt-5.6-luna.
  2. Buat satu permintaan POST ke API dan referensikan {{MODEL_SOL}} di bagian badan, lalu duplikasikan dua kali dan tukar dengan variabel lainnya.
  3. Kirim prompt berbentuk produksi yang sama melalui ketiganya dan baca jawabannya secara berdampingan.
  4. Periksa blok penggunaan di setiap respons. Kalikan jumlah token dengan tarif masing-masing tingkatan dan Anda akan mendapatkan proyeksi biaya per permintaan yang didasarkan pada prompt Anda sendiri, bukan tolok ukur orang lain.

Alat yang sama terbukti berguna selama penyetelan upaya. Ubah tingkat upaya pada satu permintaan yang disimpan, kirim ulang, dan perhatikan token output bergerak; angka itu dikalikan tarif per-token adalah kurva kualitas-versus-biaya Anda, yang terlihat satu permintaan pada satu waktu.

FAQ

Apakah API GPT-5.6 tersedia untuk semua orang?

Ya. Sejak 9 Juli 2026, akun OpenAI API mana pun dapat memanggil ketiga model secara swalayan. Pembatasan pratinjau pra-peluncuran dicabut sebelum GA, dan akses API tidak bergantung pada paket ChatGPT Anda. Tingkatan paket hanya membentuk produk chat, di mana pengguna Gratis dan Go mendapatkan Terra, dan paket berbayar membuka pemilih model penuh.

Berapa jendela konteks dan batas pengetahuan GPT-5.6?

Berdasarkan liputan dokumentasi awal, keluarga model ini memiliki jendela konteks 1 Juta token, output maksimal 128K, dan batas pengetahuan hingga 16 Februari 2026. Halaman model OpenAI adalah sumber catatan; anggap ini sebagai angka yang dilaporkan hingga Anda mengonfirmasinya untuk akun Anda.

Apa perbedaan antara mode pro dan ultra?

Mode Pro adalah pengaturan API (reasoning.mode: "pro") yang berfungsi di ketiga model dan menukar kecepatan dengan kualitas jawaban. Ultra adalah pengaturan multi-agen yang menjalankan empat agen secara paralel secara default, dan tersedia di ChatGPT Work pada paket Pro dan Enterprise ditambah Codex dari Plus ke atas. Pembagian mode ultra GPT-5.6 membahas kapan pengeluaran token ekstra yang disengaja itu sepadan.

Haruskah saya membangun di Chat Completions atau Responses API?

Kode Chat Completions yang ada tetap berfungsi dengan pertukaran ID model, jadi tidak ada penulisan ulang yang dipaksakan. Pembangunan baru harus menargetkan Responses API: panggilan alat terprogram, multi-agen, dan penalaran yang dipertahankan semuanya dikirimkan di sana, dan dokumentasi GPT-5.6 OpenAI berpusat padanya.

Kesimpulan untuk Anda

Anda tidak memerlukan proyek migrasi untuk memulai. Pilih Terra, jalankan satu prompt nyata dari produk Anda melaluinya dengan upaya medium, lalu turunkan satu tingkat dan bandingkan. Terapkan caching eksplisit jika prompt Anda memiliki awalan statis yang besar; penghematan 89% dalam contoh di atas adalah tipikal dari apa yang diberikan oleh prompt sistem yang besar. Baru setelah itu putuskan di mana Sol dan Luna cocok dalam tumpukan Anda.

Pertahankan juga alat perbandingan tiga tingkat tersebut. Sol, Terra, dan Luna akan berkembang dengan irama mereka sendiri, jadi rilis berikutnya adalah menjalankan ulang permintaan yang disimpan daripada proyek penelitian. Apidog menyimpan permintaan, lingkungan, dan jumlah token tersebut di satu tempat, yang mengubah setiap peluncuran model di masa mendatang menjadi pengujian sore hari alih-alih tebakan.

tombol

Mengembangkan API dengan Apidog

Apidog adalah alat pengembangan API yang membantu Anda mengembangkan API dengan lebih mudah dan efisien.