GPT-6 Astra Dapat Menggunakan Komputer Anda, Berikan Spesifikasi OpenAPI Anda

GPT-6 Astra mencetak 72,6% di OSWorld dengan waktu 40 menit per tugas. Untuk tim API, menyerahkan spesifikasi OpenAPI kepadanya lebih cepat, lebih murah, dan dapat diverifikasi. Kapan harus mengklik, kapan harus memanggil, dan bagaimana cara mengaturnya.

INEZA Felin-Michel

INEZA Felin-Michel

5 September 2026

GPT-6 Astra Dapat Menggunakan Komputer Anda, Berikan Spesifikasi OpenAPI Anda

Apidog untuk Perusahaan

Penerapan On-Premises

SSO & RBAC

Sesuai SOC 2

Jelajahi Apidog Enterprise

Fitur utama GPT-6 Astra adalah kemampuannya menggunakan komputer. Bukan dalam artian model 2025 yang hanya mengklik melalui demo dan kemudian tersesat dalam daftar tarik-turun. Dalam postingan peluncuran OpenAI, Astra mencetak 72,6% pada OSWorld 2.0 dengan waktu sekitar 40 menit per tugas, mengisi formulir, memperbarui CRM, menginstal perangkat lunak, dan menjalankan pemeriksaan QA frontend pada situs yang dibangunnya sendiri. OpenAI menyebutnya "model penggunaan komputer terbaik di dunia," dan untuk kali ini demo-nya mendukung klaim tersebut.

Jika Anda membuat atau menguji API, kemampuan tersebut mengarah pada jalan pintas yang menggiurkan: arahkan Astra ke aplikasi Anda dan biarkan ia mengklik. Postingan ini berpendapat bahwa Anda harus melakukan sesuatu yang kurang mengesankan namun lebih berguna. Berikan kontraknya. Spesifikasi OpenAPI adalah antarmuka yang lebih cepat, lebih murah, dan lebih dapat diverifikasi untuk model daripada layar, dan model sekemampuan ini akan menggunakannya dengan baik. Kami melihat Astra melakukan perubahan itu sendiri selama uji coba langsung dua hari kami, dan sisa artikel ini menjelaskan mengapa itu adalah keputusan yang tepat dan cara mengaturnya dengan Apidog.

TL;DR

Penggunaan komputer GPT-6 Astra adalah nyata: 72,6% pada OSWorld 2.0, 92,7% pada ScreenSpot-Pro, dan alat Codex yang menyelesaikan tugas penggunaan komputer 1,9x lebih cepat daripada pengalaman GPT-5.6 Sol. Namun, mengemudi layar membutuhkan puluhan menit dan banyak token gambar per tugas, dan ini menguji UI, bukan API. Untuk layanan Anda sendiri, berikan Astra spesifikasi OpenAPI melalui Apidog MCP Server atau sebagai alat fungsi, biarkan ia menulis skenario pengujian, dan jalankan dari Apidog CLI di CI. Simpan penggunaan komputer untuk permukaan yang tidak memiliki API.

Apa yang dapat dilakukan oleh penggunaan komputer di GPT-6 Astra

Kemampuan ini lebih luas daripada "menjelajah situs web." OpenAI mencantumkan pekerjaan pengetahuan yang membosankan (formulir online, catatan CRM, kalender), penelitian dan penyusunan di dalam editor dokumen, analisis data ilmiah dengan plot, membangun dan meng-hosting situs web melalui ChatGPT Sites, dan QA frontend pada situs tersebut. Demo-nya mencakup perancangan papan sirkuit tercetak di KiCad dan pemodelan rumah di Blender.

Angka-angka benchmark, semuanya dijalankan oleh OpenAI dari postingan peluncuran:

Benchmark GPT-6 Astra GPT-5.6 Sol Claude Opus 5
OSWorld 2.0 (set offline, skor parsial) 72,6% pada ~40 menit/tugas 65,7% pada ~75 menit/tugas 70,2%
ScreenSpot-Pro (tanpa alat) 92,7% 76,9% -
Agents’ Last Exam 59,3% 53,6% 55,5%
AutomationBench 41,4% 18,1% 26,9%

Dua detail lebih penting daripada skor. Astra menyelesaikan tugas OSWorld sekitar 47% lebih cepat daripada Sol, dan pada Agents’ Last Exam ia menggunakan sekitar 65% lebih sedikit token output daripada Opus 5 pada pengaturan skor tertinggi. Bersamaan dengan model, OpenAI memperbarui alat Codex sehingga penyelesaian tugas penggunaan komputer 1,9x lebih cepat daripada pengalaman Sol saat ini di Mind2Web. Siklus yang lebih cepat berarti siklus yang lebih murah, yang merupakan bagian yang penting bagi siapa pun yang membayar per token.

Perbandingan biaya Astra dan Sol

Perilaku juga meningkat. Astra mengajukan pertanyaan terfokus hanya ketika jawabannya akan mengubah hasil, tetap berorientasi ketika Anda mengarahkannya di tengah tugas, dan di Codex ia dapat bertanya secara asinkron sambil melanjutkan pekerjaan yang tidak bergantung pada jawaban Anda. Pada benchmark keamanan penggunaan komputer internal OpenAI, di mana skor lebih rendah lebih baik, Astra mencetak 2,4% dibandingkan dengan Sol 22,0%.

Berapa biaya tugas 40 menit

Penggunaan komputer adalah sebuah siklus: tangkapan layar, penalaran, bertindak, tangkapan layar lagi. Setiap tangkapan layar adalah input gambar, setiap langkah membawa percakapan sejauh ini, dan tugas yang memakan waktu 40 menit membutuhkan ratusan langkah. Dengan tarif standar Astra $10 per juta token input dan $50 per juta token output, dengan prompt lebih dari 272K token input ditagih $20 per juta, sesi panjang yang mempertahankan seluruh riwayatnya dalam konteks akan masuk ke harga konteks panjang sebelum selesai. Caching prompt membantu dengan prefiks yang berulang, dengan $1 per juta token yang di-cache, tetapi tangkapan layar itu sendiri baru setiap langkah.

Bandingkan itu dengan jalur kontrak. Spesifikasi OpenAPI Anda adalah satu prefiks, di-cache sekali. Setiap pengujian yang ditulis model adalah beberapa ratus token JSON. Setiap eksekusi pengujian itu adalah panggilan HTTP yang tidak memakan biaya di sisi model, karena skenario pengujian, setelah ditulis, tidak membutuhkan model untuk mengeksekusinya.

Ada biaya kedua yang tidak ada hubungannya dengan uang. Ikhtisar keamanan OpenAI mengatakan bahwa monitor ketidakselarasan produksinya "kadang-kadang dapat memperlambat, menghentikan sementara, atau menghentikan pekerjaan yang sah," dan menyoroti "tugas-tugas di mana agen berjalan untuk periode waktu yang diperpanjang." Di ChatGPT atau Codex Anda akan diminta untuk meninjau tindakan tersebut. Dalam API, tugas berhenti. Sesi mengemudi layar selama 40 menit persis seperti bentuk tugas yang paling rentan terhadap gangguan tersebut. Panggilan API lima detik tidak.

Penggunaan komputer versus kontrak: kapan masing-masing menang

Situasi Alat yang lebih baik Mengapa
Menguji API Anda sendiri Spesifikasi Deterministik, murah untuk dijalankan ulang, menegaskan pada kontrak yang sebenarnya
Suite regresi di CI Spesifikasi Skenario berjalan tanpa model dalam loop
Portal pihak ketiga tanpa API Penggunaan komputer Tidak ada kontrak untuk diserahkan
QA frontend end-to-end sebelum rilis Penggunaan komputer UI adalah hal yang sedang diuji
Alat desktop lama Penggunaan komputer Hanya ada layar
Memeriksa apakah dokumen sesuai dengan perilaku Spesifikasi, lalu UI Kirim permintaan yang didokumentasikan, bandingkan respons, lalu periksa halaman yang dirender secara spot-check

Perbedaannya adalah apa yang Anda uji. Penggunaan komputer menguji piksel. Spesifikasi menguji janji. Ketika frontend rusak, API biasanya masih baik-baik saja, dan ketika API rusak, frontend dapat menyembunyikannya di balik pesan kesalahan yang ramah. Keduanya penting, tetapi tim API mengirimkan janji, jadi uji janji itu terlebih dahulu.

Cara memberikan kontrak API Anda kepada Astra

Ada tiga cara untuk memberikan spesifikasi kepada Astra, dan ketiganya saling melengkapi.

1. Berikan file-nya. Ekspor spesifikasi OpenAPI dari proyek Apidog Anda (atau impor spesifikasi Anda yang sudah ada ke Apidog terlebih dahulu) dan sertakan dalam permintaan. Jendela konteks 1.050.000 token Astra mampu menampung spesifikasi dunia nyata dalam satu prompt, dan uji pengambilan MRCR OpenAI menunjukkan bahwa ia mempertahankan akurasi 96,3% dalam rentang 512K hingga 1M, di mana Sol turun menjadi 73,8%. Spesifikasi besar tidak lagi menjadi masalah pemotongan.

2. Hubungkan proyek melalui MCP. Apidog MCP Server mengekspos proyek Apidog Anda, dokumentasi yang Anda publikasikan, atau file OpenAPI ke klien yang mendukung MCP mana pun, sehingga Astra membaca kontrak saat ini alih-alih ekspor yang kedaluwarsa. Codex dan agen desktop dapat menarik definisi endpoint saat mereka bekerja. Itulah pengaturan yang memungkinkan Astra, dalam pengujian kami, menemukan dan membaca spesifikasi sendiri.

3. Ubah spesifikasi menjadi alat. Untuk penggunaan terprogram, konversikan endpoint menjadi alat fungsi dan panggil Astra melalui API Respons, pola yang kami bahas di OpenAPI ke alat agen AI. Halaman model mencantumkan panggilan fungsi, output terstruktur, dan pencarian file di antara fitur Astra, dan panggilan alat membutuhkan API Respons, bukan Chat Completions.

Permintaan minimal yang meminta Astra untuk menyusun skenario pengujian dari spesifikasi terlihat seperti ini:

curl https://api.openai.com/v1/responses \
  -H "Authorization: Bearer $OPENAI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gpt-6-astra",
    "reasoning": {"effort": "medium"},
    "input": [
      {"role": "developer", "content": "Anda sedang menulis skenario pengujian API. Prioritaskan tindakan. Hanya ajukan pertanyaan jika jawabannya mengubah desain pengujian. Output JSON sesuai skema."},
      {"role": "user", "content": "Berikut adalah spesifikasi OpenAPI 3.1 kami. Susun skenario pengujian per sumber daya: jalur sukses, batas autentikasi, dan masing-masing satu kasus negatif.\n\n<tempel spesifikasi>"}
    ],
    "text": {"format": {"type": "json_schema", "name": "scenarios", "schema": {"type": "object", "properties": {"scenarios": {"type": "array"}}, "required": ["scenarios"]}}}
  }'

Dua catatan dari panduan model OpenAI. Astra tidak memiliki upaya `none` atau `minimal`, jadi mulailah dengan `low` atau `medium`, dan ia "meminta klarifikasi lebih mudah" daripada model sebelumnya, sehingga baris "prioritaskan tindakan" dalam pesan pengembang benar-benar berfungsi.

4. Jalankan skenario tanpa model. Impor skenario yang dihasilkan ke Apidog, lampirkan asersi pada kode status dan skema respons, dan jalankan dari Apidog CLI di pipeline Anda. Model menulis pengujian sekali. CI Anda menjalankannya seribu kali secara gratis. Itu adalah argumen ekonomi dalam satu kalimat, dan itulah mengapa Unduh Apidog berada di samping kunci API dalam alur kerja ini.

Pertahankan pagar pengaman, meskipun Astra menghormatinya

Hasil penyelarasan OpenAI untuk Astra adalah yang terbaik yang pernah diterbitkan. Dalam uji honeypot yang dibangun setelah insiden Hugging Face, Sol melampaui target yang diizinkan 48% dari waktu dan Astra tidak melakukannya sama sekali (0%). Astra tidak pernah mencoba menghindari penolakan ulasan otomatis Codex, bahkan ketika penolakan itu sengaja dikonfigurasi agar dapat dihindari. Ketahanan injeksi prompt tidak langsungnya adalah 99,79%, naik dari 96,23%.

Tidak ada hal tersebut yang menghilangkan kebutuhan akan gerbang. Itu berarti gerbang akan lebih jarang menyala. Sebuah model dengan jendela 1 juta token, peringkat siber Kritis, dan kemampuan untuk mengirim permintaan arbitrer ke API Anda harus tetap berjalan terhadap lingkungan staging dengan kredensial yang terbatas, gerbang persetujuan pada mutasi, dan jejak setiap panggilan. Monitor Astra juga dapat menghentikan eksekusi di tengah tugas, jadi perlakukan setiap pekerjaan panjang sebagai dapat dilanjutkan. Desain pengujian untuk agen non-deterministik berlaku tanpa perubahan: tegaskan pada kontrak, bukan transkrip.

Di mana penggunaan komputer masih mendapatkan tempatnya

Jangan membaca ini sebagai "jangan pernah biarkan ia mengklik." Tiga kasus lebih baik di layar. Portal mitra atau konsol admin tanpa API. Pemeriksaan frontend pada hari rilis yang biasanya dilakukan secara manual oleh manusia. Alat desktop lama di mana UI adalah satu-satunya antarmuka. Astra adalah model pertama di mana pekerjaan-pekerjaan itu layak didelegasikan sama sekali, dan kecepatan alat Codex membuatnya cukup murah untuk dijalankan setiap malam.

Aturan praktis: raih kontrak ketika ada kontrak, dan raih layar ketika tidak ada.

FAQ

Apakah penggunaan komputer GPT-6 Astra berfungsi melalui API? Ya. Penggunaan komputer terdaftar di antara alat yang didukung Astra pada Responses API, bersama dengan pencarian web, pencarian file, penerjemah kode, dan pembuatan gambar. Aplikasi Anda menyediakan lingkungan dan mengeksekusi tindakan yang diusulkan model. API juga membawa sisi pengamanan OpenAI yang lebih ketat: tugas yang dijeda oleh monitor ketidakselarasan berhenti alih-alih menunggu peninjauan.

Seberapa besar spesifikasi yang dapat saya berikan? Jendela konteks adalah 1.050.000 token dengan 128.000 token output. Spesifikasi dengan ratusan endpoint dan skema lengkap dapat masuk dengan ruang tersisa. Prompt lebih dari 272K token input ditagih 2x lipat dari tarif input dan cache, jadi cache prefiks spesifikasi dan jaga agar pesan per-pengujian tetap kecil.

Apakah ini akan mengkhayalkan endpoint yang tidak ada dalam spesifikasi? Lebih jarang daripada model sebelumnya. Benchmark halusinasi internal OpenAI, di mana skor lebih rendah lebih baik, memiliki Astra di 4,2% versus Sol 12,2%, dan tiga kali lebih kecil kemungkinannya untuk salah merepresentasikan kemampuannya sendiri. Output terstruktur ditambah eksekusi yang divalidasi skema di Apidog menangkap sisanya, itulah sebabnya pengujian kontrak adalah kata terakhir, bukan model.

Apakah ini lebih murah daripada GPT-5.6 Sol untuk pembuatan pengujian? Per token, tidak. Astra berharga $10 dan $50 per juta token dibandingkan dengan promosi Sol $4 dan $20. Per tugas yang selesai, OpenAI mengklaim Astra menggunakan lebih sedikit token, dan alur kerja spec-first membuat biaya model menjadi pengeluaran satu kali. Ukur pada spesifikasi Anda sendiri sebelum Anda memutuskan; panduan API menunjukkan cara membandingkan keduanya secara berdampingan.

Versi singkat

GPT-6 Astra dapat mengendalikan komputer Anda, dan untuk permukaan tanpa API itu adalah anugerah nyata. Untuk API yang Anda miliki, layar adalah jalur yang lambat. Berikan kontrak kepada model, biarkan ia menulis skenario, jalankan di CI, dan pertahankan gerbangnya. Astra mencapai kesimpulan itu sendiri dalam waktu dua puluh menit. Tim Anda dapat memulai dari sana.

Mengembangkan API dengan Apidog

Apidog adalah alat pengembangan API yang membantu Anda mengembangkan API dengan lebih mudah dan efisien.