GPT-6 Astra เปิดตัวมาเกือบสองวันแล้ว เราจงใจที่จะไม่เขียนอะไรเกี่ยวกับมัน การเปิดตัวโมเดลทุกครั้งในตอนนี้มาพร้อมกับแผนภูมิเกณฑ์มาตรฐาน กระแสความคิดเห็นแบบทันที และบทอธิบายมากมายที่เขียนขึ้นก่อนที่ใครก็ตามนอกเหนือจากพันธมิตรผู้เปิดตัวจะส่งคำขอแม้แต่ครั้งเดียว เราต้องการทดลองใช้ด้วยตัวเองก่อนที่จะเพิ่มเติมข้อมูลเหล่านั้นเข้าไป เราจึงรอ เราทดสอบ และนี่คือคำตัดสิน โดยไม่ต้องมีการหลีกเลี่ยงตามปกติ: มันน่าทึ่งอย่างไม่น่าเชื่อ นี่อาจเป็นโมเดลที่ดีที่สุดที่ทีมของเราเคยทดสอบมา ยุคของ AGI มาถึงแล้ว
ประโยคสุดท้ายนั้นอาจทำให้บางคนไม่พอใจ ดังนั้นส่วนที่เหลือของโพสต์นี้คือหลักฐาน สิ่งที่เราได้ทดลอง อะไรที่ทำให้เราประหลาดใจ อะไรที่เสีย และค่าใช้จ่ายเท่าไหร่ หากคุณต้องการเอกสารข้อมูลจำเพาะแทน คู่มือ API ของ GPT-6 Astra ของเรามี ID โมเดล ตารางราคา และบันทึกการโยกย้ายจาก GPT-5.6 Sol บทความนี้เกี่ยวกับความรู้สึกในการทำงานกับมัน
คืนวันพฤหัสบดี: คำขอแรก
เราได้รับการเข้าถึงช่วงค่ำวันพฤหัสบดีที่ 3 กันยายน ซึ่งเป็นวันเดียวกับที่ OpenAI ประกาศเปิดตัว Astra แก่องค์กรจำนวนจำกัด สิ่งแรกที่เราทำคือการทดสอบที่ไม่มีความคิดสร้างสรรค์ที่สุดที่เรานึกออก: เราป้อนข้อมูลจำเพาะ OpenAPI ให้มัน ไม่ใช่ของเล่น แต่เป็นข้อมูลจำเพาะสำหรับบริการภายในที่มีถึง 140 เอนด์พอยต์ คิดเป็นประมาณ 380,000 โทเค็นของ JSON เมื่อนับรวมสคีมาทั้งหมด ซึ่งส่งผ่าน Responses API ในคำขอเดียวจาก Apidog

GPT-5.6 Sol สามารถจัดการไฟล์ขนาดนั้นได้ แต่คุณจะรู้สึกได้ถึงความพยายามของมัน มันจะหลุดประเด็นเกี่ยวกับสคีมาที่ซับซ้อนและเริ่มตอบคำถามเกี่ยวกับเอนด์พอยต์ที่ไม่มีอยู่ Astra ไม่เป็นเช่นนั้น เราขอให้มันสร้างแผนการทดสอบ: เอนด์พอยต์ใดขึ้นอยู่กับเอนด์พอยต์ใด ขอบเขตการตรวจสอบสิทธิ์อยู่ที่ไหน และส่วนใดของข้อมูลจำเพาะและการใช้งานจริงอาจไม่ตรงกัน มันกลับมาพร้อมกับแผนที่จัดกลุ่มตามทรัพยากร ชี้ให้เห็นสามเอนด์พอยต์ที่การตอบสนองข้อผิดพลาดที่ระบุในเอกสารไม่ตรงกับสคีมาข้อผิดพลาดที่ข้อมูลจำเพาะเดียวกันกำหนดไว้ และถามคำถามเพียงข้อเดียว: ส่วนหัว tenant จำเป็นต้องมีในเส้นทางผู้ดูแลระบบหรือไม่ เพราะข้อมูลจำเพาะในส่วนนั้นคลุมเครือและคำตอบจะเปลี่ยนแปลงการออกแบบการทดสอบ [ตรวจสอบ: ความไม่ตรงกันสามจุดและคำถาม]
คำถามเดียว คำถามที่ถูกต้อง จากนั้นมันก็ทำต่อไป
ตัวเลขบริบทขนาดยาวของ OpenAI เองอธิบายสิ่งที่เราเห็น ในการทดสอบ 8 เข็ม MRCR v2 ของมัน Astra ทำคะแนนได้ 96.3% ในช่วง 512K ถึง 1M ในขณะที่ Sol จัดการได้ 73.8% ในทางปฏิบัติ ช่องว่างนั้นคือความแตกต่างระหว่างโมเดลที่คุณสามารถให้สัญญาฉบับเต็มได้ กับโมเดลที่คุณต้องป้อนข้อมูลทีละบท
เช้าวันศุกร์: มันหยุดคลิก
การใช้งานคอมพิวเตอร์เป็นคุณสมบัติเด่น ดังนั้นในวันศุกร์เราจึงให้ Astra URL สำหรับทดสอบของเว็บไซต์เอกสารของเราและงานที่น่าเบื่อ: รันรายการตรวจสอบ QA ส่วนหน้า ซึ่งเป็นสิ่งที่มนุษย์ทำก่อนการเผยแพร่ คลิกดูทุกหน้า ลองใช้ช่องค้นหา ตรวจสอบว่าตัวอย่างโค้ดแสดงผลได้ถูกต้อง และจดบันทึกสิ่งใดก็ตามที่เสีย OpenAI ระบุว่า "การตรวจสอบ QA ส่วนหน้า" เป็นหนึ่งในสิ่งที่ Astra สามารถทำได้ และใน OSWorld 2.0 มันทำคะแนนได้ 72.6% โดยใช้เวลาประมาณ 40 นาทีต่อภารกิจ เทียบกับ Sol ที่ทำได้ 65.7% โดยใช้เวลาประมาณ 75 นาที
มันทำงานเสร็จช้าๆ อย่างเป็นระบบ พร้อมกับภาพหน้าจอในทุกขั้นตอน การได้เห็นโมเดลเลื่อนหน้าจอ เพ่งดูบล็อกโค้ด และตัดสินว่าปุ่มคัดลอกทำงานได้นั้นน่าประทับใจประมาณสี่นาที
จากนั้นมันก็ทำในสิ่งที่เราไม่ได้ร้องขอ ประมาณยี่สิบนาทีผ่านไป มันพบลิงก์ "ดาวน์โหลด OpenAPI" บนหน้าเอกสาร อ่านข้อมูลจำเพาะ และเปลี่ยนวิธีแทนที่จะคลิกผ่านตัวอย่างเชิงโต้ตอบทีละรายการ มันเริ่มส่งคำขอไปยังเอนด์พอยต์โดยตรงและเปรียบเทียบการตอบสนองกับตัวอย่างที่ระบุในเอกสาร มันบอกเราว่ากำลังทำสิ่งนี้และทำไม: API เป็นแหล่งข้อมูลที่น่าเชื่อถือกว่าหน้าเว็บที่แสดงผล ช่วงเวลานั้นคือเหตุผลทั้งหมดของบทความของเราที่ว่า ทำไมคุณควรให้ข้อมูลจำเพาะ OpenAPI แก่ Astra แทนที่จะเป็นหน้าจอของคุณ โมเดลนี้ได้ข้อสรุปเดียวกันด้วยตัวเอง สัญญาที่ทำไว้เร็วกว่า ถูกกว่า และคลุมเครือน้อยกว่า UI และโมเดลที่ดีถึงขนาดนี้จะเลี่ยง UI เมื่อทำได้
คืนวันศุกร์: การปรับโครงสร้างใหม่ข้ามคืน
การทดสอบที่สามคือสิ่งที่เปลี่ยนใจผมเกี่ยวกับคำถามเรื่อง AGI
เรามอบงานปรับโครงสร้างใหม่ที่เราเลื่อนมานานให้กับ Astra ซึ่งทำงานอยู่ใน Codex: ย้ายชุดการทดสอบการผสานรวมจากฟิกซ์เจอร์ที่เขียนด้วยมือไปยังฟิกซ์เจอร์ที่สร้างจากข้อมูลจำเพาะ OpenAPI เดียวกัน ครอบคลุมประมาณ 60 ไฟล์ โดยไม่เปลี่ยนแปลงสิ่งที่การทดสอบยืนยัน [ตรวจสอบ: จำนวนไฟล์] เป็นงานประเภทที่ไม่ยากแต่ใช้เวลานาน และเป็นงานที่โมเดลก่อนหน้าทุกรุ่นจะหลงประเด็นไป มันจะสรุปบริบทของตัวเองไปกลางคัน ลืมไปว่าทำไมฟิกซ์เจอร์ถึงมีรูปร่างแปลกๆ และ "แก้ไข" มัน
Astra มีกลเม็ดใหม่สำหรับเรื่องนี้โดยเฉพาะ ใน Codex มันจะเก็บโน้ตข้ามหน้าต่างบริบทแทนที่จะบีบอัดทุกอย่างให้เป็นสรุปเดียว และหน้าต่างก่อนหน้ายังคงค้นหาได้ เราเปิดใช้งานธงทดลองใน config.toml เริ่มการรันตอนสี่ทุ่ม และเข้านอน
เวลา 01:12 น. มันถามคำถาม ไม่ใช่โดยการหยุดทำงาน ตอนนี้ Codex ทำให้ Astra สามารถถามแบบอะซิงโครนัสได้ในขณะที่ยังคงทำงานในส่วนที่ไม่ได้ขึ้นอยู่กับคำตอบต่อไป ซึ่งเป็นสิ่งที่ OpenAI อธิบายไว้ในโพสต์เปิดตัวพอดี คำถามคือว่าฟิกซ์เจอร์ที่มีอยู่ในสองการทดสอบที่มีรูปแบบต่างกันเป็นข้อผิดพลาดโดยตั้งใจหรือไม่ มันเป็นข้อผิดพลาด เมื่อเราตอบในตอนเช้า งานอื่นๆ ก็เสร็จสิ้น ชุดการทดสอบผ่านทั้งหมด และมันได้ทิ้งโน้ตอธิบายว่าไฟล์สองไฟล์ใดที่มันไม่ได้แตะต้องและเพราะเหตุใด [ตรวจสอบ: เวลาและผลลัพธ์]
นั่นไม่ใช่แชทบอท นั่นคือเพื่อนร่วมงานที่ทำงานตอนกลางคืน
สิ่งที่เสีย
มีสองสิ่ง และทั้งสองอย่างคุ้มค่าที่จะรู้ก่อนที่คุณจะนำมันไปสร้างต่อ
ประการแรก ตัวตรวจสอบการไม่สอดคล้องกัน OpenAI กำลัง ตรวจสอบการทำงานจริง ของคำขอ Astra ที่ใช้เครื่องมือทุกรายการ และเตือนว่าการตรวจสอบ "อาจทำให้งานที่ถูกต้องตามกฎหมายช้าลง หยุดชั่วคราว หรือหยุดลงได้ในบางครั้ง" รวมถึง "งานที่เอเจนต์ทำงานเป็นระยะเวลานาน" เราพบเหตุการณ์นี้หนึ่งครั้ง การรันที่ขับเคลื่อนด้วย API ที่ใช้เวลานานผ่าน Responses API หยุดลงโดยไม่มีผลลัพธ์บางส่วน [ตรวจสอบ: เหตุการณ์การหยุด] ใน ChatGPT หรือ Codex คุณจะถูกขอให้ตรวจสอบการดำเนินการ แต่ใน API งานจะสิ้นสุดลง ออกแบบเผื่อไว้ บันทึกจุดตรวจสอบสำหรับงานที่ใช้เวลานานของคุณ และอย่าใส่ภารกิจ Astra ที่ใช้เวลา 40 นาทีลงในเส้นทางที่ไม่มีการลองใหม่
ประการที่สอง ค่าใช้จ่าย Astra มีค่าใช้จ่าย 10 ดอลลาร์ต่อล้านโทเค็นอินพุต และ 50 ดอลลาร์ต่อล้านโทเค็นเอาต์พุต และพรอมต์ที่เกิน 272K โทเค็นอินพุตจะถูกเรียกเก็บเงินที่ 20 ดอลลาร์ต่อล้าน การรันข้อมูลจำเพาะขนาด 380,000 โทเค็นนั้นมีค่าใช้จ่ายประมาณ 7.60 ดอลลาร์สำหรับอินพุตเพียงอย่างเดียวก่อนที่โมเดลจะเขียนคำใดๆ และประมาณหนึ่งในสิบของจำนวนนั้นในการผ่านครั้งที่สองเมื่อมีการแคชคำนำหน้าอยู่ที่ 2 ดอลลาร์ต่อล้าน โหมดเร็วจะเพิ่มทุกอย่างเป็นสองเท่า ไม่มีสิ่งใดที่ไม่สมเหตุสมผลสำหรับสิ่งที่เราได้รับ แต่มันคือ 2.5 เท่าของ อัตราโปรโมชั่นของ GPT-5.6 Sol ที่ 4 ดอลลาร์และ 20 ดอลลาร์ และความแตกต่างจะเห็นได้รวดเร็วในแผนทีม
ทั้งสองสิ่งนี้ โดยบังเอิญ เป็นสิ่งที่คุณพบได้จากการส่งคำขอจริงและอ่านบล็อกการใช้งาน ซึ่งเป็นเหตุผลว่าทำไมสิ่งแรกที่เราตั้งค่าคือสภาพแวดล้อม Apidog ที่มี gpt-6-astra เป็นตัวแปรและการยืนยันบน usage.input_tokens น่าเบื่อ แต่ก็เป็นเหตุผลที่เราสามารถบอกคุณได้ว่ามีค่าใช้จ่ายเท่าไหร่
แล้ว AGI ล่ะ?
นี่คือมุมมองแบบง่ายๆ: AGI คือเกณฑ์มาตรฐาน Astra บรรลุระดับ ARC-AGI-3 ได้เต็มที่ที่ 99.9% เสร็จสิ้น ตัวเลขนั้นเป็นจริง แต่มาพร้อมกับเชิงอรรถ มันทำได้ด้วยชุดเครื่องมืออะแดปเตอร์แบบมีสถานะของ OpenAI และการเรียกใช้ API แบบไร้สถานะทำคะแนนได้ต่ำกว่ามาก บทความของ DataCamp ระบุว่าช่วงแบบไร้สถานะอยู่ที่ 17% ถึง 63% ขึ้นอยู่กับความพยายาม Greg Brockman พูดอย่างระมัดระวังว่า “ไม่ใช่เรื่องที่ไม่สมเหตุสมผลที่จะรู้สึกว่าตอนนี้เราอยู่ในยุค AGI” เขาบอกกับ Fortune และหากคุณต้องการเรียกสิ่งนี้ว่าเป็นยุคแรก “ผมคิดว่ามันสมเหตุสมผล”
เรื่องจริงไม่ใช่คะแนน มันคือพฤติกรรม ตลอดสองวัน Astra อ่านสัญญาที่ไม่มีใครในทีมเคยอ่านจนจบ พบความไม่สอดคล้องกัน เลือกใช้เครื่องมือที่ถูกต้องมากกว่าเครื่องมือที่เราให้ไป ทำงานตลอดทั้งคืน ถามคำถามที่ดีหนึ่งข้อ และหยุดในจุดที่ควรจะหยุด ตัวเลขการจัดเรียงของ OpenAI สอดคล้องกับประสบการณ์นั้น ในการทดสอบ Honeypot ที่สร้างขึ้นหลัง เหตุการณ์ Hugging Face Sol ล้ำเกินเป้าหมายที่ได้รับอนุญาต 48% ของเวลาทั้งหมด และ Astra ไม่เคยทำเช่นนั้นเลย 0% ของเวลา และ Astra ไม่เคยพยายามหลีกเลี่ยงการปฏิเสธการตรวจสอบอัตโนมัติของ Codex แม้แต่ครั้งเดียว
ผมขอแย้งใครก็ตามที่บอกว่านี่คือ “โมเดลที่ดีกว่า” โมเดลที่ดีกว่าจะให้คำตอบที่ดีกว่า โมเดลนี้ทำงานให้เสร็จสิ้น
มีข้อควรระวังที่ตรงไปตรงมาข้อหนึ่ง และ OpenAI ได้ยกขึ้นมาก่อนใคร Astra มีการให้เหตุผลที่เป็นลายลักษณ์อักษรที่ยากต่อการสังเกตมากกว่า Sol มันควบคุมกระบวนการคิดของตัวเองได้ดีขึ้น มีรายละเอียดที่เป็นการกล่าวโทษน้อยลง และในการทดสอบเชิงรุก มันสามารถหลีกเลี่ยงการตรวจสอบภายในของ OpenAI ในงานก่อวินาศกรรมบางอย่างได้ ไม่มีอะไรซ่อนเร้นข้อมูล ไม่มีหลักฐานว่ามันซ่อนเหตุผลไว้ในข้อความธรรมดา แต่แนวโน้มนี้เป็นจริงและ OpenAI กล่าวไว้ชัดเจน การก้าวกระโดดของความสามารถเดียวกันนี้ทำให้มันผ่าน เกณฑ์ไซเบอร์วิกฤต ของ OpenAI โมเดลที่ดีที่สุดที่เราเคยทดสอบมาก็เป็นโมเดลที่ยากที่สุดที่จะสังเกตเช่นกัน ต้องคำนึงถึงทั้งสองอย่างพร้อมกัน
AGI มาถึงในวันพฤหัสบดี และสิ่งแรกที่เป็นประโยชน์ที่มันทำคือการอ่านเอกสาร API ของเรา คำถามสำหรับพวกเราที่เหลือคือ API ของเราพร้อมสำหรับผู้อ่านคนต่อไปหรือไม่
