หากคุณได้ย้ายเวิร์กโหลดของเอเจนต์ไปใช้ GPT-6 Astra ในช่วงต้นเดือนกันยายน ตอนนี้คุณก็มีใบแจ้งหนี้สามสัปดาห์แล้ว และคุณก็รู้แล้วว่าปัญหาคืออะไร Astra คิดค่าบริการ 10 ดอลลาร์ต่ออินพุตโทเค็นหนึ่งล้าน และ 50 ดอลลาร์ต่อเอาต์พุตหนึ่งล้าน ลูปที่ทำงานยาวนานพร้อม system prompt ขนาดใหญ่และ tool schema ที่แนบมาจะใช้เงินหมดเร็วกว่าที่สเปรดชีตใดๆ คาดการณ์ไว้
เมื่อวันที่ 22 กันยายน OpenAI ได้เปิดตัว GPT-6 Sol ในราคา 2 ดอลลาร์และ 10 ดอลลาร์ เป็นโมเดลตระกูลเดียวกัน, API อินเทอร์เฟซเดียวกัน, แต่ราคาถูกลงห้าเท่าในทุกรายการของบิล
นี่คือการย้ายระบบ สิ่งที่เปลี่ยนไปในโค้ดของคุณแทบจะไม่มี สิ่งที่เปลี่ยนไปในบิลของคุณคือทุกสิ่ง และส่วนที่สื่อส่วนใหญ่ในวันเปิดตัวมองข้ามไป: OpenAI ยังคงกล่าวว่า Astra เป็นโมเดลที่ดีกว่า และการเปรียบเทียบแบบตัวต่อตัวที่เผยแพร่ไประหว่างสองโมเดลนี้ก็ไม่ใช่การเปรียบเทียบอย่างที่เห็น
สรุปสั้นๆ
- การเปลี่ยนจาก
gpt-6-astraเป็นgpt-6-solคือการสลับชื่อโมเดลสำหรับผู้เรียกส่วนใหญ่ Context window, เอาต์พุตสูงสุด, endpoints, เครื่องมือในตัว, คุณสมบัติที่รองรับ และระดับการจำกัดอัตรา (rate-limit tiers) เหมือนกันทุกประการ - ทุกอัตราลดลง 5 เท่าพอดี: อินพุตจาก 10 ดอลลาร์เป็น 2 ดอลลาร์, อินพุตที่แคชไว้จาก 1 ดอลลาร์เป็น 0.20 ดอลลาร์, การเขียนแคชจาก 12.50 ดอลลาร์เป็น 2.50 ดอลลาร์, เอาต์พุตจาก 50 ดอลลาร์เป็น 10 ดอลลาร์ บิลของคุณจะลดลงเหลือหนึ่งในห้าไม่ว่าสัดส่วนโทเค็นของคุณจะเป็นอย่างไร
- Sol เพิ่มระดับ
noneสำหรับความพยายามในการให้เหตุผล (reasoning effort) นอกจากนี้ยังจำกัดการเรียกใช้ฟังก์ชัน (function calling) ของ Chat Completions ให้ใช้ได้เฉพาะเมื่อreasoning_effort: "none"เท่านั้น ซึ่งเป็นการเปลี่ยนแปลงเดียวที่อาจทำให้การเชื่อมต่อที่ทำงานอยู่เดิมหยุดชะงักได้ - วันที่ตัดข้อมูลความรู้ของ Sol คือ 20 เมษายน 2026 ส่วนของ Astra คือ 30 เมษายน 2026
- OpenAI กล่าวว่า Astra “ยังคงเป็นโมเดลที่ดีที่สุดของเราในทุกด้าน” การทดสอบเปรียบเทียบ Sol กับ Astra ที่เผยแพร่ออกมานั้น รัน Astra ที่
lowเทียบกับ Sol ที่xhighดังนั้นจึงเป็นการวัดประสิทธิภาพด้านต้นทุน ไม่ใช่ความสามารถสูงสุด
ตารางราคา
อัตราทั้งสองชุดมาจากหน้าโมเดลของ OpenAI คือ gpt-6-astra และ gpt-6-sol ซึ่งอ่านเมื่อวันที่ 23 กันยายน 2026
| ตัวชี้วัด, ต่อ 1 ล้านโทเค็น | GPT-6 Astra | GPT-6 Sol | การเปลี่ยนแปลง |
|---|---|---|---|
| อินพุต | $10 | $2 | ถูกลง 5 เท่า |
| อินพุตที่แคชไว้ | $1 | $0.20 | ถูกลง 5 เท่า |
| การเขียนแคช | $12.50 | $2.50 | ถูกลง 5 เท่า |
| เอาต์พุต | $50 | $10 | ถูกลง 5 เท่า |
ตัวปรับอัตราการเรียกเก็บเงินตรงกันในโมเดลทั้งสอง พรอมต์ที่ใช้อินพุตโทเค็นเกิน 272K จะถูกเรียกเก็บเงินในอัตรา 2 เท่าของอินพุตและแคช และ 1.5 เท่าของเอาต์พุตสำหรับคำขอทั้งหมด โหมด Batch และ Flex มีราคาครึ่งหนึ่ง โหมดเร็วคิดราคาเป็นสองเท่า และบน Astra ไม่มี SLA สำหรับความหน่วงเวลา

เนื่องจากอัตราทั้งสี่ลดลงด้วยปัจจัยเดียวกัน คุณไม่จำเป็นต้องสร้างแบบจำลองสัดส่วนโทเค็นของคุณเพื่อคาดการณ์การประหยัด ลองพิจารณาเวิร์กโหลดของเอเจนต์ที่ชัดเจน: 10,000 คำขอต่อวัน แต่ละคำขอมี cached prefix 30,000 โทเค็น, อินพุตใหม่ 10,000 โทเค็น และเอาต์พุต 3,000 โทเค็น
| ส่วนประกอบ | โทเค็นต่อวัน | Astra | Sol |
|---|---|---|---|
| อินพุตที่แคชไว้ | 300 ล้าน | $300 | $60 |
| อินพุตใหม่ | 100 ล้าน | $1,000 | $200 |
| เอาต์พุต | 30 ล้าน | $1,500 | $300 |
| รวมทั้งหมด | $2,800 | $560 |
ไม่ว่าคุณจะปรับสัดส่วนไปทางเอาต์พุต, ไปทางแคช, รันที่ 272K context และจ่ายค่าตัวคูณสำหรับพรอมต์ยาว: อัตราส่วนก็ยังคงอยู่ที่ห้า
เพื่อให้เห็นภาพว่าทำไมสิ่งนี้ถึงสำคัญ OpenAI รายงานว่านักวิจัยของตนเองโดยเฉลี่ยใช้จ่ายมากกว่า 600 ดอลลาร์ต่อวันกับ coding agents โดยผู้ที่อยู่ในเปอร์เซ็นไทล์ที่ 90 ใช้จ่าย 7,000 ดอลลาร์ต่อวัน หารตัวเลขเหล่านั้นด้วยห้า แล้วจำนวนการทดลองที่ทีมสามารถทำได้ก็จะเปลี่ยนไป บริบทที่กว้างขึ้นสำหรับการเปิดตัวทั้งสองนี้อยู่ใน การวิเคราะห์สงครามราคาโมเดลเดือนกันยายน 2026 ของเรา
ข้อจำกัดประการหนึ่งที่ต้องจำไว้: OpenAI อธิบายว่า Sol ถูกกว่า GPT-5.6 ถึง 50% และการเปรียบเทียบนี้เทียบกับราคาโปรโมชันของ GPT-5.6 ซึ่งเป็นคำกล่าวของ OpenAI เอง เมื่อเทียบกับราคาปกติของ GPT-5.6 ที่เราได้บันทึกไว้ในขณะนั้นใน โพสต์ราคา GPT-5.6 ของเรา การลดราคานั้นยิ่งใหญ่กว่า เมื่อเทียบกับ Astra แล้ว ราคาลดลง 5 เท่าตรงๆ
สิ่งที่ยังคงเหมือนเดิมทุกประการ
นี่คือส่วนที่ทำให้การย้ายระบบมีราคาถูก
| GPT-6 Astra | GPT-6 Sol | |
|---|---|---|
| ID โมเดล | gpt-6-astra |
gpt-6-sol |
| Context window | 1,050,000 | 1,050,000 |
| โทเค็นอินพุตสูงสุด | 922,000 | 922,000 |
| โทเค็นเอาต์พุตสูงสุด | 128,000 | 128,000 |
| รูปแบบ (Modalities) | ข้อความ, รูปภาพ (อินพุต); ข้อความ (เอาต์พุต) | ข้อความ, รูปภาพ (อินพุต); ข้อความ (เอาต์พุต) |
| Endpoints | Chat Completions, Responses, Batch | Chat Completions, Responses, Batch |
| ไม่รองรับ | Realtime, Assistants, fine-tuning, embeddings, audio | เหมือนกัน |
| เครื่องมือในตัว | web search, file search, image generation, code interpreter, hosted shell, apply patch, skills, computer use, MCP, tool search | รายการเดียวกัน |
| คุณสมบัติ | streaming, structured outputs, function calling, file search, image input, web search, prompt caching | รายการเดียวกัน |
| การจำกัดอัตรา Tier 5 | 15,000 RPM, 40M TPM | 15,000 RPM, 40M TPM |
| สแนปช็อต | gpt-6-astra |
gpt-6-sol |
Context window คือหัวใจสำคัญ Sol ไม่ใช่โมเดลที่มี context สั้นลง: มี window 1,050,000 โทเค็น และอินพุตสูงสุด 922,000 โทเค็นเท่ากับ Astra ไม่มีอะไรเกี่ยวกับการแบ่งส่วนข้อมูล, งบประมาณการดึงข้อมูล หรือกลยุทธ์การบีบอัดข้อมูลของคุณที่จะต้องเปลี่ยนแปลง
สิ่งที่เปลี่ยนแปลงจริงในโค้ดของคุณ
สี่ประการตามลำดับที่น่าจะส่งผลกระทบ
1. การเรียกใช้ฟังก์ชัน Chat Completions บน Astra, Chat Completions ทำงานได้ และการเรียกใช้เครื่องมือต้องใช้ Responses API บน Sol, Chat Completions รองรับการเรียกใช้ฟังก์ชันได้เฉพาะเมื่อ reasoning_effort เป็น "none" เท่านั้น หากคุณกำลังเรียกใช้เครื่องมือผ่าน Chat Completions ด้วยความพยายามอื่นใด คำขอนั้นจะหยุดทำงานเหมือนเดิม คู่มือ GPT-6 ของ OpenAI เองก็ระบุให้ใช้ Responses สำหรับการให้เหตุผลด้วยเครื่องมือ หากคุณใช้ Responses อยู่แล้ว ข้อนี้ก็ไม่มีค่าใช้จ่ายสำหรับคุณ
2. ระดับความพยายาม none Astra รองรับตั้งแต่ low ไปจนถึง max Sol รองรับทั้งหมดนั้น รวมถึง none ซึ่งเป็นกลไกที่ทำให้ Sol เหมาะสำหรับงานการจัดหมวดหมู่และการแยกข้อมูลที่โทเค็นการให้เหตุผลเป็นเพียงค่าใช้จ่ายเพิ่มเติม ค่าเริ่มต้นสำหรับทั้งสองคือ medium
3. วันที่ตัดข้อมูลความรู้ Astra ได้รับการฝึกฝนถึงวันที่ 30 เมษายน 2026 ส่วน Sol ถึงวันที่ 20 เมษายน 2026 สิบวันเป็นช่วงเวลาสั้นๆ แต่หากพรอมต์ของคุณอาศัยความรู้จากปลายเดือนเมษายน ให้ทดสอบข้อสมมตินั้น
4. พารามิเตอร์ที่ไม่รองรับ เมื่อใดก็ตามที่ความพยายามในการให้เหตุผลไม่ใช่ none พารามิเตอร์ temperature, top_p และ top_logprobs จะต้องไม่มีอยู่ และ Chat Completions ก็ไม่รองรับ logprobs ด้วย Astra บังคับใช้กฎเดียวกัน ดังนั้นการเชื่อมต่อ Astra ที่ถูกต้องอยู่แล้วจึงเป็นไปตามข้อกำหนด สิ่งนี้สำคัญก็ต่อเมื่อคุณย้ายไปใช้ reasoning_effort: "none" บน Sol และพิจารณาที่จะใส่ temperature กลับไป
นี่คือตัวอย่างก่อนและหลังสำหรับการเรียก Responses ทั่วไป ความแตกต่างคือบรรทัดเดียว
from openai import OpenAI
client = OpenAI()
response = client.responses.create(
- model="gpt-6-astra",
+ model="gpt-6-sol",
reasoning={"effort": "xhigh"},
tools=[{"type": "function", "name": "run_api_test", "parameters": {...}}],
input=[
{"role": "developer", "content": "You are a senior API engineer. Bias towards action."},
{"role": "user", "content": "Read this OpenAPI operation and propose three negative test cases."},
],
)
สังเกตระดับความพยายามในตัวอย่างนั้น การย้ายไป Sol และคงความพยายามเท่าเดิมไม่ใช่การย้ายระบบที่น่าสนใจ การย้ายไป Sol และเพิ่มความพยายามขึ้นต่างหากที่น่าสนใจ เพราะคุณมีงบประมาณเพิ่มขึ้นห้าเท่าเพื่อใช้กับโทเค็นการให้เหตุผลด้วยเงินจำนวนเท่าเดิม
สิ่งที่คุณต้องแลก
โปรดซื่อสัตย์กับส่วนนี้ เพราะตัวเลขการเปิดตัวนั้นตีความผิดได้ง่าย
OpenAI กล่าวว่า Astra ยังคงเป็นโมเดลที่ดีกว่า โพสต์เปิดตัวระบุว่า Astra “ยังคงเป็นโมเดลที่ดีที่สุดของเราในทุกด้าน” นั่นคือการนำเสนอผลิตภัณฑ์ใหม่ของ OpenAI เอง และเป็นประโยคที่ควรใช้อ้างถึงใครก็ตามที่บอกว่า Sol มาแทนที่ Astra
การเปรียบเทียบแบบตัวต่อตัวที่เผยแพร่ออกมาไม่ใช่การเปรียบเทียบความสามารถ บน AutomationBench 1.0.6, Sol ที่ xhigh ได้คะแนน 33.2% ด้วยต้นทุน 0.27 ดอลลาร์ต่อภารกิจ และ Astra ที่ low ได้คะแนน 30.3% ด้วยต้นทุน 3.9 เท่าของ Sol ต่อภารกิจ โปรดอ่านระดับความพยายาม Sol ถูกปรับสูงสุด ส่วน Astra ถูกปรับต่ำสุด สิ่งที่การจับคู่นี้แสดงให้เห็นคือ ความสามารถสูงสุดของ Sol เหนือกว่าความสามารถต่ำสุดของ Astra ด้วยต้นทุนประมาณหนึ่งในสี่ต่อภารกิจ ซึ่งเป็นผลลัพธ์ที่มีประโยชน์และเป็นจริง ไม่ได้กล่าวถึง Sol ที่ xhigh เทียบกับ Astra ที่ max ไม่มีตัวเลขที่เผยแพร่ออกมาสำหรับการเปรียบเทียบนั้น หากเวิร์กโหลดของคุณเป็นงานที่ Astra ด้วยความพยายามสูงเป็นสิ่งที่ทำให้มันทำงานได้ในที่สุด Sol คือการทดสอบ ไม่ใช่การแทนที่
ความหน่วงเวลาที่ระดับสูงสุด Artificial Analysis วัดรุ่น GPT-6 Sol ที่มีการให้เหตุผลสูงสุด (max-reasoning variant) ได้ 115.2 โทเค็นเอาต์พุตต่อวินาที โดยมีเวลาถึงโทเค็นแรก 102.15 วินาที ตัวเลขนี้มาจากบุคคลที่สาม ไม่ใช่จาก OpenAI และอธิบายเฉพาะรุ่น max ดังนั้นจึงไม่ได้บอกคุณว่า medium หรือ none ทำอะไรได้บ้าง ถือเป็นคำเตือนว่าโมเดลราคาถูกไม่ได้หมายความว่าเป็นโมเดลที่เร็วโดยอัตโนมัติเมื่อใช้ความพยายามสูง และควรวัดระดับความพยายามของคุณเองแทนที่จะใช้ตัวเลขที่ให้มา
ความพร้อมใช้งาน Sol พร้อมใช้งานสำหรับ ChatGPT Work และ Codex สำหรับผู้ใช้ Plus, Pro, Business, Enterprise และ Edu แต่ยังไม่พร้อมใช้งานใน Chat API พร้อมแล้ว; แต่หน้าต่าง Chat ยังไม่พร้อม
สำหรับสิ่งที่ Astra ทำซึ่งสมควรเก็บไว้ในสแต็กของคุณ การทดสอบภาคปฏิบัติสองวันของเรา, บทความเกี่ยวกับการใช้งานคอมพิวเตอร์ และ คำอธิบาย Critical cyber threshold ทั้งหมดนี้ยังคงใช้ได้ และข้อมูลจำเพาะฉบับเต็มอยู่ใน คู่มือ API ของ GPT-6 Astra ของเรา
ตัดสินใจด้วยคำขอของคุณเอง ไม่ใช่ด้วยเกณฑ์มาตรฐาน
AutomationBench ไม่ได้รันพรอมต์ของคุณ การเปรียบเทียบเดียวที่จะยืนยันการย้ายระบบได้คือการใช้ชุดคำขอเดียวกัน ส่งไปยัง ID โมเดลทั้งสอง และให้คะแนนตามเกณฑ์ของคุณเอง ตั้งค่านี้เพียงครั้งเดียวก็จะคุ้มค่าในทุกการเปิดตัวในอนาคต ใน Apidog ให้ใส่ ID โมเดลในตัวแปรสภาพแวดล้อม, บันทึกคำขอหนึ่งครั้ง, แล้วสลับสภาพแวดล้อมเพื่อกำหนดเป้าหมายใหม่:
{
"model": "{{MODEL_ID}}",
"reasoning": { "effort": "xhigh" },
"input": [
{ "role": "user", "content": "{{TEST_PROMPT}}" }
]
}
สร้างสถานการณ์ทดสอบจากพรอมต์การผลิตจริง 20 หรือ 30 รายการ เพิ่มการยืนยันสำหรับรูปแบบการตอบสนองที่ parser ของคุณต้องการ (output_text มีอยู่, อาร์กิวเมนต์การเรียกใช้เครื่องมือถูกต้องตาม JSON Schema ของคุณ, ไม่มีการตัดทอนที่ max_output_tokens) จากนั้นรันสองครั้ง ครั้งละหนึ่งสภาพแวดล้อม Apidog จะบันทึกเนื้อหาและเวลาที่ใช้ไปสำหรับทุกคำขอ ดังนั้นคุณจะได้เห็นความถูกต้องและความหน่วงเวลาเคียงข้างกันโดยไม่ต้องเขียนโปรแกรมทดสอบ บล็อก usage ในแต่ละการตอบสนองจะให้จำนวนโทเค็นแก่คุณเพื่อประเมินราคาการเปรียบเทียบได้อย่างถูกต้อง
มีสองข้อที่ควรเพิ่มสำหรับการยืนยันในการย้ายระบบนี้โดยเฉพาะ: ตรวจสอบว่าการเรียกใช้เครื่องมือยังคงมาถึงหรือไม่หากคุณใช้ Chat Completions อยู่ และตัดสินจากพรอมต์ที่ช้าที่สุดของคุณ แทนที่จะเป็นพรอมต์เฉลี่ย เพราะความเสี่ยงด้านความหน่วงเวลาจะเกิดขึ้นเมื่อใช้ความพยายามสูงกับอินพุตที่ยาว
รายการตรวจสอบการย้ายระบบ
- ยืนยันว่าคุณใช้ Responses API ในทุกที่ที่คุณเรียกใช้เครื่องมือ หากคุณเรียกใช้เครื่องมือผ่าน Chat Completions ให้ย้ายก่อนเปลี่ยนโมเดล
- สลับ
gpt-6-astraเป็นgpt-6-solและปล่อยทุกอย่างไว้ตามเดิมสำหรับการรันครั้งแรก - รันชุดทดสอบ regression ของคุณซ้ำกับ ID ทั้งสอง และเปรียบเทียบความแตกต่างของเอาต์พุต ไม่ใช่แค่รหัสสถานะ
- ลองเพิ่มระดับความพยายามในการให้เหตุผลบน Sol ขึ้นอีกหนึ่งระดับ ตอนนี้คุณมีงบประมาณสำหรับสิ่งนั้นแล้ว
- ตรวจสอบพรอมต์ใดๆ ที่ต้องอาศัยความรู้จากปลายเดือนเมษายน 2026 อีกครั้ง
- เก็บเส้นทาง Astra ไว้เบื้องหลังแฟล็กสำหรับงานที่ความสามารถสูงสุดคือสิ่งที่คุณจ่ายไป
บทสรุป
การย้ายจาก Astra ไป Sol เป็นการย้ายระบบที่ไม่ค่อยพบเห็นบ่อยนักที่ API อินเทอร์เฟซไม่เปลี่ยนแปลง, context window ไม่ลดขนาดลง, และราคาลดลงด้วยปัจจัยคงที่ในทุกส่วน งานที่ต้องทำไม่ได้อยู่ในโค้ด แต่มันอยู่ในพรอมต์ยี่สิบรายการที่คุณจะรันผ่านโมเดลทั้งสองเพื่อค้นหาว่างานที่ยากที่สุดของคุณนั้นใช้ความสามารถสูงสุดของ Astra หรือแค่จ่ายเงินไปโดยเปล่าประโยชน์
ทำการเปรียบเทียบนั้นก่อนที่คุณจะเปลี่ยนแฟล็ก และให้ประโยคของ OpenAI เองอยู่ในใจขณะที่คุณอ่านผลลัพธ์: Astra ยังคงเป็นโมเดลที่ดีที่สุดของพวกเขา Sol เป็นโมเดลที่คุณสามารถจ่ายได้เพื่อปล่อยให้มันทำงานต่อไป
