วิธีใช้ DeepSeek V4 Pro 0813 API

DeepSeek V4 Pro พร้อมใช้งานทั่วไปแล้วในรุ่น 0813 เรียกใช้ DeepSeek-V4-Pro API ด้วย Python: การตั้งค่า, โหมดการคิดพร้อมเนื้อหาการให้เหตุผล, การสตรีม, การเรียกใช้เครื่องมือ และประหยัดการแคชพรอมต์ได้ถึง 120 เท่า

@apidog

@apidog

13 August 2026

วิธีใช้ DeepSeek V4 Pro 0813 API

Apidog สำหรับองค์กร

การติดตั้งแบบ On-Premises

SSO & RBAC

รองรับมาตรฐาน SOC 2

สำรวจ Apidog Enterprise

DeepSeek V4 Pro ออกจากการทดลองใช้งานเมื่อวันที่ 12 สิงหาคม 2026. รุ่น GA ที่ประทับตรา 0813 ได้เปิดให้บริการที่ปลายทาง API deepseek-v4-pro และมาพร้อมกับตัวเลขที่ดูเหมือนผิดพลาด: หน้าต่างบริบทขนาด 1M-token, เอาต์พุตสูงสุด 384K โทเค็น, และราคาอินพุตที่ลดลงเหลือ $0.003625 ต่อล้านโทเค็นเมื่อมีการเรียกใช้แคชสำเร็จ. ตามที่ Unite.AI รายงาน โมเดลที่ใช้เวลาสี่เดือนในการทดลองใช้งานขณะนี้เป็นโมเดลหลักของ DeepSeek.

ข่าวการเปิดตัวจะบอกคุณว่ามีอะไรออกมาบ้าง ไม่ใช่ว่าจะเรียกใช้งานอย่างไร. คู่มือนี้ครอบคลุมส่วนปฏิบัติจริง: การร้องขอครั้งแรกด้วย OpenAI SDK, โหมดการคิดและฟิลด์ reasoning_content, การสตรีม, การเรียกใช้เครื่องมือ, และการคำนวณแคชพร้อมต์ที่ตัดสินว่าบริบท 1M นั้นสามารถจ่ายได้หรือจะทำให้คุณล้มละลาย. หากคุณต้องการเรื่องราวเบื้องหลังสถาปัตยกรรมก่อน, โปรดอ่าน DeepSeek V4 คืออะไร แล้วกลับมา.

สรุป

การเปลี่ยนแปลงที่รุ่น GA build 0813 มีต่อผู้พัฒนา

เวอร์ชันทดลองเปิดตัวในเดือนเมษายน 2026, รุ่นน้อง V4 Flash วางจำหน่ายในเดือนกรกฎาคม, และในวันที่ 12 สิงหาคม โมเดล Pro ได้รับการอัปเกรดเป็นเวอร์ชันทั่วไปในชื่อ build 0813 ตามธรรมเนียมการประทับวันที่ของ DeepSeek (เช่นเดียวกับที่ v3-0324 แสดงถึงสแนปช็อต V3).

สามสิ่งที่จะเปลี่ยนแปลงเมื่อเป็น GA:

  1. สแนปช็อตมีความเสถียร. โมเดลเวอร์ชันทดลองอาจเปลี่ยนแปลงได้ตลอดเวลา ซึ่งจะทำให้การประเมินและการปรับแต่งพร้อมต์ใช้งานไม่ได้. Build 0813 เป็นเป้าหมายที่คงที่จนกว่า DeepSeek จะประกาศสแนปช็อตใหม่.
  2. ปลายทางคือชื่อแทนสำหรับการใช้งานจริง. บน API อย่างเป็นทางการ คุณจะเรียกใช้ deepseek-v4-pro และได้ build 0813; หากต้องการระบุสแนปช็อตอย่างชัดเจน, OpenRouter ระบุว่าเป็น deepseek/deepseek-v4-pro-0813.
  3. ฟังก์ชันทั้งหมดพร้อมใช้งานแล้ว. โหมดการคิด, การเรียกใช้ฟังก์ชัน, เอาต์พุตที่มีโครงสร้าง, การแคชพร้อมต์, และ API หลายรูปแบบ (OpenAI, Anthropic, Responses) ทั้งหมดนี้ใช้งานได้แล้วบนปลายทาง GA.

ภายใต้การทำงาน, V4 Pro เป็นโมเดลแบบผสมผสานผู้เชี่ยวชาญ (mixture-of-experts) ที่มีพารามิเตอร์ทั้งหมด 1.6 ล้านล้าน และ 49 พันล้านพารามิเตอร์ที่ใช้งานต่อโทเค็น. เรื่องราวทางวิศวกรรมที่สำคัญคือประสิทธิภาพ: แผนการทำงานของกลไกความสนใจสองแบบ, Compressed Sparse Attention และ Heavily Compressed Attention, ช่วยลดการคำนวณการอนุมานแบบโทเค็นเดี่ยวลงเหลือ 27% ของ V3.2 และแคช KV เหลือ 10%. การลดแคช KV นี้คือสิ่งที่ทำให้บริบท 1M-token สามารถให้บริการได้ในราคาเหล่านี้ ไม่ใช่เพียงแค่ฟังก์ชันสาธิต.

DeepSeek V4 Pro 0813: ข้อมูลจำเพาะโดยย่อ

คุณสมบัติ DeepSeek V4 Pro 0813
การเปิดตัว GA เมื่อวันที่ 12 สิงหาคม 2026 (สแนปช็อต 0813)
สถาปัตยกรรม Mixture-of-experts, พารามิเตอร์รวม 1.6 ล้านล้าน, 49 พันล้านที่ใช้งานต่อโทเค็น
กลไกความสนใจ Compressed Sparse Attention + Heavily Compressed Attention
ต้นทุนการอนุมานเทียบกับ V3.2 27% ของการคำนวณแบบโทเค็นเดี่ยว, 10% ของแคช KV
หน้าต่างบริบท 1,000,000 โทเค็น
เอาต์พุตสูงสุด 384K โทเค็น
โหมดการคิด non-think, think high, think max
ราคาอินพุต $0.435/M โทเค็น (แคชพลาด), $0.003625/M (แคชสำเร็จ)
ราคาเอาต์พุต $0.87/M โทเค็น
รูปแบบ API OpenAI Chat Completions, Anthropic Messages, DeepSeek Responses
รหัสโมเดล deepseek-v4-pro
รุ่นน้อง deepseek-v4-flash (รวม 284B / ใช้งาน 13B), อินพุต $0.14/M, เอาต์พุต $0.28/M

ในด้านความสามารถ, บัตรโมเดลของ DeepSeek ระบุ SWE-bench Verified ที่ 80.6%, Terminal Bench 2.0 ที่ 67.9%, GPQA Diamond ที่ 90.1%, และ LiveCodeBench ที่ 93.5% สำหรับ V4-Pro-Max ซึ่งเป็นการตั้งค่าการคิดสูงสุด. ตัวเลขเหล่านี้เป็นตัวเลขที่ผู้จำหน่ายรายงานเองและยังไม่มีบุคคลที่สามตรวจสอบ ดังนั้นควรทำการประเมินเฉพาะงานของคุณเองก่อนที่จะย้ายสิ่งสำคัญใดๆ.

รับ API key และส่งคำขอแรกของคุณ

การตั้งค่าใช้เวลาประมาณห้านาที:

  1. สร้างบัญชีบนแพลตฟอร์ม DeepSeek (platform.deepseek.com) และเติมเงิน เนื่องจาก API เป็นแบบเติมเงิน.
  2. เปิด API Keys, สร้างคีย์, และคัดลอกทันที (จะแสดงเพียงครั้งเดียว).
  3. ส่งออกเป็นตัวแปรสภาพแวดล้อมแทนที่จะวางลงในโค้ด:
export DEEPSEEK_API_KEY="sk-..."

API ใช้โปรโตคอล OpenAI Chat Completions ดังนั้นแพ็คเกจ openai มาตรฐานจึงเป็นไคลเอนต์. ทั้ง https://api.deepseek.com และ https://api.deepseek.com/v1 สามารถใช้เป็น URL หลักได้; /v1 คือความเข้ากันได้ของโปรโตคอล ไม่ใช่เวอร์ชันของโมเดล.

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["DEEPSEEK_API_KEY"],
    base_url="https://api.deepseek.com",
)

response = client.chat.completions.create(
    model="deepseek-v4-pro",
    messages=[
        {"role": "system", "content": "You are a concise technical assistant."},
        {"role": "user", "content": "Explain idempotency in REST APIs in two sentences."},
    ],
)

print(response.choices[0].message.content)
print(response.usage)

พิมพ์ response.usage ตั้งแต่วันแรก. ด้วยโมเดลที่ถูกมากเมื่อแคชสำเร็จและแพงมากเมื่อแคช 1M-token พลาด การนับโทเค็นคือความแตกต่างระหว่างความผิดพลาดจากการปัดเศษกับค่าใช้จ่ายจริง.

คำขอเดียวกันผ่าน HTTP ดิบ มีประโยชน์สำหรับการทดสอบเบื้องต้นและการนำเข้าสู่เครื่องมือ API:

curl https://api.deepseek.com/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $DEEPSEEK_API_KEY" \
  -d '{
    "model": "deepseek-v4-pro",
    "messages": [
      {"role": "user", "content": "List three ways to version a REST API."}
    ]
  }'

การอ้างอิงพารามิเตอร์ทั้งหมดอยู่ใน เอกสาร DeepSeek อย่างเป็นทางการ รวมถึงปลายทางที่เข้ากันได้กับ Anthropic (สามารถใช้งานได้จาก Anthropic SDK และ Claude Code โดยไม่ต้องเขียนโค้ดใหม่) และ DeepSeek's Responses API.

การทำงานกับสามโหมดการคิด

V4 Pro เปิดเผยการให้เหตุผลเป็นเหมือนปุ่มปรับแทนที่จะเป็นโมเดลแยกต่างหาก. ปลายทางเดียว, สามโหมด:

โหมดต่างๆ จะแมปเข้ากับพารามิเตอร์ reasoning_effort มาตรฐาน ดังนั้นจึงไม่จำเป็นต้องมีการติดตั้งเพิ่มเติมที่เฉพาะเจาะจงกับผู้จำหน่าย:

response = client.chat.completions.create(
    model="deepseek-v4-pro",
    reasoning_effort="high", # "none" | "high" | "max"
    messages=[
        {"role": "user", "content": "Our API returns 502s under load but only behind the CDN. Walk through likely causes in order of probability."},
    ],
)

message = response.choices[0].message
print("--- Reasoning ---")
print(message.reasoning_content)
print("--- Answer ---")
print(message.content)

ข้อควรทราบในทางปฏิบัติสองประการ. ประการแรก, อย่าส่ง reasoning_content กลับเข้าไปในประวัติการสนทนา; ให้ส่งเฉพาะ content ของการสนทนาก่อนหน้าเท่านั้น. ประการที่สอง, โทเค็นการให้เหตุผลจะถูกเรียกเก็บเงินเป็นโทเค็นเอาต์พุตที่ $0.87/M, ดังนั้นโหมด think max จึงมีค่าใช้จ่ายจริงและมีเวลาแฝงจริง. ควรจับคู่โหมดกับงานแทนที่จะตั้งค่าเป็นสูงสุดโดยอัตโนมัติ.

การสตรีมการตอบสนอง

ด้วยเอาต์พุตสูงสุด 384K และโหมดการคิดที่สามารถให้เหตุผลได้อย่างยาวนาน, การร้องขอแบบไม่สตรีมจะทำให้ผู้ใช้ได้รับประสบการณ์ที่ไม่ดี. ตั้งค่า stream=True และจัดการเดลต้าทั้งสองประเภท, ในโหมดการคิด, ส่วน reasoning_content จะมาถึงก่อน, ตามด้วยคำตอบ:

stream = client.chat.completions.create(
    model="deepseek-v4-pro",
    reasoning_effort="high",
    stream=True,
    messages=[
        {"role": "user", "content": "Design a rate limiter for a public API. Compare token bucket and sliding window."},
    ],
)

for chunk in stream:
    if not chunk.choices:
        continue # final chunk may carry usage data only
    delta = chunk.choices[0].delta
    if getattr(delta, "reasoning_content", None):
        print(delta.reasoning_content, end="", flush=True) # thinking phase
    elif delta.content:
        print(delta.content, end="", flush=True) # answer phase

รูปแบบ UI ที่สมเหตุสมผล: แสดงเฟสการให้เหตุผลแบบยุบตัวเป็นตัวบ่งชี้ "กำลังคิด", จากนั้นเปลี่ยนเป็นการแสดงผลปกติเมื่อ content เดลต้าเริ่มมาถึง. ภายใต้การทำงาน นี่คือเหตุการณ์ที่เซิร์ฟเวอร์ส่งตามมาตรฐาน; คู่มือของเราเกี่ยวกับการ สตรีมการตอบสนอง API ด้วย SSE ครอบคลุมกลไกการทำงาน.

การเรียกใช้เครื่องมือและเอาต์พุตที่มีโครงสร้าง

V4 Pro รองรับการเรียกใช้ฟังก์ชันสไตล์ OpenAI ซึ่งหมายความว่า Agent loops ที่มีอยู่สามารถพอร์ตได้โดยไม่มีการแก้ไข. กำหนดเครื่องมือ, อ่าน tool_calls, ดำเนินการ, เพิ่มผลลัพธ์, ทำซ้ำ:

tools = [{
    "type": "function",
    "function": {
        "name": "get_endpoint_status",
        "description": "Check the health of an internal API endpoint",
        "parameters": {
            "type": "object",
            "properties": {
                "endpoint": {"type": "string", "description": "Path, e.g. /v1/orders"}
            },
            "required": ["endpoint"],
        },
    },
}]

response = client.chat.completions.create(
    model="deepseek-v4-pro",
    messages=[{"role": "user", "content": "Is /v1/orders healthy right now?"}],
    tools=tools,
)

print(response.choices[0].message.tool_calls)

เอาต์พุตที่มีโครงสร้างทำงานผ่านพารามิเตอร์ response_format มาตรฐานเมื่อคุณต้องการ JSON ที่สามารถแยกวิเคราะห์ได้แน่นอน. การอธิบายขั้นตอนการทำงานของ Tool loops แบบหลายขั้นตอนโดยละเอียดสมควรที่จะเป็นบทความแยกต่างหาก; เอกสารทางการ ครอบคลุมรายละเอียดรูปร่างของข้อความ.

เศรษฐศาสตร์การแคชพร้อมต์: ตัวเลขที่เปลี่ยนสถาปัตยกรรมของคุณ

นี่คือคุณสมบัติที่ควรได้รับความสนใจมากกว่าเกณฑ์มาตรฐาน. DeepSeek แคชคำนำหน้าพร้อมต์โดยอัตโนมัติ, ไม่มีส่วนหัว cache-control, ไม่มีการกำหนดค่า TTL, และคำนำหน้าที่ซ้ำกันจะถูกเรียกเก็บเงินที่ $0.003625/M แทนที่จะเป็น $0.435/M. นั่นคือส่วนลด 120 เท่าสำหรับอินพุตที่ API เคยเห็นมาแล้ว.

ลองคำนวณตัวเลขในภาระงานที่สมจริง. สมมติว่าคุณกำลังสร้าง coding agent ที่เก็บบริบทของ repository ขนาด 200K-token และมีการเรียกใช้ 50 ครั้งในหนึ่งเซสชัน:

ในเซสชันเดียวกันนี้, ราคาถูกลงประมาณ 35 เท่า, และสิ่งที่คุณต้องทำคือโครงสร้างพร้อมต์: เนื้อหาคงที่มาก่อน (system prompt, เอกสารประกอบ, บริบทของ repository), เนื้อหาที่เปลี่ยนแปลงได้มาทีหลัง (ข้อความล่าสุดของผู้ใช้, การประทับเวลา, รหัสคำขอ). การเปลี่ยนแปลงใดๆ ที่เกิดขึ้นในช่วงต้นของพร้อมต์จะทำให้คำนำหน้าแคชไม่ถูกต้องนับจากจุดนั้น, ดังนั้นการประทับเวลาใน system prompt ของคุณจะเปลี่ยนทุกการเรียกใช้ให้กลายเป็นการแคชพลาดในราคาเต็มโดยที่คุณไม่รู้ตัว.

สิ่งนี้ยังปรับเปลี่ยนมุมมองของหน้าต่างบริบท 1M: การเติมข้อมูลจะมีค่าใช้จ่าย $0.435 เมื่อแคชพลาด, แต่ในฐานะคำนำหน้าเซสชันที่เสถียร มันจะมีค่าใช้จ่ายประมาณหนึ่งในสามของเซ็นต์ต่อการเรียกใช้. สำหรับทฤษฎีทั่วไป, โปรดดู Prompt caching คืออะไร.

การทดสอบ deepseek-v4-pro ใน Apidog

ก่อนที่ V4 Pro จะถูกนำไปใช้กับโค้ดจริง, ควรนำปลายทางไปดีบักด้วยดีบักเกอร์ที่เหมาะสม. เนื่องจาก API ของ DeepSeek เข้ากันได้กับ OpenAI, Apidog จึงสามารถรองรับได้โดยไม่ต้องมีการจัดการพิเศษใดๆ:

  1. นำเข้าปลายทาง. วางคำสั่ง curl จากก่อนหน้านี้ลงใน Apidog และมันจะกลายเป็นคำขอที่แก้ไขได้, ส่วนหัว, การรับรองความถูกต้อง, และเนื้อหาจะถูกแยกวิเคราะห์โดยอัตโนมัติ.
  2. ตั้งค่าสภาพแวดล้อมสำหรับ Pro และ Flash. เก็บ base_url และ API key ของคุณเป็นตัวแปรสภาพแวดล้อม, และทำให้ชื่อโมเดลเป็นตัวแปรด้วย. การสลับระหว่าง deepseek-v4-pro และ deepseek-v4-flash จะกลายเป็นการเปลี่ยนสภาพแวดล้อมเพียงคลิกเดียว, ซึ่งทำให้คำถามที่ว่า "Pro คุ้มค่ากับราคา 3 เท่าของ Flash สำหรับพร้อมต์นี้หรือไม่?" กลายเป็นคำถามเชิงประจักษ์แทนที่จะเป็นการถกเถียง.
  3. ตรวจสอบสตรีม SSE. ส่งคำขอด้วย "stream": true และ Apidog จะแสดงผลสตรีมเหตุการณ์เป็นไทม์ไลน์สดแทนที่จะเป็นผนังของบรรทัด data: ดิบ, โดยรวมเดลต้าเข้าด้วยกันเพื่อให้คุณสามารถดู reasoning_content ที่มาถึงก่อนคำตอบ. เมื่อการเรียกใช้โหมด think-max รู้สึกช้า, มุมมองนี้จะแสดงให้คุณเห็นว่าเวลาส่วนใหญ่หมดไปที่ใด.
  4. บันทึกเซสชันเป็นคอลเลกชัน. เมื่อ DeepSeek ส่งมอบสแนปช็อตถัดไป, ให้เรียกใช้คำขอเดิมซ้ำและเปรียบเทียบพฤติกรรมก่อนที่คุณจะอัปเกรด, ซึ่งเป็นเวิร์กโฟลว์เดียวกับที่ทีมต่างๆ ใช้สำหรับปลายทางที่เข้ากันได้กับ OpenAI โดยทั่วไป.

ตัวแสดงการตอบสนองยังแสดงบล็อก usage ในทุกคำขอ, ซึ่งเป็นวิธีที่เร็วที่สุดในการตรวจสอบอัตราการเรียกใช้แคชสำเร็จของคุณในขณะที่คุณปรับโครงสร้างพร้อมต์.

ราคาปัจจุบัน และการปรับราคาที่กำลังจะมาถึง

ราคาที่ระบุในปัจจุบันสำหรับปลายทาง V4 สองรายการ:

โมเดล อินพุต (แคชพลาด) อินพุต (แคชสำเร็จ) เอาต์พุต
deepseek-v4-pro $0.435/M $0.003625/M $0.87/M
deepseek-v4-flash $0.14/M $0.28/M

แม้แต่ในราคาของ Pro, ก็ยังต่ำกว่าโมเดลชั้นนำของตะวันตกอย่างมาก. แต่โปรดวางแผนโดยคำนึงถึงข้อควรระวังหนึ่งข้อ: ในวันที่ 6 สิงหาคม 2026, หกวันก่อน GA, DeepSeek ได้เตือนว่าจะมีการปรับราคา API เพิ่มขึ้น "อย่างมีนัยสำคัญ", โดยไม่มีตัวเลขหรือวันที่มีผลบังคับใช้.

การป้องกันความเสี่ยงในทางปฏิบัติในขณะที่ยังไม่ทราบตัวเลข:

สำหรับการวิเคราะห์เชิงลึกของโครงสร้างราคา V4 และการเปรียบเทียบระหว่างผู้ให้บริการ, โปรดดู คู่มือราคา DeepSeek V4 API ของเรา.

คำถามที่พบบ่อย

โค้ด OpenAI SDK ที่มีอยู่ของฉันจะยังคงใช้งานได้โดยไม่มีการเปลี่ยนแปลงหรือไม่?

เกือบทั้งหมด. เปลี่ยน base_url เป็น https://api.deepseek.com, เปลี่ยน API key, และตั้งค่า model="deepseek-v4-pro". Chat Completions, การสตรีม, เครื่องมือ, และเอาต์พุตที่มีโครงสร้างจะตามรูปแบบของ OpenAI. ทีมที่ใช้ Anthropic SDK สามารถใช้ปลายทาง Anthropic Messages ของ DeepSeek ได้แทน.

ฉันควรใช้ V4 Flash แทน V4 Pro เมื่อใด?

Flash (รวม 284B, ใช้งาน 13B) เป็นโมเดลสำหรับปริมาณงาน: การจัดหมวดหมู่, การแยกข้อมูล, การแชทแบบง่าย, หรืออะไรก็ตามที่ไวต่อเวลาแฝงและไม่ต้องการการให้เหตุผลเชิงลึก. Pro คุ้มค่ากับราคาเอาต์พุตที่สูงกว่า 3 เท่าในงานการเขียนโค้ดของ Agent, การวิเคราะห์บริบทขนาดยาว, และภาระงานในโหมดคิด. ควรกำหนดเส้นทางตามลักษณะงาน ไม่ใช่ตามความภักดี.

ฉันสามารถใช้ V4 Pro 0813 ใน Cursor ได้หรือไม่?

ได้, Cursor รองรับปลายทางที่เข้ากันได้กับ OpenAI ที่กำหนดเอง, ดังนั้น build GA สามารถนำมาใช้เป็นโมเดลที่กำหนดเองได้. เราจะอธิบายการตั้งค่าที่ถูกต้องใน วิธีใช้ DeepSeek V4 Pro กับ Cursor.

สรุป

วันแรกกับการใช้งานโมเดล GA เป็นเวลาที่เหมาะสมในการสร้างความคุ้นเคย: คีย์, คำขอแรก, โหมดการคิด, การสตรีม, และการจัดวางพร้อมต์ที่คำนึงถึงการแคช. V4 Pro ให้ผลตอบแทนแก่พฤติกรรมสุดท้ายนี้มากกว่าโมเดลอื่นๆ ที่เคยมีมา, ส่วนลดแคช 120 เท่าทำให้โครงสร้างพร้อมต์กลายเป็นการตัดสินใจเชิงสถาปัตยกรรม. เชื่อมต่อตัวอย่างข้างต้น, ตรวจสอบตัวเลข usage, และเก็บคอลเลกชัน Apidog ที่บันทึกไว้ เพื่อให้คุณสามารถตรวจสอบพฤติกรรมซ้ำได้เมื่อสแนปช็อตถัดไปหรือการเปลี่ยนแปลงราคาที่ประกาศออกมา.

button

ฝึกการออกแบบ API แบบ Design-first ใน Apidog

ค้นพบวิธีที่ง่ายขึ้นในการสร้างและใช้ API