วิธีใช้ Claude Haiku 5.5 API

คู่มือ API ของ Claude Haiku 5.5: การเรียกใช้ครั้งแรกด้วย claude-haiku-5-5 ใน curl, Python และ TypeScript รวมถึงความพยายาม, การคิด, การแคช, การประมวลผลเป็นชุด และการปฏิเสธ

INEZA Felin-Michel

INEZA Felin-Michel

8 October 2026

วิธีใช้ Claude Haiku 5.5 API

Apidog สำหรับองค์กร

การติดตั้งแบบ On-Premises

SSO & RBAC

รองรับมาตรฐาน SOC 2

สำรวจ Apidog Enterprise

ในการใช้ Claude Haiku 5.5 API ให้ส่งคำขอ POST ไปยัง https://api.anthropic.com/v1/messages โดยมี "model": "claude-haiku-5-5", คีย์ของคุณอยู่ในเฮดเดอร์ x-api-key และ anthropic-version: 2023-06-01 มีค่าใช้จ่าย $0.10/$0.50 ต่อหนึ่งล้านโทเค็นอินพุต/เอาต์พุต สำหรับข้อความแจ้ง (prompts) สูงสุด 100K โทเค็น (สูงกว่านั้นคือ $0.50/$2.50) สามารถอ่านบริบทได้สูงสุด 1M โทเค็น เขียนได้สูงสุด 128K และค่าเริ่มต้นจะตั้งค่าความพยายาม (effort) ไว้ที่ medium พร้อมเปิดการคิดแบบปรับตัว (adaptive thinking) ไว้

Anthropic ได้เปิดตัว Haiku 5.5 เมื่อวันที่ 7 ตุลาคม 2026 และเป็น Haiku รุ่นแรกที่มีระดับความพยายาม (effort levels) (Claude Haiku 5.5 คืออะไร ครอบคลุมถึงข้อมูลจำเพาะและตำแหน่งทางการตลาด) คู่มือนี้ครอบคลุมการเรียกใช้ครั้งแรกด้วย curl, Python และ TypeScript จากนั้นจึงกล่าวถึงความพยายาม (effort), การคิด (thinking), การแคช (caching), แบตช์ (batch), การปฏิเสธ (refusals) และชุดเครื่องมือสำหรับเอเจนต์ (agent toolsets) คุณสามารถบันทึกและยืนยันทุกคำขอที่อยู่ด้านล่างได้ใน Apidog

ปุ่ม

ภาพรวม Claude Haiku 5.5 API

พารามิเตอร์ พฤติกรรมของ Haiku 5.5
รหัสโมเดล claude-haiku-5-5 (Bedrock: anthropic.claude-haiku-5-5); ไม่มีชื่อแทนแยกต่างหาก
ราคาต่อ MTok, สำหรับ prompts สูงสุด 100K โทเค็น $0.10 สำหรับอินพุต, $0.50 สำหรับเอาต์พุต, $0.01 สำหรับการอ่านแคช
ราคาต่อ MTok, สำหรับ prompts ที่เกิน 100K โทเค็น $0.50 สำหรับอินพุต, $2.50 สำหรับเอาต์พุต, $0.05 สำหรับการอ่านแคช
บริบท / เอาต์พุตสูงสุด 1M / 128K; 300K ใน Batch โดยใช้เฮดเดอร์เบต้า output-300k-2026-03-24
output_config.effort low, medium (ค่าเริ่มต้น), high, xhigh, max
thinking adaptive เป็นค่าเริ่มต้น; disabled ใช้ได้เฉพาะที่ระดับ high effort หรือต่ำกว่า
thinking.display ฟิลด์ thinking ว่างเปล่าเป็นค่าเริ่มต้น; summarized จะคืนค่าเป็นข้อความที่อ่านได้
temperature, top_p, top_k ค่าที่ไม่ใช่ค่าเริ่มต้นจะคืนค่า 400
การเติมข้อความล่วงหน้าสำหรับผู้ช่วย (Assistant prefill) คืนค่า 400 แม้ว่าจะปิดการคิด (thinking) อยู่ก็ตาม
prompt ที่สามารถแคชได้ขั้นต่ำ 512 โทเค็น (4,096 ใน Haiku 4.5)

แหล่งที่มา: หน้าโมเดล Haiku 5.5 และ เอกสารราคา Claude API

การเรียกใช้ Claude Haiku 5.5 API ครั้งแรกของคุณ

สร้างคีย์ใน Claude Console ( คู่มือคีย์ Anthropic API จะอธิบายขั้นตอน) และส่งออกเป็น ANTHROPIC_API_KEY ห้ามวางคีย์ลงในโค้ดโดยตรง จากนั้นส่งข้อมูลนี้:

curl https://api.anthropic.com/v1/messages \
  -H "x-api-key: $ANTHROPIC_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -H "content-type: application/json" \
  -d '{
    "model": "claude-haiku-5-5",
    "max_tokens": 4096,
    "output_config": {"effort": "medium"},
    "thinking": {"type": "adaptive", "display": "summarized"},
    "messages": [{"role": "user", "content": "Classify this ticket as billing, bug, or feature request: The export button times out on large projects."}]
  }'

Python SDK จะดึง ANTHROPIC_API_KEY จากตัวแปรสภาพแวดล้อม:

import anthropic

client = anthropic.Anthropic()
response = client.messages.create(
    model="claude-haiku-5-5",
    max_tokens=4096,
    output_config={"effort": "medium"},
    thinking={"type": "adaptive", "display": "summarized"},
    messages=[{"role": "user", "content": "Classify this ticket as billing, bug, or feature request: The export button times out on large projects."}],
)

for block in response.content:
    if block.type == "thinking":
        print("[thinking]", block.thinking)
    elif block.type == "text":
        print(block.text)
print(response.stop_reason, response.usage)

TypeScript มีรูปแบบที่คล้ายกัน:

import Anthropic from "@anthropic-ai/sdk";

const client = new Anthropic();
const response = await client.messages.create({
  model: "claude-haiku-5-5",
  max_tokens: 4096,
  output_config: { effort: "medium" },
  thinking: { type: "adaptive", display: "summarized" },
  messages: [
    { role: "user", content: "Classify this ticket as billing, bug, or feature request: The export button times out on large projects." },
  ],
});

for (const block of response.content) {
  if (block.type === "text") console.log(block.text);
}
console.log(response.stop_reason, response.usage);

สามนิสัยจะช่วยให้โค้ดนี้ทำงานได้อย่างถูกต้อง เลือกบล็อกเนื้อหาตาม type เนื่องจากบางการตอบกลับอาจเริ่มต้นด้วยบล็อก thinking ซึ่งจะทำให้ content[0].text เกิดข้อผิดพลาดได้ เว้นช่องว่างใน max_tokens ไว้ เพราะโทเค็นของการคิด (thinking tokens) จะนับรวมอยู่ในนั้น และทำให้เนื้อหาคำขอสะอาด: ไม่มี temperature, top_p, top_k, budget_tokens หรือ assistant prefill สิ่งเหล่านี้แต่ละรายการจะคืนค่า 400 สำหรับโมเดลนี้ หากคุณกำลังย้ายโค้ดเก่า คู่มือ Haiku 5.5 เทียบกับ Haiku 4.5 จะแสดงการเปลี่ยนแปลงที่ส่งผลกระทบทั้งหมดพร้อม JSON ก่อน/หลัง

เลือกระดับความพยายาม (effort level)

ความพยายาม (effort) ซึ่งตั้งค่าใน output_config.effort เป็นปัจจัยหลักในการกำหนดคุณภาพ, ความหน่วง (latency) และค่าใช้จ่าย คู่มือการสร้าง prompt ให้จุดเริ่มต้นเหล่านี้:

เส้นโค้งค่าใช้จ่ายนั้นสูงชัน นี่คือผลการทดสอบ OSWorld 2.1 (ชุดย่อยแบบออฟไลน์) ของ Anthropic จากแผนภูมิเปิดตัว โดยมีคะแนนเครดิตบางส่วนและค่าใช้จ่ายต่อการพยายาม:

ความพยายาม คะแนน ค่าใช้จ่ายต่อการพยายาม
low 42.0% $0.0695
medium 53.3% $0.1257
high 61.3% $0.1827
xhigh 67.6% $0.2792
max 72.4% $0.6111

การเปลี่ยนจาก xhigh เป็น max ทำให้ค่าใช้จ่ายเพิ่มขึ้นเป็นสองเท่าเพื่อเพิ่มคะแนนไม่ถึงห้าจุด รายละเอียดเกณฑ์มาตรฐานของ Haiku 5.5 มีแผนภูมิอื่นๆ สำหรับแต่ละระดับความพยายาม

ข้อสังเกตพิเศษ: ที่ระดับ xhigh ในการสนทนาหลายรอบ โมเดลบางครั้งจะเขียนคำตอบทั้งหมดลงในการคิด (thinking) และจบเทิร์นโดยไม่มีข้อความที่มองเห็นได้ ตรวจสอบการตอบกลับที่ว่างเปล่าก่อนที่จะแสดงให้ผู้ใช้เห็น

ควบคุมการคิด (thinking)

การคิดแบบปรับตัว (adaptive thinking) จะเปิดใช้งานโดยค่าเริ่มต้น และมีการเปลี่ยนแปลงสองอย่างจาก Haiku 4.5 ประการแรก การแสดงผลเริ่มต้นจะซ่อนข้อความ บล็อก thinking แต่ละบล็อกจะกลับมาพร้อมกับฟิลด์ thinking ที่ว่างเปล่าและมีเพียง signature เท่านั้น ตั้งค่า "display": "summarized" (เหมือนในการเรียกใช้ครั้งแรก) เมื่อคุณต้องการสรุปที่อ่านง่ายในบันทึกหรือ UI หากต้องการให้มีการคิดน้อยลง ให้ลดระดับความพยายาม (effort) การสั่งให้โมเดลตอบโดยตรงไม่สามารถหยุดการคิดได้ในการทดสอบของ Anthropic

ประการที่สอง คุณสามารถปิดการคิดได้ แต่เฉพาะที่ระดับความพยายาม (effort) high หรือต่ำกว่าเท่านั้น:

{
  "model": "claude-haiku-5-5",
  "max_tokens": 1024,
  "thinking": {"type": "disabled"},
  "output_config": {"effort": "low"},
  "messages": [{"role": "user", "content": "Extract the invoice number from: INV-2291, due Nov 3."}]
}

เนื้อหาเดียวกันที่ระดับ xhigh หรือ max จะคืนค่า 400 การบังคับ tool_choice (any หรือเครื่องมือที่มีชื่อ) จะได้รับการยอมรับ แต่การตอบกลับจะเริ่มต้นด้วยการเรียกใช้เครื่องมือและไม่มีบล็อก thinking

สำหรับการสนทนาหลายรอบและ agent loops ให้ส่งบล็อก thinking ทุกบล็อกกลับไปโดยไม่เปลี่ยนแปลง และเก็บประวัติแบบเพิ่มเท่านั้น การเปลี่ยนแปลง system, tools หรือ messages ก่อนหน้าบล็อก thinking ที่ส่งคืนอาจทำให้เกิดข้อผิดพลาด 400 ได้ และบล็อก thinking จะทำงานเฉพาะในบัญชีที่สร้างขึ้นเท่านั้น (หรือบัญชีที่เชื่อมโยงกับบัญชีนั้น)

แคช prompts และงานแบตช์

การแคชคือจุดที่ทำให้ Haiku 5.5 มีราคาถูกลง สำหรับ prompts สูงสุด 100K โทเค็น การอ่านแคชมีค่าใช้จ่าย $0.01 ต่อล้านโทเค็น เทียบกับ $0.10 สำหรับอินพุตใหม่ การเขียนแคช 5 นาทีมีค่าใช้จ่าย $0.125 และการเขียน 1 ชั่วโมงมีค่าใช้จ่าย $0.20 prompt ที่สามารถแคชได้ขั้นต่ำคือ 512 โทเค็น ลดลงจาก 4,096 โทเค็นใน Haiku 4.5 ดังนั้น prompts ระบบสั้นๆ และรายการเครื่องมือจึงมีคุณสมบัติในการแคชได้แล้ว ทำเครื่องหมายส่วนนำหน้าที่เสถียรด้วย cache_control:

{
  "model": "claude-haiku-5-5",
  "max_tokens": 1024,
  "system": [{
    "type": "text",
    "text": "You are a support triage assistant. <long, stable policy text here>",
    "cache_control": {"type": "ephemeral"}
  }],
  "messages": [{"role": "user", "content": "Ticket: refund not received after 10 days."}]
}

การเปลี่ยน effort ระดับบนสุดระหว่างคำขอจะทำให้แคชไม่ถูกต้อง; ความพยายามต่อข้อความ (per-message effort) (เฮดเดอร์เบต้า mid-conversation-output-config-2026-07-01, Claude API และ Google Cloud) จะคงแคชไว้ เอกสารการแคช prompt ครอบคลุม TTLs และ คำอธิบายการแคช prompt ของเราครอบคลุมแนวคิดนี้

สำหรับงานที่สามารถรอได้ Message Batches API ช่วยลดอินพุตและเอาต์พุตได้ถึง 50%: $0.05/$0.25 สำหรับ prompts สูงสุด 100K โทเค็น และ $0.25/$1.25 สำหรับที่เกินกว่านั้น Batch ยังเป็นวิธีเดียวที่จะเข้าถึงเอาต์พุต 300K โทเค็น โดยใช้เฮดเดอร์เบต้า output-300k-2026-03-24

สังเกตเส้นแบ่งที่ 100K: “prompt ที่มีโทเค็นเกิน 100,000 โทเค็นจะเสียค่าใช้จ่ายสูงขึ้น” ตามคำกล่าวของ Anthropic คู่มือราคา Haiku 5.5 จะแสดงตัวอย่างทั้งสองกรณี

จัดการกับ stop_reason “refusal”

Haiku 5.5 มีตัวจำแนกประเภทความปลอดภัยที่สามารถปฏิเสธคำขอได้ และไม่มีการสำรองข้อมูลฝั่งเซิร์ฟเวอร์ คำขอที่ถูกปฏิเสธจะส่งกลับมาพร้อมกับ stop_reason: "refusal" โดยมีหมวดหมู่เป็น cyber, frontier_llm, bio และ general_harms หากคุณกำลังเปลี่ยนจาก Haiku 4.5 การปฏิเสธเหล่านี้เป็นของใหม่ การส่งคำขอเดิมซ้ำมักจะส่งผลให้เกิดการปฏิเสธอีกครั้ง ดังนั้นอย่าลองใหม่โดยไม่ตรวจสอบ:

def run(client, messages):
    response = client.messages.create(
        model="claude-haiku-5-5",
        max_tokens=4096,
        messages=messages,
    )
    if response.stop_reason == "refusal":
        details = getattr(response, "stop_details", None)
        category = getattr(details, "category", "unknown")
        log_refusal(category, messages)  # your logging
        return {"status": "refused", "category": category}
    text = "".join(b.text for b in response.content if b.type == "text")
    return {"status": "ok", "text": text}

แยกการทำงานตาม stop_reason ก่อนที่คุณจะอ่าน content และส่งต่อคำปฏิเสธไปยังบุคคลหรือโมเดลอื่นในโค้ดของคุณ ทีมที่ทำงานด้านความปลอดภัยหรือวิทยาศาสตร์ชีวภาพที่ถูกต้องตามกฎหมายซึ่งถูกบล็อกโดยตัวจำแนกประเภท cyber หรือ bio สามารถยื่นคำขอเข้าร่วมโครงการ Cyber Verification Program หรือ Life Sciences Verification Program ของ Anthropic ได้

การใช้งานคอมพิวเตอร์และการใช้งานเบราว์เซอร์

บน Claude API และ Google Cloud, Haiku 5.5 รองรับการใช้งานคอมพิวเตอร์ผ่าน toolset computer_toolset_20260801 เท่านั้น ซึ่งไม่จำเป็นต้องใช้เฮดเดอร์เบต้า; การประกาศ computer_20250124 จะคืนค่า 400 การใช้งานเบราว์เซอร์จะผ่าน browser_toolset_20260801 ซึ่ง Haiku 4.5 ไม่รองรับ Python และ TypeScript SDK ได้เพิ่มคลาสเบต้าสำหรับทั้งสองในวันเปิดตัว ดู เอกสารเครื่องมือการใช้งานคอมพิวเตอร์ สำหรับเครื่องมือที่เป็นสมาชิก

ข้อจำกัดอัตรา (Rate limits)

Haiku 5.5 มี ข้อจำกัดอัตรา เดียวกันกับ Haiku 4.5: 1,000 คำขอ, 2M โทเค็นอินพุต และ 400K โทเค็นเอาต์พุตต่อนาทีสำหรับ Start tier, สูงสุด 10,000 คำขอ, 10M อินพุต และ 2M เอาต์พุตสำหรับ Scale ไม่รองรับ Priority Tier สำหรับการจัดการข้อผิดพลาด 429 โปรดดู คู่มือการจัดการเมื่อเกินข้อจำกัดอัตรา

ทดสอบ Claude Haiku 5.5 API ใน Apidog

คำขอที่บันทึกไว้ช่วยให้การเปรียบเทียบระดับความพยายามและการแก้ไขข้อผิดพลาดในการปฏิเสธสามารถทำซ้ำได้ นี่คือการตั้งค่าใน Apidog:

  1. สร้าง environment และเพิ่ม ANTHROPIC_API_KEY เป็นตัวแปรลับ อ้างอิงถึงตัวแปรนี้เป็น {{ANTHROPIC_API_KEY}} ในเฮดเดอร์ x-api-key ถัดจาก anthropic-version: 2023-06-01 และ content-type: application/json
  2. สร้างคำขอ POST ไปยัง https://api.anthropic.com/v1/messages วางเนื้อหาของการเรียกใช้ครั้งแรก และบันทึก
  3. เพิ่มการยืนยัน (assertions): สถานะคือ 200, $.stop_reason เท่ากับ end_turn, $.usage.output_tokens มากกว่า 0, และ $.content[*].type มี text การปฏิเสธหรือการตอบกลับ xhigh ที่ว่างเปล่าจะทำให้การทดสอบล้มเหลวแทนที่จะผ่านไปได้
  4. ทำซ้ำคำขอสี่ครั้งด้วย low, high, xhigh และ max แล้วรันโฟลเดอร์ คุณจะได้ usage สำหรับทุกระดับความพยายามสำหรับ prompt ของคุณเอง
  5. เพิ่มรูปแบบ cached-system-prompt และยืนยันว่า $.usage.cache_read_input_tokens มากกว่า 0 ในการรันครั้งที่สอง

สำหรับรูปแบบที่กว้างขึ้น โปรดดู การทดสอบแอปพลิเคชัน LLM

คำถามที่พบบ่อย

ขั้นตอนถัดไป

ส่งคำขอเรียกใช้ครั้งแรกที่ medium จากนั้นรันซ้ำที่ low และ high ด้วย prompt จากปริมาณงานของคุณเอง และเปรียบเทียบ usage.output_tokens กับคุณภาพของคำตอบ ดาวน์โหลด Apidog เพื่อเก็บบันทึกการรันทั้งสามครั้งพร้อมกับการยืนยัน เพื่อให้การเปิดตัวโมเดลครั้งต่อไปเป็นการเปลี่ยนแปลงเพียงฟิลด์เดียว

ปุ่ม

ฝึกการออกแบบ API แบบ Design-first ใน Apidog

ค้นพบวิธีที่ง่ายขึ้นในการสร้างและใช้ API