GPT-6.1 SolとClaude Sonnet 5.5を比較:2ドル/10ドルの同価格、1日違いで登場、共通ベンチマークは非公開

GPT-6.1 Sol 対 Claude Sonnet 5.5: 2ドル/10ドルの同価格、一日違いで登場、共通ベンチマークなし。スペック、ベンダーの主張、そして両方を自分でテストする方法。

Medy Evrard

30 9月 2026

GPT-6.1 SolとClaude Sonnet 5.5を比較:2ドル/10ドルの同価格、1日違いで登場、共通ベンチマークは非公開

Apidog エンタープライズ

オンプレミスデプロイ

SSO & RBAC

SOC 2 準拠

Apidog Enterpriseを見る

GPT-6.1 SolとClaude Sonnet 5.5はどちらも、入力トークン100万あたり2ドル、出力トークン100万あたり10ドルで提供されており、わずか1日違いでリリースされました。Sonnet 5.5は2026年9月28日に、GPT-6.1 Solは9月29日です。どちらのベンダーも、互いを比較するベンチマークを行っていません。OpenAIはGPT-6.1 SolをClaude Opus 5.5およびFable 5.1と比較し、AnthropicはSonnet 5.5を以前のSolであるGPT-6 Solと比較しました。正直な選び方は、独自のタスクで両方を実行し、トークンあたりの価格ではなく、タスクあたりのコストを比較することです。

以下に、スペックと価格の比較、各ベンダーの主張と対象モデル、サードパーティの数値(すべてGPT-6 Solに関するもので、6.1ではない)、そしてApidogでご自身で比較を実行する方法を示します。各モデルの詳細については、GPT-6.1 Solとは何か、Claude Sonnet 5.5とは何かをご覧ください。

GPT-6.1 Sol vs Claude Sonnet 5.5: スペックと価格

出典:OpenAIの価格ページ、AnthropicのSonnet 5.5概要および価格、さらに以下のGPT-6.1 Solモデルページ。

GPT-6.1 Sol Claude Sonnet 5.5
モデルID gpt-6.1-sol claude-sonnet-5-5 (Bedrock: anthropic.claude-sonnet-5-5)
リリース日 2026年9月29日 2026年9月28日
100万トークンあたりの入力/出力 $2 / $10 $2 / $10
100万キャッシュ読み込みあたり $0.10 $0.20
100万キャッシュ書き込みあたり $2.50 $2.50(5分), $4(1時間)
100万バッチあたり $1 / $5 $1 / $5
272K入力トークンを超えるプロンプト リクエスト全体で入力4ドル、キャッシュ0.20ドル、出力15ドル 100万トークンウィンドウ全体でプレミアムなし
高速ティア 高速(4ドル/20ドル)、超高速「近日公開」 高速モードは利用不可
コンテキストウィンドウ 1,050,000(最大入力922,000) 1M
最大出力 128,000 128K(ベータヘッダー付きバッチでは300K)
知識のカットオフ日 2026年4月30日 2026年6月
努力レベル low, medium(デフォルト), high, xhigh, max; noneはなし low, medium, high(APIデフォルト), xhigh, max; 思考はオフにできない(最低設定:between_tools)
API形状 Responses(ツール付き), Chat Completions(ツールなし), Batch Messages, Batch
その他のプラットフォーム OpenRouter (openai/gpt-6.1-sol) Bedrock, Google Cloud, Microsoft Foundry, AWS上のClaude Platform
無料アクセス なし。Plus、Pro、Business、Enterprise、Eduの各プランではChatGPT WorkおよびCodexで利用可能(Chatではない。EnterpriseおよびEduは管理者が有効化する必要あり、モデルドキュメントによる)。無料APIティアなし。 Claude.aiで誰でもチャット可能。APIはトークンごとに課金。

コスト面で最も重要なのは2つの行です。GPT-6.1 Solのキャッシュ読み込みはSonnet 5.5の半分なので、長いシステムプロンプトを再利用する場合はOpenAIの方が安価です。272K入力トークンを超えると状況は逆転します。GPT-6.1 Solのモデルページでは、リクエスト全体が入力とキャッシュレートの2倍、出力の1.5倍の価格で設定されていますが、Sonnet 5.5は2ドルと10ドルのままです。40万トークンのプロンプトと5千トークンの回答の場合、キャッシュなしではGPT-6.1 Solで約1.68ドル、Sonnet 5.5で0.85ドルかかります。

各ベンダーの主張と対象モデル

GPT-6.1 Solに関するOpenAIの主張 Claude Sonnet 5.5に関するAnthropicの主張
比較対象 GPT-6 Sol, GPT-6 Astra, Claude Opus 5.5, Claude Fable 5.1 Sonnet 5, Opus 5.5, GPT-6 Sol (2つのチャートではGPT-5.6 Sol)
相手のモデルを含むか いいえ いいえ (GPT-6.1 Solはまだ存在していなかったため)
見出し Astraの標準トークン価格の5分の1で「Astraに近いインテリジェンス」 Sonnet 5より30%以上高速、タスクあたり最大30%低コスト
誰が数値を算出したか OpenAI(競合他社の結果は、脚注によると公開レポートから) Anthropic、およびCognition、Cursor、Artificial Analysis、Surge AI(指定されたベンチマークについて)

OpenAIのGPT-6.1 Sol発表ブログ記事には、OpenAIが報告した以下の結果が記載されています。

AnthropicのSonnet 5.5発表ブログ記事には、GPT-6 Solの比較列が含まれています。

Sonnet 5.5ベンチマーク詳細には、Anthropicの他の表が記載されています。

Opus 5.5は両方のチャートに登場し、両ベンダーがAutomationBenchとTerminal-Bench Scienceを報告しているため、これらをつなぎ合わせたくなるかもしれません。しかし、数値は一致しません。OpenAIはAutomationBench 1.0.6を自社のハーネスでmedium effortで報告していますが、Anthropicのシステムカード要約表ではClaudeモデルをmax effortで実行しています(Sonnet 5.5が44.7、Opus 5.5が42.5、GPT-6 Solが32.0)。AnthropicはTerminal-Bench ScienceでSonnet 5.5に59.9%を与えていますが、OpenAIのテキストにはGPT-6.1 Solの生のスコアは記載されていません。また、OpenAIはOSWorld 2.0 offlineでコンピューター使用をテストし、AnthropicはOSWorld 2.1でテストしました。GPT-6 Sol対Claude Opus 5.5の比較でも同様の壁に突き当たりました。

サードパーティが測定した結果(GPT-6 Solについて、6.1ではない)

検索結果におけるすべてのサードパーティ比較では、Sonnet 5.5とGPT-6 Solが組み合わされています。最も完全なものはArtificial Analysisで、そのIntelligence Index v4.3.2は10の評価を統合しています。

努力レベル Sonnet 5.5 インデックス Sonnet 5.5 タスクあたりコスト GPT-6 Sol インデックス GPT-6 Sol タスクあたりコスト
medium 41 $0.59 40 $0.25
high 47 $1.08 43 $0.38
xhigh 52 $2.74 44 $0.52
max 56 $7.60 48 $1.05

max effortでは、同じページでSonnet 5.5は毎秒138出力トークン、GPT-6 Solは76と測定されています。Sonnet 5.5は、リスト価格が同じであるにもかかわらず、示されたすべての努力レベルでスコアが高く、タスクあたりのコストも高くなっています。これはトークンの消費量の違いによるものです。highのSonnet 5.5(47、$1.08)は、maxのGPT-6 Sol(48、$1.05)の隣に位置します。

Anthropic自身のチャートデータは、両刃の剣です。AA-Briefcaseでは、すべての努力レベルでGPT-6 Solのタスクあたりコストが低く(mediumで0.34ドル対1.64ドル)、Sonnet 5.5は高スコアを出しています。FrontierCodeでは、Sonnet 5.5がhighで49.4%を達成しタスクあたり0.42ドルであるのに対し、GPT-6 Solはmaxで49.3%を達成し2.07ドルです。

これらはすべて古いSolに関するものです。OpenAIは、GPT-6.1 Solがいくつかのベンチマークにおいて、同等またはより低い努力レベルでGPT-6 Solを上回ると述べているため、サードパーティがテストすればその順位は変わるでしょう。

各ベンダーの主張による、それぞれの強み

GPT-6.1 Sol. OpenAIは、「より低いコストでAstraに近いパフォーマンスを求める複雑なコーディング、コンピューター利用、プロフェッショナルな作業」向けにこれを売り込んでいます。その明示された利点は、エージェントによる自動化、コンピューター利用、科学タスクにおいて、さらに低努力で事実誤りが少ない点です。価格面では、272K入力トークン未満のキャッシュを多用するワークロードに有利であり、有料の速度ティア(Fast)を持つのは両者の中でこれだけです。

Claude Sonnet 5.5. Anthropicは、明確な範囲の日常業務、バグ修正、洗練されたドキュメント、スライド、スプレッドシート向けにこれを売り込み、Opus 5.5が「複雑でオープンエンドな作業において依然として明らかに優れている」と述べています(Sonnet 5.5 vs Opus 5.5を参照)。報告されている強みは、エージェントによるコーディング(Terminal-Bench 4.0でmax時に70.6%、Anthropicが実行)、知識作業、コンピューター利用(OSWorld 2.1で部分的に80.1%)です。価格面では272Kトークンを超えるプロンプトに有利で、Bedrock、Google Cloud、Microsoft Foundryで動作します。

2つの動作が、単純なテストを歪めます。デフォルトの努力レベルが異なります(GPT-6.1 Solではmedium、API上のSonnet 5.5ではhigh)ので、一致する設定で比較してください。また、どちらもサンプリングの調整を受け付けません。Sonnet 5.5は、デフォルト以外のtemperature、top_p、top_kを使用すると400を返します。OpenAIのGPT-6ガイダンスでは、努力レベルがnoneでない場合にtemperatureとtop_pを下げるよう指示しています。繰り返しの実行で分散を制御してください。

Apidogでご自身で比較を実行する

JSONフィールドやラベルなど、確認可能な回答を持つ実際のトラフィックから20〜50のタスクを選択します。次に、Apidogで:

  1. OPENAI_API_KEYとANTHROPIC_API_KEYをシークレットとして、さらにEFFORTを持つ環境を作成します。
  2. {{prompt}}変数を共有する2つのリクエストを保存します。形式は異なります(Responsesリファレンス、Messagesリファレンス)。その理由については、API形式の比較で詳しく説明されています。
POST https://api.openai.com/v1/responses
Authorization: Bearer {{OPENAI_API_KEY}}
Content-Type: application/json

{"model": "gpt-6.1-sol", "reasoning": {"effort": "{{EFFORT}}"},
 "max_output_tokens": 25000, "input": "{{prompt}}"}
POST https://api.anthropic.com/v1/messages
x-api-key: {{ANTHROPIC_API_KEY}}
anthropic-version: 2023-06-01
content-type: application/json

{"model": "claude-sonnet-5-5", "max_tokens": 25000,
 "output_config": {"effort": "{{EFFORT}}"},
 "messages": [{"role": "user", "content": "{{prompt}}"}]}
  1. 各形状にアサーションを追加し、次にexpected列に対して回答自体に1つ追加します。
チェック項目 OpenAI Responses Anthropic Messages
正常終了 $.status が completed と等しい $.stop_reason が end_turn と等しい
回答の存在 $.output[*].type に message が含まれる $.content[*].type に text が含まれる
出力トークン(推論を含む) $.usage.output_tokens $.usage.output_tokens
キャッシュ読み込み $.usage.input_tokens_details.cached_tokens $.usage.cache_read_input_tokens
キャッシュ書き込み $.usage.input_tokens_details.cache_write_tokens $.usage.cache_creation_input_tokens
  1. ポストプロセッサースクリプトで各レスポンスの価格を計算します。OpenAIのinput_tokensにはキャッシュ済みおよびキャッシュ書き込みトークンが含まれるため、2ドルレートを適用する前にそれらを差し引きます(OpenAIプロンプトキャッシング)。Anthropicのinput_tokensは、最後のキャッシュブレークポイント以降のトークンのみをカウントします(Anthropicプロンプトキャッシング)。OpenAI側には272Kルールを適用します。
  2. 両方のリクエストを1つのテストシナリオに配置し、プロンプトをダブルクォーテーションなしでCSVの単一行に保ち、関心のある各努力レベルでApidog CLIから実行します。
apidog run --access-token "$APIDOG_ACCESS_TOKEN" -t "$SCENARIO_ID" -e "$ENV_ID" \
  -d prompts.csv --env-var "EFFORT=medium" -r cli,junit

総費用を通過したタスクの数で割ると、それがタスクあたりのコストになります。同じ努力レベル名がベンダー間で同じように調整されているわけではないため、両方で少なくともmediumとhighを実行してください。リクエストの詳細については、GPT-6.1 Sol APIガイドおよびClaude Sonnet 5.5 APIの使用方法をご覧ください。

よくある質問

両方を実行して選択する

バックログから10個のタスクを選び、両方のモデルをmediumとhighで実行し、合格したタスクあたりのコストを比較してください。Apidogをダウンロードして、Artificial AnalysisがGPT-6.1 Solの数値を発表したり、どちらかのベンダーが新しいスナップショットをリリースしたときに再実行できる単一のシナリオとしてペアを保持できます。

ApidogでAPIデザイン中心のアプローチを取る

APIの開発と利用をよりシンプルなことにする方法を発見できる