Zhipu AIは2026年8月14日にGLM-5.3をリリースし、そのローンチ報道にはインフラチームにとって最も重要な一文が隠されていました。それは、オープンウェイトが約2週間後の8月28日頃にZhipuのHugging Face組織で公開されるというものです。この期間は贈り物です。これにより、単一のsafetensorsシャードが公開される前に、ハードウェアの選定、サービングスタックの選択、ホストされたAPIに対する回帰ベースラインの取得を行う時間が得られます。
このモデルは準備作業に値します。Zhipuの社内評価では、コーディング能力がGLM-5.2を50%上回り、Terminal-Bench 3.0は4.6から28.3に跳ね上がり、ローンチ報道によると、同社はエージェントのパフォーマンスを「Claude Fable 5に迫る」と表現しています。フロンティアモデルにまだ及ばない点を含め、ベンチマークの全容は、弊社のGLM-5.3解説記事に掲載されています。この記事は、一つの疑問に焦点を当てます。GLM-5.3を自分で提供できるよう、公開日までに何を準備しておくべきか?
明確にしておきますが、ウェイトは今日ダウンロードできません。以下に述べることはすべてリリース期間を対象としており、Zhipuが確認していないことは事実ではなく期待として示されています。今すぐできることは、ベースラインを構築することです。それにはApidogを使います。今週、ホストされたAPIの応答をスナップショットとして保存し、後で同じコレクションをローカルエンドポイントに対して再生するのです。
要約
- GLM-5.3は2026年8月14日に出荷されました。Zhipuは、これまでのリスクレビューの中で最も広範なものを実施した後、約2週間後の8月28日頃にオープンウェイトが公開されると述べています。公開が予想される場所は、huggingface.co/zai-orgです。
- GLM-5ファミリーのアーキテクチャ(Z.aiのドキュメントより):Mixture of Experts、総パラメータ数744B、パスあたり約40Bがアクティブ、コンテキスト200K。ベースモデルは5.3で変更されておらず、すべての改善はスケールアップされた後学習によるものです。
- 744Bパラメータの計算:ウェイトだけでBF16で約1.5TB、FP8でその約半分(KVキャッシュを除く)。フル精度でのセルフホスティングは、マルチGPUサーバーの領域です。
- 以前のGLM-5のリリースはすべて、Hugging FaceでBF16とFP8のリポジトリのペアとして公開されてきたため、公開初日には
GLM-5.3とGLM-5.3-FP8が公開され、コミュニティによるGGUF量子化は数日から数週間遅れると予想されます。 - vLLMとSGLangは、現実的な公開初日のサービングスタックです。どちらもOpenAI互換のエンドポイントを公開しているため、Z.aiのホストされたAPIに対して書かれたクライアントコードは、
base_urlの変更だけで切り替えられます。 - Apidogで、ホスト版とローカル版の回帰ベースラインを今すぐ構築しましょう。1つのコレクション、2つの環境、形状と内容に関するアサーションです。
Zhipuがリリースするもの、そしてその時期
Zhipu(国際的にはZ.aiとしてブランド展開)は、GLM-5.3 APIのローンチと同時に、2週間後のオープンウェイト公開を約束しました。モデルは2026年8月28日頃にHugging Faceに登場します。この遅延は恣意的なものではありません。Zhipuは、Claude Mythos 5とGPT-5.6 Solをわずかに上回るCyberGymでの84.5%というモデルの性能を考慮し、このリリースに向けてこれまでで最も広範なリスクレビューシステムを構築したと述べています。Seeking Alphaは、このリリースを、ZhipuがDeepSeekと一年を通じて競り合ってきたオープンモデルのリードを維持するための試みとして捉えています。
セルフホストする人にとって、リリースに関する2つの詳細が重要です。
- ベースモデルは変更なしです。 GLM-5.3は、スケールアップされた後学習を施したGLM-5のベースモデルです。あなたのサービングスタックが必要とするアーキテクチャは、vLLMとSGLangがGLM-5およびGLM-5.2ですでに実行しているものと同じです。新しいアテンションバリアントも、トークナイザーの予期せぬ変更もありません。
- リリースパターンは確立されています。 ZhipuのHugging Face組織は、GLM-5、GLM-5.1、およびGLM-5.2をホストしており、それぞれにFP8リポジトリが付属しています。GLM-5.2だけでも269万ダウンロードを記録しています。5.3についても同様の形態、つまりBF16 safetensorsリリースと公式FP8バリアントが期待されます。
5.3のライセンス条項はローンチ報道では確認されていません。商用製品に組み込む前に、リポジトリが出現した際にモデルカードを確認してください。
総パラメータ744B、アクティブ40Bがハードウェアに意味すること
GLM-5ファミリーはMixture of Experts設計です。Z.aiのドキュメントによると(Hugging Faceのリポジトリは埋め込みを含むわずかに高い総計をリストしていますが)、総パラメータ数は744B、順方向パスあたり約40Bがアクティブ、コンテキストは200Kです。これらはファミリーの仕様であり、5.3固有の主張ではありませんが、ベースモデルが変更されていないため、これらが適切な計画数値となります。
MoEの分割は、メモリと計算の非対称性をもたらします。
- 計算は40Bの密なモデルのように振る舞います。トークンあたり、ルーティングされたエキスパートのみが発火するため、モデルが収まれば、GPUあたりのスループットは744Bの密なモデルが示唆するよりもはるかに優れています。
- メモリは744Bのモデルのように振る舞います。すべてのエキスパートはアドレス可能な場所に存在する必要があります。パラメータあたり2バイト(BF16)の場合、744Bは約1.5TBのウェイトになります。1バイト(FP8)の場合、約744GBです。これは公開された数値に基づいた計算であり、テストされた構成ではなく、KVキャッシュは含まれません。
正確なGPU数を装うことなく、現実的なティアを以下に示します。
| 精度 | ウェイトのフットプリント(計算値) | 現実的な設置場所 |
|---|---|---|
| BF16 | 約1.5TB | マルチノードクラスターまたは最大規模のシングルサーバーGPU構成 |
| FP8(公式) | 約745GB | ハイエンドのマルチGPUサーバー、シングルノード |
| INT4クラスのコミュニティ量子化 | 約370-400GB程度 | 小型のマルチGPUリグ;品質レポートを待つ |
予算が消費者向けGPU 1枚である場合、GLM-5.3のフルウェイトは対象外であり、それで問題ありません。評価のためにGPU時間をレンタルするか、積極的なコミュニティ量子化を待つか、またはより小さなオープンモデルをローカルで実行しながら、重いモデルはホストされたAPIで利用し続けてください。2026年の最高のローカルLLMに関する弊社のガイドでは、シングルGPUおよびワークステーションの予算に適合するものがカバーされています。
200Kのコンテキストウィンドウもメモリに関する決定として扱ってください。KVキャッシュはコンテキストとバッチサイズとともに増大するため、公開日までにモデルの最大値にデフォルトで設定するのではなく、デプロイメントティアごとに提供されるコンテキストを制限してください。
ウェイトが公開される前にサービングスタックを選ぶ
ここでは3種類のサービングソフトウェアが重要ですが、それらがすべて同時に準備が整うわけではありません。
vLLMは、このスケールではデフォルトの答えです。オリジナルのリリース以来のGLM-5ファミリーサポート、MoEルーティング、GPUとノードをまたいだテンソル並列処理とエキスパート並列処理、そしてネイティブのOpenAI互換サーバーを備えています。リポジトリが存在すれば、起動コマンドは次のようになります。
vllm serve zai-org/GLM-5.3-FP8 \
--tensor-parallel-size 8 \
--max-model-len 65536 \
--served-model-name glm-5.3
これらのフラグをテンプレートとして扱ってください。リポジトリ名はZhipuの命名パターンに従い、並列処理設定はGPUの数とメモリに依存します。
SGLangは主要な代替手段であり、強力なMoEパフォーマンスと、長い共有プロンプトを再送信するエージェントのワークロードに効果的なラディックスツリープレフィックスキャッシングを備えています。これもOpenAI互換のエンドポイントを提供するため、後でこれら2つを切り替えてもクライアントコードには手を加える必要がありません。
llama.cppファミリー(llama.cpp、Ollama、LM Studio)はGGUF変換を必要としますが、これはsafetensorsが公開されてから数日または数週間後にコミュニティから提供されます。この方法は最終的にモデルをより小さなハードウェアで実行可能にしますが、その品質レベルは盲目的に受け入れるのではなく、あなた自身のベースラインと照らして検証すべきです。
もしハードウェアがあるなら、今週中にGLM-5.2の公開ウェイトを使ってスタックをインストールし、ドライランしてください。ハードウェアがない場合は、より小さなMoEモデルで実行してください。8月28日にCUDAドライバーのデバッグをするのは避けるべき失敗モードです。
今日のホスト型APIをベースラインとして利用する
ほとんどのチームが飛ばす準備ステップがここにあります。モデルをセルフホストする前に、リファレンス実装が生成するものを記録しておきましょう。Zhipuのホスト型APIがそのリファレンスであり、現在稼働しています。ローカルデプロイメントが異なる応答をした場合、保存されたベースラインは、その違いがあなたの量子化の選択、サービングスタックのバグ、または通常のサンプリングのばらつきによるものかどうかを教えてくれます。
ホスト型APIはOpenAI互換です。国際的にはhttps://api.z.ai/api/paas/v4/chat/completions、中国本土向けにはhttps://open.bigmodel.cn/api/paas/v4/chat/completions、認証はAuthorization: Bearer <key>です。Z.aiのドキュメントには現在glm-5が記載されていますが、glm-5.3はファミリーの慣例に従うため、公式ドキュメントで正確な文字列を確認してください。両地域での完全なセットアップは、弊社のGLM-5.3 APIクイックスタートにあります。
温度0で固定プロンプトを使ってベースラインをキャプチャします。
curl https://api.z.ai/api/paas/v4/chat/completions \
-H "Authorization: Bearer $GLM_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.3",
"temperature": 0,
"messages": [
{"role": "user", "content": "Write a Python function that parses RFC 3339 timestamps and returns UTC datetimes. Include error handling for invalid input."}
]
}' > baseline-rfc3339.json
コード生成タスク、エージェントのツール呼び出しパターン、長文コンテキストの要約など、実際のワークロードをカバーするこれらのシナリオを20~50個作成してください。温度を0にしても出力が完全に再現可能になるわけではありませんが、量子化によって引き起こされる品質低下が目立つ程度にはばらつきを抑えることができます。
Apidogで回帰ハーネスを構築する
生のcURLスクリプトは、エンドポイントが2つ、量子化レベルが3つ、そして同僚がどの設定がパスしたかを尋ねるようになるまでは機能します。構造化されたハーネスの方がうまくスケールし、これは標準的なAPI回帰問題であり、弊社のQAエンジニア向けAPIテストガイドでカバーされているのと同じ規律です。
Apidogでのセットアップ:
- 1つのコレクションに、すべてのベースラインプロンプトを。チャット補完パスに対して、ベースラインケースごとにリクエストを作成します。OpenAI互換のスキーマであるため、OpenAIスタイルの仕様をインポートすれば、リクエストの形状を無料で検証できます。
- 2つの環境:
hostedとlocal。hostedは、ベースURLをhttps://api.z.ai/api/paas/v4に設定し、あなたのGLM_API_KEYを使用します。localは、プレースホルダーキーを使用してhttp://localhost:8000/v1(vLLMのデフォルト)を指します。すべてのリクエストは{{base_url}}を参照するため、ターゲットの切り替えは1つのドロップダウンで可能です。 - まず形状、次に内容のアサーションを。HTTP 200、空でない
choices[0].message.content、および適切なusageブロックをアサートします。コードのベースラインについては、表現の揺れにも対応できる内容チェックを追加します。例えば、応答にdefが含まれているか、datetimeが言及されているか、tryパターンが含まれているか、などです。 - ホストされた応答を例として保存します。これらがあなたの参照フィクスチャとなります。公開日には、
localに対してコレクションを再実行し、差分を比較します。 - CLIから実行します。 Apidogのランナーはコレクションをヘッドレスで実行するため、比較はスクリプト化可能なステップとなり、量子化レベル、サービングスタック、または設定変更ごとに再実行できます。
8月28日までに欲しいのは、「自分のデプロイメントがホストされたモデルのように動作するか」という問いに対するワンコマンドでの回答であり、感覚ではなくプロンプトごとの合否判定です。
クライアントコードは変更不要
OpenAI互換の慣習による利点:ホストされたAPIに対して書かれたアプリケーションは、書き換えではなく設定変更だけでセルフホストされたエンドポイントに移行できます。1つの環境変数がターゲットを制御します。
import os
from openai import OpenAI
# ホスト版: GLM_BASE_URL=https://api.z.ai/api/paas/v4
# ローカル版: GLM_BASE_URL=http://localhost:8000/v1
client = OpenAI(
base_url=os.environ["GLM_BASE_URL"],
api_key=os.environ.get("GLM_API_KEY", "local-serving"),
)
response = client.chat.completions.create(
model="glm-5.3",
temperature=0,
messages=[
{"role": "user", "content": "Refactor this function to remove the nested loops: ..."},
],
)
print(response.choices[0].message.content)
vLLMとSGLangは、サービス実行時に登録したモデル名を受け入れるため、--served-model-name glm-5.3とすることで、モデル文字列さえもホストされたIDと同一に保つことができます。ストリーミング、ツール呼び出し、JSONモードは同じインターフェースで動作しますが、特にツール呼び出しは回帰テストを行うべきです。なぜなら、ローカルスタックがホストされた動作と最も乖離しやすい部分だからです。
コストの枠組み:ホストされたAPI対自社GPU
Zhipuはローンチ時に5.3固有のAPI価格を発表していませんでした。コストを見積もる前に、現在の数値については公式価格ページを確認してください。したがって、ここでの比較はトークンごとではなく、構造的なものです。
744BクラスのMoEをセルフホストすることは、トークンが流れるかどうかにかかわらずGPU容量の費用を支払うことを意味します。これが採算が取れるのは以下の3つの状況です。トークンあたりの料金が償却されたハードウェア費用やレンタル費用を超えるほど持続的に利用率が高い場合、プロンプトをネットワーク内に保持するためのデータガバナンス要件がある場合、そして共有APIでは保証できないレイテンシーや可用性の制御が必要な場合です。これら以外の場合、価格ではホスト型が有利であり、評価のためにGPU時間をレンタルする方が、未検証のモデルのためにハードウェアを購入するよりも優れています。
ヘッジとしての議論もあります。プロバイダーの価格は変動する可能性があります。DeepSeekの2026年の値上げは、ローンチ時の料金で単位経済を構築していたチームに影響を与えました。これは弊社のDeepSeek API価格引き上げ分析で取り上げました。オープンウェイトはその下方リスクを制限します。ホストされた価格が変動した場合でも、セルフホストの道はすでに確立されているからです。
公開日チェックリスト
上記すべてをこのリストにまとめました。項目1から6は今日中に実行可能です。
- 上記の算術範囲を参考に、アクセス可能なハードウェアに対して、目標とする精度ティア(BF16、FP8、または量子化を待つか)を確認します。
- vLLMまたはSGLangをインストールし、GLM-5.2の公開ウェイトまたは別のMoEモデルでドライランします。
- Z.aiのAPIキーを作成し、ライブドキュメントで正確な5.3モデルIDを確認します。
- ホストされたAPIから、温度0のベースライン応答を20~50個取得します。
- Apidogコレクションを、
hostedとlocal環境、および形状アサーションを使って構築します。 - デプロイメントティアごとに、提供する最大コンテキスト長を決定します。
- リリース時には、huggingface.co/zai-orgで
GLM-5.3およびGLM-5.3-FP8のリポジトリを監視し、商用デプロイ前にモデルカードのライセンスを読んでください。 - ウェイトをダウンロードし、サーバーを起動し、ローカル環境をそこに向け、コレクションを実行します。
- ローカルのフィクスチャとホストされたフィクスチャを比較します。トラフィックをスケールする前に、コンテンツレベルの失敗を調査します。
- その後初めてチューニングを開始します。量子化レベル、並列処理レイアウト、プレフィックスキャッシング、コンテキスト制限などです。
FAQ
GLM-5.3のウェイトは今すぐダウンロードできますか?
いいえ。2026年8月14日現在、ホストされたAPIのみが稼働しています。Zhipuによると、オープンウェイトはリリースから約2週間後の8月28日頃に公開されます。予想される公開先は、GLM-5、5.1、5.2がすでに存在するzai-org Hugging Faceページです。
GLM-5.3は単一の消費者向けGPUで動作しますか?
フルウェイトでは動作しません。このファミリーの総パラメータ数744Bは、KVキャッシュを除くFP8で約744GBであり、単一のカードでは遠く及びません。INT4クラスの量子化でさえ、マルチGPUの領域に属します。単一GPUの予算の場合、より小さなオープンモデルをローカルで実行し、GLM-5.3はホストされたAPIで利用し続けてください。弊社のローカルLLMまとめに、適合するものがリストされています。
GLM-5.3にはどのサービングフレームワークを使用すべきですか?
vLLMが最も安全なデフォルトです。実証済みのGLM-5ファミリーサポート、MoE対応の並列処理、OpenAI互換サーバーを備えています。エージェントループのように長い共有プレフィックスを再送信するワークロードの場合、SGLangは強力な代替手段となります。llama.cppおよびOllamaの道は、コミュニティのGGUF変換が登場した後、開かれます。
既存のOpenAI SDKコードは、セルフホストされたGLM-5.3に対して機能しますか?
はい、それが双方のOpenAI互換規約の目的です。SDKのbase_urlをhttps://api.z.ai/api/paas/v4ではなく、vLLMまたはSGLangサーバーに向け、同じリクエスト形状を維持してください。特にツール呼び出しとストリーミングはテストしてください。これらはローカルスタックがホストされた動作と時折異なる端の部分だからです。
セルフホストする予定があるのに、なぜホストされたAPIに手間をかけるのですか?
それがあなたのリファレンス実装だからです。ホストされたベースラインがなければ、奇妙なローカル出力が量子化が積極的すぎることを意味するのか、それともモデルがどこでもそのように動作するのかを判断できません。弊社のGLM-5.3 APIクイックスタートのセットアップを使用して、ホストされたエンドポイントを通じて今すぐベースラインを取得してください。そうすれば、公開日は推測ではなく差分比較の作業になります。
あなたのスタックにGLM-5.3を組み込む場所
GLM-5.3は、今年のオープンウェイトのコーディング発表の中で最も強力なものです。Terminal-Bench 3.0とAgents’ Last Examでオープンモデル中1位、CyberGymスコアは2つのフロンティアモデルを上回り、ウェイトは公開スケジュール通りにリリースされます。初週に価値を得るチームは、最大のGPU予算を持つチームではありません。彼らは、スタックのインストール、精度ティアの選択、ベースラインの取得、ハーネスの準備といった、地味な作業に2週間の期間を費やしたチームでしょう。
上記のチェックリストから始めてください。今週中にホストされたベースラインを取得し、それらを保持するためにApidogをダウンロードしてください。1つのコレクション、hostedとlocalの環境、そして「自分のデプロイメントは機能しているか」を、量子化レベルやサービングフラグを変更するたびに再実行できる合否レポートに変えるアサーションを用意します。
