Mistral ist zurück: Le Chonk schlägt GPT-6 Astra und Claude

Mistral Large 4 erzielt 82 % bei einem Cybertest, während GPT-6 Astra und Claude Opus 5.5 nahezu null erreichen. Hier ist der Grund, plus Spezifikationen, die Preisgestaltung von 0,68 $ und wo es verliert.

Ashley Innocent

Ashley Innocent

6 October 2026

Mistral ist zurück: Le Chonk schlägt GPT-6 Astra und Claude

Apidog für Unternehmen

On-Premises Bereitstellung

SSO & RBAC

SOC 2 konform

Apidog Enterprise entdecken

Mistral war eine Weile im Top-Segment eher ruhig. Mistral Large 3 wurde im Dezember 2025 veröffentlicht, und seitdem drehte sich die Diskussion im Bereich der Open-Weight-Modelle um Kimi, DeepSeek, GLM und Qwen. Am 6. Oktober 2026 antwortete Mistral mit Mistral Large 4, einem Modell mit 1 Billion Parametern, das das Team „Le Chonk“ nennt.

Die Schlagzeile ist ein Cyber-Benchmark, bei dem Large 4 82 % erreicht, während Claude Opus 5.5 und GPT-6 Astra nahezu null Punkte erzielen. Das stimmt, es steht auf Mistrals Startseite, und es bedarf eines einzigen Satzes Kontext, bevor Sie es teilen. Dieser Artikel liefert Ihnen diesen Kontext, die Spezifikationen, den tatsächlichen Preis und wo Large 4 immer noch verliert.

TL;DR

Warum „Mistral ist zurück“ berechtigt ist

Den größten Teil des Jahres 2026 kamen die stärksten Open-Weight-Modelle aus China. Mistral lieferte weiterhin Modelle wie Medium 3.5, Devstral 2 und Small 4 aus, aber nichts, was mit den führenden geschlossenen Modellen auf deren eigenem Terrain konkurrieren konnte.

Large 4 ändert die Situation. Mistral behauptet, es „übertrifft jedes in den USA oder Europa entwickelte Open-Weight-Modell signifikant“, und untermauert dies mit einer Trainingsgeschichte, die auf das Publikum abzielt, das Wert auf EU-Souveränität legt. Das Modell wurde von Grund auf auf 3.800 NVIDIA Grace Blackwell GPUs in Mistrals eigenen europäischen Rechenzentren trainiert, deckt mehr als 160 Sprachen ab, einschließlich jeder offiziellen EU-Sprache, und erscheint Wochen nach einer Series-D-Finanzierungsrunde über 3 Milliarden Euro, die Mistral als die größte Eigenkapitalrunde bezeichnet, die jemals von einem europäischen Technologieunternehmen aufgenommen wurde.

Auch das Timing ist entscheidend. Large 4 kam direkt nachdem Reflection sein Open-Weight-Modell Beam vorgestellt hatte, sodass das Rennen der Open-Modelle zwischen den USA und China nun einen dritten ernsthaften Teilnehmer hat.

Die Cyber-Schlagzeile und der Haken

Hier ist das Ergebnis, das jeder als Screenshot festhält. Der Artificial Analysis Cyber Index enthält einen Test, der ein Modell auffordert, eine echte Schwachstelle in Open-Source-Software zu reproduzieren und sie dann zu patchen. Mistral sagt, dass Large 4 82 % erreicht, der höchste Wert aller Modelle.

Dann der Haken, in Mistrals eigenen Worten: „Mehrere führende geschlossene Modelle, darunter Claude Opus 5.5 und GPT-6 Astra, erzielen bei demselben Test nahezu null Punkte, weil sie die Durchführung der Aufgabe verweigern.“

Lesen Sie es also so:

Behauptung Was es tatsächlich bedeutet
„Large 4 schlägt Astra und Opus 5.5 im Cyber-Bereich“ Bei diesem einen Test lehnen die geschlossenen Modelle eine Antwort ab. Large 4 antwortet und ist in der Regel erfolgreich.
„Large 4 ist das beste Hacking-Modell“ Nicht nachgewiesen. Eine Verweigerung ist eine politische Entscheidung, keine Leistungsgrenze.
„Large 4 ist unsicher“ Ebenfalls nicht nachgewiesen. Mistral berichtet, dass seine durchschnittliche Ablehnungsrate bei Cyber-Prompts von JailbreakBench, StrongREJECT und AgentHarm höher ist als bei jedem anderen Open-Weight-Modell.

Hinter der Schlagzeile steckt echte Leistungsfähigkeit. Large 4 löst auch 93 % von Cybench, einer Reihe von 40 Capture-the-Flag-Übungen, was Mistral als eines der höchsten gemeldeten Ergebnisse für ein Open-Weight-Modell bezeichnet. Beim B3 Agent Security Benchmark widersteht es 93,3 % der Angriffe.

Für Sicherheitsteams ist diese Kombination die eigentliche Geschichte: ein Modell, das Sie selbst hosten können, das bei der Reproduktion und Behebung einer CVE in Ihrem eigenen Code hilft, während es die meisten eindeutig schädlichen Anfragen weiterhin ablehnt. Für API-Teams ist dies ein nützliches Werkzeug, das auf der eigenen Hardware läuft, anstatt hinter dem Policy-Filter eines anderen zu stecken.

Wo Large 4 GPT-6 Astra außerhalb des Cyber-Bereichs schlägt

Das Cyber-Ergebnis ist das lauteste. Zwei weitere Siege gegen Astra sind leiser und bedeutsamer, da beide Modelle die Aufgabe tatsächlich versucht haben:

Benchmark Mistral Large 4 GPT-6 Astra Anmerkungen
Dense 200 (visuelle Verankerung) 42% 41% Ein Ein-Punkt-Vorsprung. Real, aber gering.
Finance Agent v2 (vals.ai) Vorn Hinten Mistral meldet die Rangliste, nicht die Punktzahlen.
Harvey Legal Agent Benchmark Bestes Open-Modell Aufgeführt Keine direkten Zahlen veröffentlicht.

Gegenüber anderen Open-Modellen ist der Vorsprung größer:

Benchmark Mistral Large 4 Wen es schlägt
AutomationBench (657 Workflows) 59.9% Kimi K3, DeepSeek V4 Pro
AA-Briefcase (Wissensarbeit) 1.393 Elo DeepSeek V4 Pro
DeepSWE v1.1 (Codierung) 61.7% Führt Open-Weight-Modelle an
SWE-Atlas-QnA 59.4%
Terminal-Bench 4.0 28.3%

All dies sind von Mistral gemeldete Zahlen des Vorschau-Modells. Noch kein unabhängiges Labor hat sie erneut ausgeführt, und Euronews berichtet, dass das Reinforcement Learning zum Zeitpunkt des Starts noch nicht abgeschlossen war. Betrachten Sie sie als ein starkes Signal, nicht als ein Urteil.

Wo es immer noch verliert

Mistral veröffentlichte ein Ergebnis, bei dem ein geschlossenes Modell eindeutig gewinnt. Bei einer menschlichen Bewertung der Codequalität, die von Surge AI über fünf Modelle durchgeführt wurde, belegte Large 4 Preview den zweiten Platz:

Modell Menschliche Codebewertung (von 5)
Claude Opus 5 4.22
Mistral Large 4 Preview 3.74
GLM-5.3 3.60
Kimi K3 3.59
GLM-5.2 3.40

Das ist ein klarer Sieg über die besten chinesischen Open-Modelle und ein Halbpunkt-Rückstand gegenüber Claude. Mistrals eigene Formulierung besagt, dass Large 4 „die Lücke zu den führenden Modellen“ in der Codierung schließt, was eine ehrliche Einschätzung ist.

Ebenfalls fehlend: Es gibt nirgendwo in den Startmaterialien einen Vergleich mit Claude Fable 5.1 oder GPT-6 Sol. Wenn Ihnen jemand sagt, Large 4 schlägt Fable, fragen Sie nach dem Benchmark.

Spezifikationen auf einen Blick

Spezifikation Mistral Large 4
API-Modell-ID mistral-large-4 (Alias mistral-large-4-0)
Version 26.10, öffentliche Vorschau
Architektur Mixture-of-Experts, hybride Instruktion + Reasoning
Parameter Insgesamt 1,05 T, 49 B aktiv, 1,6 B Vision-Encoder
Kontextfenster 1 M Token
Eingabe Text, Bilder
Reasoning (Denkprozess) reasoning_effort Parameter ("high" oder "none")
Tools Funktionsaufruf, strukturierte Ausgaben, integrierte Agenten-Tools
Endpunkte /v1/chat/completions, /v1/conversations, /v1/agents, /v1/batch
Gewichte Offen, bis Ende Oktober 2026; Lizenz noch nicht veröffentlicht

Preis: Das günstigste Frontier-Klasse-Modell, das Sie heute aufrufen können

Dieser Teil sollte API-Teams aufhorchen lassen. Mistrals Preisseite listet Large 4 während der Vorschau zum halben Listenpreis:

Modell Eingabe / 1 Mio. Ausgabe / 1 Mio. Open Weights
Mistral Large 4 (Vorschaupreis) 0,68 $ 2,09 $ Ja, Ende Oktober
Mistral Large 4 (Listenpreis) 1,36 $ 4,18 $ Ja, Ende Oktober
Claude Opus 5.5 4,00 $ 20,00 $ Nein
GPT-6 Astra 10,00 $ 50,00 $ Nein

Zum Vorschaupreis kosten die Large 4-Ausgaben etwa ein Vierundzwanzigstel derer von Astra. Selbst zum Listenpreis ist es bei der Ausgabe etwa 12-mal günstiger. Gecachte Eingaben sinken auf 0,07 $ pro Million, was für Agenten wichtig ist, die bei jeder Runde denselben System-Prompt und dieselben Tool-Definitionen erneut senden.

Mistral hat nicht mitgeteilt, wann der Vorschau-Rabatt endet, planen Sie also mit dem Listenpreis.

Sollten Sie wechseln?

Wie Sie Large 4 in Apidog gegen Ihre eigenen APIs testen

Benchmarks sagen Ihnen, wie ein Modell bei Aufgaben anderer abschneidet. Der schnellere Weg zur Entscheidung ist, Large 4 mit Ihren eigenen Prompts auszuführen und es mit dem Modell zu vergleichen, für das Sie heute bezahlen. Apidog erledigt dies ohne eine Zeile zusätzlichen Code:

  1. Speichern Sie die Anfrage einmal. Erstellen Sie POST https://api.mistral.ai/v1/chat/completions, speichern Sie Ihren Schlüssel als Umgebungsvariable und setzen Sie Authorization: Bearer {{MISTRAL_API_KEY}}.
  2. Klonen Sie sie pro Modell. Duplizieren Sie die Anfrage, ändern Sie nur das model-Feld (mistral-large-4 vs. Ihr aktuelles Modell) und senden Sie beide. Apidog zeigt die Antwort, den Status, die Latenz und die Größe nebeneinander an, und der usage-Block gibt Ihnen die Token-Anzahl für einen Kostenvergleich.
  3. Fügen Sie Behauptungen hinzu. Prüfen Sie auf einen 200-Status, eine nicht-leere Antwort und eine JSON-Schema-Übereinstimmung, wenn Sie eine strukturierte Ausgabe anfordern. Dies verwandelt ein einmaliges Experiment in einen Regressionstest.
  4. Führen Sie es bei jedem Modell-Update erneut aus. Gruppieren Sie die Anfragen in ein Testszenario und führen Sie es erneut aus, wenn Mistral die Vorschau aktualisiert oder die Gewichte veröffentlicht. Sie werden sehen, ob die Qualität abgewichen ist, bevor Ihre Benutzer es tun.

Zwei Stärken von Large 4 passen natürlich zur API-Arbeit. Seine Sicherheitsergebnisse machen es zu einem guten zweiten Prüfer für API-Sicherheitstests, zum Beispiel wenn Sie einen Auth-Bypass in Ihrer eigenen Staging-API reproduzieren. Seine Funktion zum Aufrufen von Funktionen und die strukturierten Ausgaben ermöglichen es Ihnen, eine in Apidog entworfene OpenAPI-Spezifikation in Tool-Definitionen umzuwandeln, die ein Agent aufrufen kann.

Für eine vollständige Code-Anleitung, einschließlich Schlüssel, Reasoning-Chunks, Bildern, Funktionsaufrufen und Kostenberechnung, siehe unseren Mistral Large 4 API-Leitfaden. Kommen Sie von einem älteren Mistral-Modell? Die Mistral AI API-Grundlagen und der Mistral Medium 3.5 API-Leitfaden gelten weiterhin: gleiche Basis-URL, gleiche Authentifizierung, neue Modell-ID.

FAQ

Ist Mistral Large 4 Open Source? Es ist Open-Weight. Mistral sagt, dass die Gewichte bis Ende Oktober 2026 veröffentlicht werden. Die Lizenz wurde noch nicht veröffentlicht, gehen Sie also nicht davon aus, dass sie mit der Apache 2.0-Lizenz von Large 3 übereinstimmt.

Schlägt Mistral Large 4 wirklich GPT-6 Astra? Bei der visuellen Verankerung (42 % vs. 41 %) und Finance Agent v2, ja, laut Mistrals Zahlen. Beim Cyber-Schwachstellentest erzielt Astra nahezu null Punkte, weil es sich weigert, daher ist das kein direkter Sieg.

Schlägt es Claude? Nicht bei der Codierung. Claude Opus 5 führt die menschliche Codebewertung mit 4,22 zu 3,74 an. Claude Opus 5.5 verweigert auch die Cyber-Reproduktionsaufgabe, weshalb es dort nahezu null Punkte erzielt.

Was bedeutet „Le Chonk“? Es ist Mistrals inoffizieller Spitzname für das Modell, ein Witz über seine Größe. Der offizielle Name ist Mistral Large 4, oder ML4.

Kann ich es kostenlos nutzen? Mistrals kostenloser Plan beinhaltet 10 $ API-Guthaben pro Monat und Zugriff auf die neuesten Modelle in Le Chat und Vibe. Zum Vorschaupreis ergeben 10 $ etwa 4,8 Millionen Output-Token auf Large 4.

Fazit

Mistral ist zurück in der Frontier-Diskussion. Large 4 ist nach Mistrals Zahlen das stärkste Open-Weight-Modell außerhalb Chinas, kostet einen Bruchteil von Astra oder Opus 5.5 und wird innerhalb weniger Wochen auf Ihrer eigenen Hardware laufen. Die Aussage „schlägt Astra und Claude im Cyber-Bereich“ ist real, resultiert aber aus Verweigerungen, und das ehrliche Urteil zur Codierung lautet „Zweiter nach Claude“. Testen Sie es jetzt in Apidog mit Ihren eigenen APIs, solange der Vorschaupreis gilt, und warten Sie mit Ihrer Produktionsentscheidung, bis nach dem 27. Oktober unabhängige Benchmarks vorliegen.

Button

Praktizieren Sie API Design-First in Apidog

Entdecken Sie eine einfachere Möglichkeit, APIs zu erstellen und zu nutzen