Kimi K3 vs Kimi K2.7: Was sich am Code geändert hat

Kimi K3 vs. Kimi K2.7 Code im Vergleich: der Sprung in der Skalierung, die neue Aufmerksamkeitsarchitektur, 1 Mio. Kontext, Preisänderungen und ein klarer Leitfaden für die Entscheidung, ob man migrieren oder bleiben soll.

INEZA Felin-Michel

INEZA Felin-Michel

17 July 2026

Kimi K3 vs Kimi K2.7: Was sich am Code geändert hat

Apidog für Unternehmen

On-Premises Bereitstellung

SSO & RBAC

SOC 2 konform

Apidog Enterprise entdecken

Wenn Sie bereits Kimi nutzen, wirft die Einführung von Kimi K3 am 16. Juli 2026 eine praktische Frage auf: Ist dies das Upgrade, zu dem Sie wechseln sollten, oder ein größeres, teureres Modell, das Sie vorerst überspringen können? Kimi K2.7 Code ist die auf Codierung spezialisierte Version der K2-Reihe, und viele Teams haben sie im letzten Quartal in ihre Agenten und CI integriert. K3 ist ein anderes Kaliber: Moonshots neues Flaggschiff, das in einem viel größeren Maßstab gebaut wurde, mit einem neuen Aufmerksamkeitsdesign und einem 1M-Token-Kontextfenster. Dieser Artikel schlüsselt auf, was sich wirklich geändert hat, was Marketing ist und wie Sie entscheiden, ob Sie migrieren sollten.

Wir sind hier nicht neutral: Wir haben die Anleitungen zu beiden Modellen geschrieben, daher ist dies die ehrliche Upgrade-Empfehlung, die wir einem Kollegen geben würden. Da beide eine OpenAI-kompatible API bereitstellen, können Sie dieselbe Anfrage sowohl über kimi-k3 als auch kimi-k2-7-code nebeneinander in Apidog ausführen und die Unterschiede bei Ausgaben, Latenz und Token-Verbrauch lesen, bevor Sie Produktionscode umschreiben. Zuerst das Fazit.

Button

TL;DR: Das Fazit auf einen Blick

Zwei verschiedene Arten von Modellen

Bevor Sie Spezifikationen vergleichen, verstehen Sie dies: K2.7 Code und K3 wurden für unterschiedliche Aufgaben entwickelt.

Kimi K2.7 Code ist das auf Codierung spezialisierte Mitglied der K2-Linie (K2, K2 Thinking, K2.5, K2.6, dann K2.7 Code), die in der ~1T-Parameter-Klasse gipfelte. Sie richtete diese Linie stark auf Codegenerierung, -bearbeitung und agentische Entwickleraufgaben aus: Wenn Ihre Aufgabe „Code über eine API schreiben und reparieren“ war, war es eine abgestimmte, kostengünstige Wahl. Für genaue K2.7 Code-Parameterzahlen, Kontext und Preise, siehe unseren Erklärartikel Was ist Kimi K2.7 Code.

K3 ist keine Codierungs-Version. Es ist das neue Flaggschiff, Moonshots leistungsfähigstes allgemeines Modell, wobei Codierung eine starke Fähigkeit innerhalb eines breiteren Spektrums ist. Sie vergleichen also nicht alten Coder gegen neuen Coder; Sie vergleichen einen Spezialisten mit einem Generalisten, der auch gut im Programmieren ist, und das ist der Hauptgrund für die Migrationsentscheidung.

Was sich tatsächlich geändert hat, Generation für Generation

Hier ist, was sich geändert hat, ohne das Marketing-Blabla.

Skalierung: ungefähr das Dreifache der Gesamtparameter

K3 ist ein 2,8T-Parameter-Mixture-of-Experts-Modell. Die K2-Linie, aus der K2.7 Code hervorging, befand sich in der ~1T-Parameter-Klasse, sodass K3 die Gesamtparameter grob verdreifacht. Ein Vorbehalt: Moonshot hat die Anzahl der aktiven Parameter von K3 nicht veröffentlicht. MoE-Modelle verwenden pro Token nur einen Bruchteil ihrer Gewichte, daher ist „2,8T insgesamt“ nicht die Zahl, die die Inferenzkosten bestimmt. Lesen Sie 2,8T nicht als „2,8T Parameter werden bei jeder Anfrage ausgelöst“. Was Moonshot veröffentlicht hat, ist das Aktivierungsmuster, das als Nächstes behandelt wird.

Eine neue Aufmerksamkeitsarchitektur, keine skalierte

Dieser Teil ist wirklich neu und nicht nur größer. K3 basiert auf drei benannten Komponenten:

Moonshot berichtet über eine grobe 2,5-fache Verbesserung der Skalierungseffizienz im Vergleich zu Kimi K2: mehr Leistungsfähigkeit pro Recheneinheit, nicht nur mehr Rechenleistung. K2.7 Code, ein Modell der K2-Generation, enthält dieses Redesign nicht, sodass der Unterschied nicht nur „größer“ ist, sondern auch „anders gebaut“.

Kontext: bis zu 1M Tokens

K3 unterstützt ein Kontextfenster von 1.048.576 Tokens. Für einen Codierungs-Workflow ist das der Unterschied zwischen dem Zuführen einer Handvoll Dateien an einen Agenten und dem Übergeben eines großen Teils eines echten Repositorys, seiner Tests und seiner Protokolle auf einmal. Wenn Sie mit K2.7 Code bei Aufgaben mit großen Repositories an Kontextgrenzen stoßen, ist dies die einzige Änderung, die im Alltag am wichtigsten sein dürfte.Positionierung: vom Spezialisten zum Flaggschiff-Generalisten

K2.7 Code war eine Codierungs-Version; K3 ist das Flaggschiff, das „leistungsfähigste“ Modell, das auch gut in langfristiger agentischer Codierung ist. Moonshot verweist auf autonome Läufe bei schwierigen, mehrstufigen Problemen, einschließlich eines einzelnen 48-stündigen Laufs bei einer Chip-Design-Aufgabe. Ob diese Anekdoten auf Ihre Arbeitslast zutreffen, müssen Sie testen, nicht einfach glauben. Aber die Absicht ist klar: K3 richtet sich an Agenten, die lange laufen und Zustände halten, wo der 1M-Kontext und das neue Aufmerksamkeitsdesign sich auszahlen.

Preise: Flaggschiff-Tarife

K3 listet $0,30 pro Million Tokens für Cache-Hit-Eingabe, $3 pro Million für Cache-Miss-Eingabe und $15 pro Million für Ausgabe. Der 10-fache Unterschied bei der Eingabe ist der interessante Teil. Bei Arbeitslasten mit einer hohen Cache-Hit-Rate, wie agentischer Codierung, die einen großen System-Prompt und Repository-Kontext über viele Aufrufe hinweg wiederverwendet, liegen die effektiven Eingabekosten viel näher bei $0,30 als bei $3; bei Einmalaufrufen mit neuem Kontext zahlen Sie den $3-Listenpreis. Die Ausgabe von $15/M ist Flaggschiff-Niveau ohne Rabattmöglichkeit. Für die vollständige Cache-Berechnung siehe unseren Kimi K3 Preisleitfaden und bestätigen Sie die Tarife von K2.7 Code, bevor Sie annehmen, dass K3 pro Aufgabe strikt teurer ist.

Kimi K3 vs. Kimi K2.7 Code: Seite an Seite

Dimension Kimi K2.7 Code Kimi K3
Positionierung Auf Codierung spezialisierte Version der K2-Reihe Flaggschiff „leistungsfähigstes“ allgemeines Modell, stark in agentischer Codierung
Generation K2-Linie (K2 bis K2.6 bis K2.7 Code) Neue K3-Generation
Gesamtparameter ~1T-Klasse (K2-Linie) 2,8T insgesamt (MoE)
Aktive Parameter Bestätigen Sie im Vergleich zu unserem K2.7 Code Beitrag Nicht veröffentlicht; 16 von 896 Experten aktiv
Aufmerksamkeitsdesign K2-Generation Aufmerksamkeit Kimi Delta Attention + Attention Residuals
MoE-Framework K2-Generation MoE Stable LatentMoE (16/896 Experten)
Kontextfenster Bestätigen Sie im Vergleich zu unserem K2.7 Code Beitrag 1.048.576 Tokens (1M)
Modell-ID kimi-k2-7-code kimi-k3
API-Kompatibilität OpenAI-SDK-kompatibel OpenAI-SDK-kompatibel
Listenpreise Bestätigen Sie im Vergleich zu unserem K2.7 Code Beitrag $0,30/$3 Eingabe (Cache-Hit/Miss), $15 Ausgabe pro M
Offene Gewichte Siehe unsere K2.7 Code Berichterstattung Erwartet um den 27. Juli 2026
Unabhängiges Signal Siehe unsere K2.7 Code Berichterstattung Artificial Analysis Intelligence Index 57, #4/189
Beste Eignung Eng gefasste Codierung zu bekannten Kosten Großer Kontext, langer Zeithorizont, allgemeine + Codierungsarbeiten

Ein Hinweis zu den mit „bestätigen“ markierten Zellen: Wir erfinden bewusst keine exakten K2.7 Code-Zahlen. Wo Sie eine präzise K2.7-Spezifikation benötigen, sind unser Beitrag Was ist Kimi K2.7 Code und unser Kimi K2.7 Code API-Leitfaden die vertrauenswürdigen Quellen. Die vergleichende Formulierung von K3 hält den Vergleich ehrlich.

Wo K3 tatsächlich im Vergleich zur Spitze steht

Es wäre leicht, „2.8T Flaggschiff“ als „neues bestes Modell“ zu lesen, daher hier der Teil, den Anbieter normalerweise abmildern. Moonshots eigener Launch-Blog besagt, dass K3 Claude Fable 5 und GPT-5.6 Sol immer noch hinterherhinkt. Es ist auf spezifischen Benchmarks konkurrenzfähig und bei einigen sogar führend, beansprucht aber nicht die Gesamtkrone.

Die unabhängige Einschätzung bestätigt dies. Artificial Analysis weist K3 einen Intelligence Index von 57 zu, Rang #4 von 189 Modellen, mit einer Ausgabe von rund 62 Tokens pro Sekunde, was für seine Preisklasse eher langsam ist. Bei den von Moonshot veröffentlichten Codierungs-Benchmarks ist das Bild eher gemischt als dominant: Bei DeepSWE meldet es K3 mit 67,5 gegenüber Fable 5s 70,0, und bei Terminal-Bench 2.1 meldet es K3 mit 88,3 gegenüber Fable 5s 84,6. K3 gewinnt einige und verliert einige gegen die Spitze, ein starkes Ergebnis für ein Open-Weight-Modell und kein Grund, es zu überverkaufen. Lesen Sie Moonshots vollständige Aussagen im offiziellen Kimi K3 Launch-Post; wir beleuchten die Lücke zwischen Anbieter und Unabhängigen in unserer Kimi K3 Benchmarks-Analyse.

Für Ihre Migrationsentscheidung ist „eine Verbesserung gegenüber dem eigenen Vorgänger“ eine andere Aussage als „schlägt jedes geschlossene Modell“. Beides trifft gleichzeitig zu.

Sollten Sie migrieren oder bei K2.7 Code bleiben?

Überprüfen Sie Ihre Arbeitslast der Reihe nach anhand dieser Fragen.

Migrieren Sie zu K3, wenn eine der folgenden Aussagen zutrifft

Bleiben Sie bei K2.7 Code, wenn eine der folgenden Aussagen zutrifft

Praxisbeispiele

Einige konkrete Profile, da abstrakter Rat nur begrenzt hilfreich ist.

Für die praktische Einrichtung decken unsere Kimi K3 Codierungs-Anleitung und unser Kimi K3 API-Leitfaden die Modellauswahl und den OpenAI-kompatiblen Schnellstart ab; wenn Sie noch die ältere Linie verwenden, ergänzt der K2.6-Erklärer die Abstammung.

Wie Sie die beiden per A/B-Test prüfen, bevor Sie sich festlegen

Der einfachste Weg zur Entscheidung ist, dieselbe Anfrage durch beide Modelle zu senden und den Unterschied zu lesen. Da beide OpenAI-SDK-kompatibel sind, ist das wenig Aufwand.

Richten Sie eine Anfrage an den Moonshot-Endpunkt mit dem Modell kimi-k2-7-code und eine zweite identische Anfrage mit kimi-k3. Halten Sie alles andere konstant: denselben System-Prompt, dieselbe Benutzer-Nachricht, Temperatur und dieselben Tools. Vergleichen Sie dann die drei Dinge, die Ihre Entscheidung beeinflussen:

  1. Ausgabe-Qualität bei Ihren echten Prompts, beurteilt so, wie Sie die Produktionsausgabe beurteilen, nicht nach Gefühl.
  2. Latenz, da K3 laut seiner unabhängigen Geschwindigkeitsmessung das langsamere Modell ist, was in interaktiven Anwendungen einen Qualitätsgewinn überwiegen kann.
  3. Token-Verbrauch, einschließlich der Frage, wie Ihre Cache-Hit-Rate die effektiven Eingabekosten zwischen den beiden ändert.

Apidog macht diesen Side-by-Side-Workflow unkompliziert. Speichern Sie beide Anfragen in einem Projekt, tauschen Sie die Modell-ID als Umgebungsvariable aus, beobachten Sie Server-Sent-Event-Streaming-Antworten in Echtzeit, inspizieren Sie Tool-Call-Payloads und sehen Sie den Token-Verbrauch pro Aufruf. Duplizieren Sie die Anfrage, ändern Sie ein Feld, und Sie haben einen kontrollierten A/B-Test ohne überflüssigen Testcode. Laden Sie Apidog herunter, um es einzurichten, und wenn Sie in einem Editor arbeiten, sorgt die Apidog-Integration in VS Code dafür, dass es neben Ihrem Code bleibt. Es ist ein kostenloser Weg, auf Basis von Fakten und nicht von Marketing zu entscheiden.

Das Fazit

K3 ist ein echter Generationssprung gegenüber K2.7 Code, keine Umbenennung. Es verdreifacht grob die Gesamtparameter auf 2,8T, bietet eine neue Aufmerksamkeitsarchitektur (Kimi Delta Attention, Attention Residuals, Stable LatentMoE), erweitert den Kontext auf 1M Tokens und positioniert das Produkt neu vom Codierungs-Spezialisten zum Flaggschiff-Generalisten. Es kostet auch mehr zum Listenpreis, und nach Moonshots eigener Aussage liegt es immer noch hinter Fable 5 und GPT-5.6 Sol zurück, sodass das Upgrade nicht automatisch ist. Wenn Sie den Kontext, die allgemeine Argumentation oder das langfristige Agentenverhalten benötigen, wechseln Sie. Wenn K2.7 Code Ihre Anforderungen zu einem Preis erfüllt, der Ihnen gefällt, ist es vertretbar zu bleiben. Führen Sie beide mit Ihren eigenen Prompts aus, lesen Sie die Unterschiede und lassen Sie die Beweise entscheiden.

Button

Häufig gestellte Fragen

Welches ist besser zum Codieren? K2.7 Code wurde speziell für die Codierung optimiert und ist eine starke, kostengünstige Wahl für eng gefasste Code-Aufgaben. K3 ist ein Flaggschiff-Generalist, auch gut in langfristiger agentischer Codierung, mit einem viel größeren Kontext. Für große Repositorys und mehrstufige Agentenarbeiten hat K3 den strukturellen Vorteil; für eng gefasste Codierung, die K2.7 gut bewältigt, kann K2.7 Code die intelligentere Investition sein.

Ist Kimi K3 teurer als K2.7 Code? K3 listet $0,30/M Cache-Hit-Eingabe, $3/M Cache-Miss-Eingabe und $15/M Ausgabe, was Flaggschiff-Niveau ist. Ob es pro Aufgabe teurer ist, hängt von Ihrer Cache-Hit-Rate und der Ausgabefreudigkeit ab. Vergleichen Sie daher die effektiven Kosten für Ihre eigene Arbeitslast. Beide Modelle sind OpenAI-SDK-kompatibel, sodass der Wechsel hauptsächlich eine Änderung der Modell-ID plus einen erneuten Prompt-Test bedeutet.

Ist Kimi K3 Open Source? Nicht am Starttag. Moonshot sagte, dass die vollständigen Modellgewichte voraussichtlich um den 27. Juli 2026 erwartet werden. Bis dahin ist K3 nur über API und App verfügbar. Betrachten Sie jeden Selbsthosting-Plan als abhängig von dieser Veröffentlichung.

Ist K3 besser als Claude Fable 5 oder GPT-5.6 Sol? Laut Moonshots eigenem Blog: nein. K3 liegt insgesamt hinter beiden zurück, obwohl es auf spezifischen Benchmarks konkurrenzfähig oder sogar führend ist. Unabhängig davon platziert Artificial Analysis es mit einem Intelligence Index von 57 auf Platz 4 von 189. Es ist ein starker Open-Weight-Kandidat, aber nicht der uneingeschränkte Spitzenreiter.

Praktizieren Sie API Design-First in Apidog

Entdecken Sie eine einfachere Möglichkeit, APIs zu erstellen und zu nutzen