Der KI-Modellbericht vom Juli 2026: Kimi, DeepSeek, Qwen, Gemini, GPT, und Claude
Ein am 24. Juli 2026 überprüfter Modell-Tracker, der Veröffentlichungen, Vorschauversionen, Verspätungen, Zugriffsänderungen und die praktischen Entscheidungen abdeckt, mit denen Entwickler derzeit konfrontiert sind.

Juli 2026 brachte so viele Modellnachrichten, dass eine statische „bestes LLM“-Liste bereits vor der Veröffentlichung überflüssig wird. Das sinnvolle Format ist ein Statusbericht: was Sie nutzen können, was noch in der Vorschau verfügbar ist, was verzögert wird, welche Migrationen dringend sind und was noch von einer zukünftigen Zusage abhängt.
Dieser Bericht über die neuesten KI-Modelle vom Juli 2026 ist bis zum 24. Juli überprüft. Er nutzt die Dokumentationen der Anbieter für den Produktstatus und bewährte Berichterstattung für den Kontext zu Kapazitäten oder Verzögerungen. Er vermeidet es, Anbieter-Benchmark-Behauptungen zu einem unabhängigen Fakt umzuwandeln.
Der Status in einer Minute
Der Marktstatus des Modells Juli 2026 am 24. Juli 2026: überfüllt, leistungsstark und auf mehrere Veröffentlichungsstufen verteilt. GPT-5.6 und Claude Fable 5 sind verfügbar; Kimi K3 ist live mit für den 27. Juli geplanten Gewichten; DeepSeek V4 ist eine Open-Weight-Vorschau; Qwen3.8-Max ist eine ausgewählte Produktvorschau; Gemini 3.6 Flash und 3.5 Flash-Lite sind verfügbar, während 3.5 Pro noch im Partner-Testing ist.
Diese Formulierung ist entscheidend. „Bekanntgegeben“, „Vorschau“, „über ausgewählte Produkte verfügbar“, „allgemein verfügbar“ und „Open-Weight“ beschreiben verschiedene Zugriffsebenen. Ein Modell kann in einem Abonnement-Produkt nutzbar sein, während seine Gewichte, sein technischer Bericht, seine öffentliche API oder seine unternehmensbezogenen Service-Level-Vereinbarungen noch fehlen. Wenn man diese Phasen als austauschbar betrachtet, wandelt sich ein nützlicher Modellleitfaden zu Fehlinformationen.
Der Tracker
| Modell | Stand am 24. Juli | Praktischer Hinweis | |---|---|---| | GPT-5.6 Sol, Terra, Luna | Allgemein verfügbar | Verfügbar über OpenAI-Produkte und die API, mit Stufen nach Leistung und Kosten | | Claude Fable 5 | Verfügbar | Optimiert für ambitionierte Codierung und lang andauernde Wissensarbeit | | Kimi K3 | Service verfügbar | Vollständige Gewichtsangaben und weitere technische Details werden für den 27. Juli angekündigt | | DeepSeek V4 Pro / Flash | Vorschau; API und Gewichte verfügbar | Explizite Modellnamen ersetzen die abgeschafften veralteten Aliase | | Qwen3.8-Max | Vorschau bei ausgewählten Produkten | Vollständiges öffentliches technisches und Veröffentlichungspaket ist nach wie vor begrenzt | | Gemini 3.6 Flash | Verfügbar | Googles aktuelles Arbeitspferd für Programmieraufgaben, Wissensaufgaben, multimodale Aufgaben und Agentenaufgaben | | Gemini 3.5 Flash-Lite | Verfügbar | Hochdurchsatz und kostengünstigere Gemini-Route | | Gemini 3.5 Pro | Partner-Testung | Kein allgemeiner Verfügbarkeitstermin in Googles Beitrag vom 21. Juli |
Die drei betrieblichen Geschichten
Zuerst ist Kapazität ein Wettbewerbsvorteil. Kimis vorübergehende Abonnementspause zeigte, dass die Nachfrage die Inferenzkapazität übertreffen kann, selbst nach einem erfolgreichen Launch. Zweitens ist Lebenszyklusmanagement Produktqualität. Die Einstellung von deepseek-chat und deepseek-reasoner durch DeepSeek zwingt Entwickler, explizite V4-Routen zu nutzen. Drittens zählt Zurückhaltung. Google veröffentlichte neue Flash-Modelle, behielt aber 3.5 Pro in der Testphase, statt ein künstliches GA-Datum bekanntzugeben.
Diese Geschichten zusammen erklären, warum Einkäufer Fallbacks, Model-Adapter, Regressionstestsuiten und ein Feld für den Veröffentlichungsstatus in jedem internen Katalog benötigen.
Was man diesen Monat testen soll
Testen Sie Kimi K3, ob lange Codiersitzungen, visuelle Rückmeldungen oder große Wissensaufgaben zentral sind. Testen Sie DeepSeek V4 Flash und Pro als getrennte Routen; gehen Sie nicht davon aus, dass eine den gesamten Datenverkehr abwickeln soll. Bewerten Sie Qwen3.8-Max in den Produkten, in denen die Vorschau tatsächlich angeboten wird. Für skalierbare Agenten-Workflows vergleichen Sie Gemini 3.6 Flash und 3.5 Flash-Lite. Behalten Sie GPT-5.6 Sol und Claude Fable 5 im Frontier Bake-Off für die schwierigsten Aufgaben.
Ein praktischer Weg zur Bewertung des Modellmarktes vom Juli 2026
Beginnen Sie nicht mit einer Rangliste. Beginnen Sie stattdessen mit einem Aufgabenpaket aus Ihrer eigenen Arbeit: zehn repräsentative Eingaben, das erwartete Ergebnis, ein Zeitlimit und eine kurze Liste unzulässiger Fehler. Für einen Codierungsagenten fügen Sie eine Fehlerbehebung, eine kleine Funktionalität, eine Testreparatur und eine Aufgabe zur Repository-Navigation hinzu. Bei Forschungsarbeiten fügen Sie eine Frage hinzu, deren Antwort sich im Laufe der Zeit ändert, und fordern Sie die Verwendung verlinkter Quellen an. Bei Dokumentenarbeiten fügen Sie unordentliche Tabellen, gescannte Seiten und widersprüchliche Anweisungen hinzu.
Führen Sie jeden Kandidaten mit dem gleichen Kontext, Tools, Berechtigungen und Erfolgskriterien aus. Protokollieren Sie den Aufgabenabschluss, die Zeit für menschliche Korrekturen, die Latenz, den Token-Verbrauch und die Anzahl fehlgeschlagener Tool-Aufrufe. Die letzten beiden Punkte sind leicht zu übersehen, bestimmen aber oft die tatsächlichen Kosten. Ein Modell, das in einem einzigen sauberen Durchgang abgeschlossen wird, kann günstiger sein als ein preiswertes Modell, das in Schleifen läuft, Dateien unnötig umschreibt oder wiederholtes Prompting erfordert.
Behalten Sie einen menschlichen Prüfer im Loop für folgenreiche Arbeiten. Modelle können plausible, aber falsche Erklärungen liefern, übertreiben, was sie überprüft haben, oder eine technisch gültige Änderung vornehmen, die eine Geschäftsregel verletzt. Das sicherste Produktionsdesign gewährt dem Agenten nur die benötigten Berechtigungen, protokolliert Aktionen, erfordert eine Genehmigung vor irreversiblen Schritten und erleichtert das Rollback.
Schließlich wiederholen Sie den Test nach bedeutenden Aktualisierungen des Modells oder des Testrahmens. Die Agentenleistung ist eine Eigenschaft des gesamten Systems – des Modells, des Prompts, der Tool-Definitionen, des Kontextmanagements, der Laufzeit und der Genehmigungsrichtlinie – nicht nur des Modellnamens. Ein Ergebnis aus der Umgebung eines anderen Unternehmens ist ein Beleg, aber keine Garantie für Ihre eigene Umgebung.
Die Kaufentscheidung, die die meisten Teams treffen sollten
Wählen Sie ein Portfolio, nicht einen Champion. Verwenden Sie ein leistungsfähiges Frontier-Modell für den kleinen Anteil an Arbeit, bei dem ein Fehler teuer ist oder die Aufgabe ungewöhnlich schwierig ist. Leiten Sie routinemäßige Klassifizierungs-, Extraktions- und Übersetzungsarbeiten sowie Erstantwürfe im ersten Durchgang an ein schnelleres Modell weiter. Halten Sie mindestens einen alternativen Anbieter oder eine selbst gehostete Option für Ausfälle, Kapazitätsgrenzen, Richtlinienänderungen und plötzliche Preisverschiebungen bereit.
Vor der Unterzeichnung einer großen Zusage berechnen Sie die Kosten pro angenommener Aufgabe statt pro Million Tokens. Beziehen Sie hierbei Wiederholungen, Tool-Aufrufe, zwischengespeicherte Eingaben, menschliche Überprüfung, Ingenieurzeit sowie die Kosten langsamer Antworten ein. Überprüfen Sie anschließend die Datenaufbewahrung, regionale Verarbeitung, Zugriffssteuerungen, Audit-Protokolle, Ratenbegrenzungen sowie die Bedingungen zur Modellveraltung. Diese betrieblichen Details sorgen selten für Schlagzeilen am Launch-Tag, aber sie bestimmen, ob ein KI-Arbeitsablauf den Kontakt mit der Produktion überlebt.
Spezialisierte Produkte können in bestimmten Phasen besser als ein einzelnes universelles Modell sein. Ein allgemeines Modell kann ein Konzept recherchieren, einen Brief strukturieren oder einen Plan prüfen, während ein fokussiertes kreatives, Codierungs-, Rechts- oder Analyseprodukt die Umsetzung übernimmt. Der beste Arbeitsablauf kombiniert oft Tools mit klaren Grenzen, statt jeden Schritt durch einen einzigen Chatbot zu zwingen. Das macht den Austausch ebenfalls einfacher: Ein Team kann eine Phase upgraden, ohne den gesamten Prozess neu gestalten zu müssen.
Wo Elser AI sich natürlich einfügen kann
Creative teams can pair general models with specialist products. A model may turn research into a structured visual brief, while Elser AI can create anime imagery, original characters, videos, and storyboards. This modular approach keeps each tool focused on what it is built to do.
Wie wir Beweise von Hype getrennt haben
Dieser Artikel priorisiert eigene Release-Hinweise des Anbieters, Modellseiten, API-Dokumentationen und benannte Meldungen etablierter Nachrichtenorganisationen. Herstellerangaben zu Benchmarks werden als Herstellerangaben gekennzeichnet, da die Testumgebung, die Inferenz-Einstellungen und die Vergleichsbedingungen einen Score maßgeblich verändern können. Wir werten einen anonymen Screenshot, einen Arena-Spitznamen, einen Social-Media-Countdown oder das Modellmenü eines Wiederverkäufers nicht als Beleg für eine öffentliche Veröffentlichung.
Die Frist ist 24. Juli 2026. Der Produktzugang kann je nach Land, Tarif, Konto und Rollout-Kohorte variieren, und Preise können sich ohne neuen Modellnamen ändern. Bestätigen Sie den aktuellen Modellbezeichner, die Preisliste und die Verfügbarkeit in der eigenen Konsole des Anbieters, bevor Sie bereitstellen. Wenn ein technischer Bericht oder Gewichte zu einem späteren Zeitpunkt versprochen werden, beschreibt dieser Artikel diese Zusage als zukünftigen Plan – nicht als abgeschlossene Veröffentlichung.
Häufig gestellte Fragen
Was ist das neueste breit verfügbare Flaggschiff?
GPT-5.6 und Claude Fable 5 sind derzeit verfügbare Flaggschiffe. „Neuestes“ sollte nicht mit dem Beste für jede Arbeitsbelastung verwechselt werden.
Ist Kimi K3 heute im offenen Gewicht?
Moonshots Service ist live, aber die vollständige Veröffentlichung im vollen Umfang ist für den 27. Juli geplant, drei Tage nach der Sperrfrist dieses Berichts.
Ist DeepSeek V4 nur ein Gerücht?
Nein. Seine API und die Gewichte sind verfügbar, aber DeepSeek kennzeichnet es ausdrücklich als Vorschau.
Ist Qwen3.8 verwendbar?
Qwen3.8-Max-Preview wird in ausgewählten Alibaba-Abonnement- und Codierungsprodukten gemeldet. Details zur umfassenderen Veröffentlichung bleiben unvollständig.
Was ist mit Gemini 3.5 Pro passiert?
Google sagt, dass es mit Partnern testet. Das Unternehmen hat 3.6 Flash und 3.5 Flash-Lite veröffentlicht, ohne die breite Verfügbarkeit von Pro anzukündigen.
Fazit
Der Juli-Markt belohnt Präzision. Kimi ist veröffentlicht, wartet aber auf volle Gewichte; DeepSeek ist zugänglich, aber im Preview; Qwen ist eine ausgewählte Produkt-Vorschau; Geminis Pro wird getestet, während neuere Flash-Produkte ausgeliefert werden; GPT-5.6 und Claude Fable 5 sind verfügbare Frontier-Optionen. Verwenden Sie diese Kennzeichnungen, testen Sie die tatsächliche Arbeit und halten Sie Ihre Architektur bereit für die nächste Änderung.
Quellen und Überprüfung
- OpenAI: GPT-5.6 Veröffentlichung
- Anthropic: Claude Fable 5
- Moonshot AI: Kimi K3 technischer Blog
- AP: Kimi pausiert neue Abonnements, nachdem die Nachfrage die Kapazität übersteigt
- DeepSeek: V4 Vorschau-Release
- SCMP: Alibaba stellt Qwen3.8-Max-Preview vor
- Google: Gemini 3.6 Flash, 3.5 Flash-Lite und 3.5 Flash Cyber
- Reuters: Start von Gemini 3.5 Pro verschoben
Redaktioneller Hinweis: Dieser Artikel wurde recherchiert und zuletzt am 24. Juli 2026 überprüft. Anbieter-Zugänge, Preise und Vorschau-Status können sich ändern; prüfen Sie die verlinkten erstparteilichen Dokumentationen vor einer Produktionsentscheidung.






































