GPT-6 Astra Prompt-Caching-Leitfaden: So reduzieren Sie Kosten für wiederholte Kontexte
Erfahren Sie, wie GPT-6 Astra Prompt-Caching funktioniert, wie Sie wiederverwendbare Präfixe strukturieren, Cache-Breakpoints platzieren, Treffer messen und teure Cache-Fehlschläge vermeiden.

Große Agent-Prompts wiederholen oft dieselbe Systemrichtlinie, Tool-Definitionen, Produktdokumentation, Beispiele und Gesprächsverlauf. Das erneute Senden dieses Materials ist manchmal unvermeidbar; die vollen Eingabekosten und Latenz für ein identisches Präfix zu zahlen, ist es nicht. GPT-6 Astra unterstützt Prompt-Caching in der Responses API, sodass wiederholte Präfixe wiederverwendet werden können.
Caching ist eine Optimierung, kein Speicher. Es sorgt nicht dafür, dass sich ein Modell zwischen Anfragen an einen Kunden erinnert, und es ändert nicht, was das Modell sieht. Die Anfrage benötigt weiterhin die relevanten Eingaben. Der Unterschied besteht darin, dass ein berechtigtes, identisches Präfix aus dem Cache zu einem niedrigeren gecachten Eingabentarif bedient werden kann.
Was GPT-6 Astra zwischenspeichert
Der Cache ist präfixbasiert. OpenAI kann Tokens vom Anfang eines Prompts wiederverwenden, wenn die nächste Anfrage mit übereinstimmendem Inhalt beginnt. Ein nützliches mentales Modell ist ein Dokument, dessen stabile Kapitel zuerst kommen und dessen anfragenspezifischer Anhang zuletzt kommt.
Stelle diese in die Nähe der Vorderseite:
- stabile Entwickleranweisungen;
- Tool-Schemas in einer stabilen Reihenfolge;
- lange Referenzdokumente, die über mehrere Anfragen hinweg verwendet werden;
- kanonische Beispiele und Ausgaberegeln.
Setzen Sie diese gegen Ende:
- die aktuelle Benutzernachricht;
- Zeitstempel, Anfrage-IDs und temporärer Zustand;
- abgerufene Passagen, die sich bei jedem Aufruf ändern;
- Benutzerspezifische Einstellungen, die nicht geteilt werden.
Ein Zeitstempel, der nahe dem Anfang eingefügt wird, kann alles danach ungültig machen. Ebenso kann die Erzeugung von Tool-Arrays aus einer ungeordneten Map semantisch identische, aber byte-unterschiedliche Präfixe erzeugen. Erstelle Prompts deterministisch.
Implizites und explizites Caching
GPT-5.6 und neuere Modelle legen prompt_cache_options offen. Im impliziten Modus erkennt der Dienst automatisch einen wiederverwendbaren Haltepunkt. Dies ist der einfachste Ausgangspunkt und geeignet, wenn Ihr Prompt ein großes, stabiles Präfix hat.
import OpenAI from "openai";
const client = new OpenAI();
const response = await client.responses.create({
model: "gpt-6-astra",
prompt_cache_key: "support-agent:v4",
prompt_cache_options: { mode: "implicit", ttl: "30m" },
input: [
{ role: "developer", content: "Stabile Richtlinien und Betriebsanweisungen..." },
{ role: "user", content: "Warum wurde meine Rechnung dupliziert?" }
]
});
Der aktuell dokumentierte TTL-Wert ist 30m, und 30 Minuten sind der Standardwert. Entwickeln Sie keine Lösungen auf Basis nicht dokumentierter Zeiträume. OpenAI kennzeichnet das ältere Feld prompt_cache_retention zudem als veraltet.
Der explizite Modus gibt der Anwendung mehr Kontrolle. Sie fügen prompt_cache_breakpoint-Inhaltselemente an sinnvollen Grenzen ein. Dies ist nützlich, wenn ein Prompt aus mehreren stabilen Blöcken, gefolgt von veränderlichem Material, zusammengesetzt ist. Eine Anfrage kann maximal vier Haltepunkte setzen, und der Dienst berücksichtigt bis zu den letzten 80 Haltepunkten. Mehr Haltepunkte sind nicht automatisch besser: Jeder Eintrag verursacht Kosten, und fragmentierte Präfixe können schwieriger zu durchschauen sein.
Eine praktische Präfix-Architektur
Für einen Produktionsagenten verwenden Sie vier Ebenen:
1. Identität und Sicherheit
Platziere die dauerhafte Rolle, die Sicherheitsbeschränkungen und den Antwortvertrag zuerst. Versioniere diesen Block bewusst. Eine Richtlinienbearbeitung sollte einen neuen Cache-Schlüssel erzeugen, anstatt stillschweigend Messungen aus zwei Versionen zu vermischen.
2. Werkzeugdefinitionen
Werkzeug-Schemata sind oft umfangreich und wiederholen sich. Behalten Sie Namen, Beschreibungen, Eigenschaften und die Reihenfolge stabil bei. Entfernen Sie nicht genutzte Werkzeuge, wo möglich; dies senkt sowohl den ungecachten als auch den gecachten Kontext und reduziert Mehrdeutigkeiten bei der Werkzeugauswahl.
3. Gemeinsames Wissen
Fügen Sie dauerhafte Handbücher, Taxonomien, Styleguides oder Produktdokumentationen hinzu. Wenn sich das Wissen häufig ändert, ist die Dateisuche möglicherweise besser geeignet, als alles in jede Eingabeaufforderung einzubetten. Zwischenspeichern Sie stabiles Betriebswissen; rufen Sie sich ändernde Fakten ab.
4. Dynamischer Anfragestatus
Benutzereingaben, aktuelle Datensätze, Live-Suchergebnisse und temporären Zustand anhängen. Diese Platzierung schützt das wiederverwendbare Präfix vor routinemäßigen Änderungen.
Für einen kreativen Workflow könnte die stabile Ebene Animationsproduktionsregeln und einen Hausstil enthalten, während der dynamische Tail die aktuelle Szene enthält. Eine Plattform wie Elser AI könnte das gleiche Prinzip auf wiederholte Story-Bibel- oder Charakterkonsistenz-Kontexte anwenden, ohne zu implizieren, dass Caching selbst Konsistenz schafft.
Ersparnisse messen statt anzunehmen
Untersuche usage.input_tokens_details.cached_tokens und cache_write_tokens. Eine hohe Anzahl von zwischengespeicherten Token zeigt, dass ein Teil des Präfixes wiederverwendet wurde. Cache-Write-Token zeigen die Kosten für das Erstellen oder Aktualisieren von Einträgen.
Für GPT-6 Astra listet die veröffentlichte Modellpreisgestaltung zum Überprüfungsdatum zwischengespeicherte Eingaben unterhalb der normalen Eingabe und Cache-Schreibvorgänge oberhalb der normalen Eingabe. Das wirft eine Break-Even-Frage auf: Ein wiederholt verwendetes Präfix kann Geld sparen; ein einmal geschriebenes und nie wieder verwendetes Präfix kann mehr kosten. Die Preisgestaltung ändert sich, daher sollte mit der aktuellen Modellseite gerechnet werden, anstatt feste Zahlen in Planungstabellen einzutragen.
Mindestens verfolgen:
- Cache-Trefferquote nach Prompt-Version;
- zwischengespeicherte, geschriebene und gesamte Eingabe-Token;
- p50- und p95-Zeit bis zum ersten Token;
- Kosten pro abgeschlossener Aufgabe, nicht nur pro Anfrage;
- Cache-Fehler, die durch Freigaben verursacht werden.
Ein Dashboard, das nur nach Modell gruppiert ist, verbirgt die Ursache von Fehltreffern. Fügen Sie in Ihrer eigenen Telemetrie eine Cache-Key- oder Prompt-Version-Dimension hinzu, aber geben Sie niemals persönliche Daten oder Geheimnisse in Cache-Keys ein.
Sieben häufige Ursachen für Cache-Fehler
Dynamischer Inhalt erscheint zu früh
Verschiebe Daten, Benutzer-IDs und abgerufenes Material nach dem wiederverwendbaren Inhalt.
Tool-Schemas ändern Reihenfolge
Werkzeuge und Schema-Eigenschaften im Anwendungs-Build-Schritt deterministisch sortieren.
Aufforderungen sind „äquivalent“, aber nicht identisch
Leerzeichen, Beispiele oder Serialisierung können variieren. Generieren Sie gemeinsame Blöcke aus versionierten Artefakten anstelle von Ad-hoc-Zeichenfolgen.
Das Präfix ist zu kurz
Die minimal cachebare Länge variiert je nach Modell. Sehr kurze Eingabeaufforderungen bringen möglicherweise keinen Vorteil. Bestätigen Sie dies anhand der Nutzungsdaten.
Kompaktierung hat das Präfix geändert
Komprimierung hilft, lange Gespräche unterzubringen, erzeugt aber eine andere Kontextdarstellung. Erwarten Sie, dass sich Nutzungsmuster nach der Komprimierung ändern, und messen Sie in der Nähe von Meilensteingrenzen.
Zu viele Breakpoints mit geringem Wert
Breakpoints sollten sinnvollen wiederverwendbaren Schichten entsprechen. Vier erlaubte Schreibvorgänge sind eine Obergrenze, kein Ziel.
Ein Cache-Schlüssel ist zu breit oder zu eng gefasst
Ein Schlüssel für jeden unabhängigen Workflow führt zu schwacher Gruppierung; ein eindeutiger Schlüssel pro Anfrage verhindert die Wiederverwendung. Bevorzugen Sie einen semantischen Schlüssel wie legal-review:v3:us.
Ein sicherer Rollout-Plan
Beginnen Sie mit dem impliziten Modus bei einem Workflow mit hohem Volumen. Stabilisieren Sie den Prompt-Aufbau, notieren Sie Token-Details und vergleichen Sie zwei Wochen lang Kosten und Latenz. Ziehen Sie dann explizite Haltepunkte in Betracht, wenn der Prompt mehrere wiederverwendbare Schichten oder häufige dynamische Enden aufweist. Bewerten Sie die Qualität zusammen mit den Einsparungen: Das aggressive Entfernen von Kontext ist kein Caching und kann die Antwortqualität beeinträchtigen.
Cachen Sie nur Inhalte, die Sie bereits an die API senden dürfen. Caching ersetzt keine Datenklassifizierung, Mandantenisolierung, Zugriffskontrollen oder Aufbewahrungsentscheidungen. Halten Sie Geheimnisse aus Prompts heraus, wenn ein Tool sie just-in-time abrufen kann.
FAQ
Reduziert Prompt-Caching die Kosten für Ausgabe-Token?
Nein. Es gilt für berechtigte wiederholte Eingaben. Die Ausgabe wird normal generiert und zum Ausgabesatz abgerechnet.
Macht previous_response_id vorherige Antworten kostenlos?
Nein. OpenAI gibt an, dass frühere Eingabe-Tokens in einer Antwortkette weiterhin als Eingabe abgerechnet werden. Prompt-Caching kann die Kosten für berechtigte wiederholte Präfixe senken, aber Konversationsverkettung und Caching sind getrennte Mechanismen.
Sollte ich abgerufene Suchergebnisse zwischenspeichern?
Nur wenn sie stabil und tatsächlich wiederverwendet werden. Live-Ergebnisse gehören normalerweise in den dynamischen Teil. Für kontrollierte Korpora kann die Dateisuche vermeiden, eine gesamte Sammlung in jeden Prompt einzubetten.
Kann ich mich auf einen Cache-Treffer verlassen?
Behandeln Sie Caching als eine opportunistische Optimierung. Ihre Anwendung muss auch bei einem Fehltreffer korrekt bleiben.
Fazit
Die wertvollste Caching-Strategie für GPT-6 Astra ist architektonischer Natur: stabile Anweisungen und Werkzeuge zuerst, flüchtiger Zustand zuletzt, deterministische Serialisierung, bewusste Versionierung und Messung über Tokendetails. Beginnen Sie mit implizitem Caching, fügen Sie explizite Haltepunkte nur dann hinzu, wenn Daten diese stützen, und optimieren Sie die Kosten pro erfolgreicher Aufgabe, anstatt einer He






























































































