Zurück zu den Leitfäden
Fehlerbehebung·17. Juli 2026·6 Min. Lesezeit

context_length_exceeded / prompt is too long — Lösungen, die Ihre App nicht verdummen

Jedes Modell hat ein Kontextfenster; dieser 400-Fehler bedeutet, dass Prompt plus angeforderte Ausgabe nicht hineinpassen. Die naive Lösung — den Prompt blind abzuschneiden — macht RAG-Apps stillschweigend dümmer. So passen Sie den Kontext ein, ohne den roten Faden zu verlieren.

Zuletzt überprüft am .

Jedes Modell hat ein Kontextfenster; dieser 400-Fehler bedeutet, dass Prompt plus angeforderte Ausgabe nicht hineinpassen. Die naive Lösung — den Prompt blind abzuschneiden — macht RAG-Apps stillschweigend dümmer. So passen Sie den Kontext ein, ohne den roten Faden zu verlieren.

Der Fehler

response (HTTP 400)
// Anthropic:
{"type":"error","error":{"type":"invalid_request_error",
 "message":"prompt is too long: 214481 tokens > 200000 maximum"}}

// OpenAI-compatible:
{"error":{"type":"invalid_request_error","code":"context_length_exceeded",
 "message":"This model's maximum context length is 128000 tokens..."}}

Ursachen und Lösungen im Überblick

UrsacheLösung
Unbegrenzter ChatverlaufVerwenden Sie ein gleitendes Fenster und eine fortlaufende Zusammenfassung; spielen Sie nicht in jeder Runde das gesamte Transkript erneut ab.
RAG ruft zu viele oder zu große Chunks abRufen Sie weniger, kleinere und neu gerankte Chunks ab — Qualität ist lange vor dem Füllen des Fensters wichtiger als Menge.
max_tokens ist für den verbleibenden Platz zu großDas Fenster umfasst Eingabe UND Ausgabe: Budget = Fenster − Eingabe. Setzen Sie max_tokens auf den verbleibenden Platz.
Die Arbeitslast benötigt tatsächlich mehr KontextWechseln Sie zu einer Modellstufe mit langem Kontext (z. B. Modellen mit 1M-Fenster), statt um eine harte Grenze herumzuentwickeln.

Vor dem Kürzen messen

Zählen Sie Token so, wie es die API tut (Anthropic bietet einen count_tokens-Endpunkt; tiktoken approximiert Modelle mit OpenAI-Drahtformat). Protokollieren Sie die Anzahl jeder Anfrage — die Lösung unterscheidet sich, wenn Sie 1,05× oder 5× über dem Limit liegen.

Kürzen Sie Abrufe und Verlauf, niemals die Anweisungen

Kürzen Sie in dieser Reihenfolge: (1) veraltete Chat-Runden → zusammenfassen, (2) abgerufene Chunks → neu ranken und die obersten k behalten, (3) ausführliche Few-Shot-Beispiele → weniger und präzisere. Systemanweisungen kommen zuletzt — dort befindet sich das Verhalten.

Bei strukturellem Bedarf auf ein längeres Fenster wechseln

Wenn legitime Eingaben wöchentlich das Fenster überschreiten, handelt es sich um ein Problem der Modellauswahl. Stufen mit langem Kontext (200K–1M) existieren genau für Vertragsanalyse, Codebase-Fragen und die Arbeit mit mehreren Dokumenten — vergleichen Sie den Aufpreis mit der Entwicklungszeit, die Sie für das Kürzen aufwenden.

Wenn Sie Kunavo verwenden

Der Kunavo-Katalog umfasst Kontextstufen — darunter Modelle der Familie Claude 5 mit 1M-Fenster — hinter einem einzigen Schlüssel. Eine Arbeitslast von einem 200K- auf ein 1M-Fenster hochzustufen, ist daher eine Änderung der Modellzeichenfolge. Auf jeder Modellseite wird das Fenster neben dem Preis pro Token angegeben, damit Sie den Zielkonflikt budgetieren können.

Häufig gestellte Fragen

Wird max_tokens auf das Kontextfenster angerechnet?

Ja — das Fenster begrenzt Eingabe plus generierte Ausgabe. Ein Modell mit 200K-Fenster und einem Prompt von 195K kann max_tokens: 8000 nicht erfüllen. Berechnen Sie den verbleibenden Platz und begrenzen Sie max_tokens entsprechend.

Ist Prompt-Caching eine Lösung für überlaufenden Kontext?

Nein — Caching senkt die KOSTEN wiederholter langer Prompts, nicht deren Größe. Die auf das Fenster angerechnete Tokenanzahl ist mit und ohne Cache identisch.

Verwandte Anleitungen

Weitere Informationen zur Fehlersemantik finden Sie unter Fehlerreferenz; einen Schlüssel erhalten Sie in einer Minute über Registrierung und die Authentifizierungsanleitung.