Retour aux guides
Dépannage·17 juillet 2026·6 min de lecture

context_length_exceeded / prompt is too long — des correctifs qui n’abrutissent pas votre application

Chaque modèle possède une fenêtre de contexte ; cette erreur 400 signifie que le prompt et la sortie demandée ne tiennent pas. Le correctif naïf — tronquer le prompt sans discernement — est la manière dont les applications RAG deviennent silencieusement moins pertinentes. Voici comment tenir dans la fenêtre sans perdre le fil.

Dernière vérification le .

Chaque modèle possède une fenêtre de contexte ; cette erreur 400 signifie que le prompt et la sortie demandée ne tiennent pas. Le correctif naïf — tronquer le prompt sans discernement — est la manière dont les applications RAG deviennent silencieusement moins pertinentes. Voici comment tenir dans la fenêtre sans perdre le fil.

L’erreur

response (HTTP 400)
// Anthropic:
{"type":"error","error":{"type":"invalid_request_error",
 "message":"prompt is too long: 214481 tokens > 200000 maximum"}}

// OpenAI-compatible:
{"error":{"type":"invalid_request_error","code":"context_length_exceeded",
 "message":"This model's maximum context length is 128000 tokens..."}}

Causes et solutions en bref

CauseSolution
Historique de conversation non bornéConservez une fenêtre glissante et un résumé cumulatif ; ne rejouez pas toute la transcription à chaque tour.
RAG récupère trop de fragments ou des fragments trop volumineuxRécupérez moins de fragments, plus petits et réordonnés : la qualité l’emporte sur le volume bien avant que la fenêtre soit pleine.
max_tokens trop élevé pour l’espace restantLa fenêtre couvre l’entrée ET la sortie : budget = fenêtre − entrée. Définissez max_tokens selon le reste disponible.
La charge de travail nécessite réellement davantage de contextePassez à une gamme de modèles à contexte long, par exemple des modèles avec une fenêtre de 1M, plutôt que de contourner artificiellement une limite stricte.

Mesurez avant de réduire

Comptez les tokens de la même manière que l’API (Anthropic dispose d’un point de terminaison count_tokens ; tiktoken fournit une approximation pour les modèles utilisant le protocole OpenAI). Journalisez le décompte par requête : le correctif diffère si le dépassement est de 1,05× ou de 5×.

Réduisez la récupération et l’historique, jamais les instructions

Réduisez dans cet ordre : (1) anciens tours de conversation → résumez-les ; (2) fragments récupérés → réordonnez-les et conservez le top-k ; (3) exemples few-shot verbeux → moins nombreux et plus concis. Les instructions système viennent en dernier : c’est là que réside le comportement.

Passez à une fenêtre plus longue lorsque le problème est structurel

Si les entrées légitimes dépassent la fenêtre chaque semaine, il s’agit d’un problème de choix de modèle. Les gammes à contexte long (200K–1M) existent précisément pour l’analyse de contrats, les questions-réponses sur des bases de code et le travail sur plusieurs documents ; comparez le prix de la mise à niveau au temps d’ingénierie consacré à la réduction.

Si vous appelez via Kunavo

Le catalogue de Kunavo couvre plusieurs niveaux de contexte, notamment des modèles de la famille Claude 5 avec une fenêtre de 1M, accessibles avec une seule clé. Faire passer une charge de travail d’une fenêtre de 200K à une fenêtre de 1M consiste donc à modifier la chaîne du modèle ; chaque page de modèle indique sa fenêtre à côté de son prix par token pour évaluer le compromis.

Questions fréquentes

max_tokens est-il comptabilisé dans la fenêtre de contexte ?

Oui : la fenêtre englobe l’entrée et la sortie générée. Un modèle avec une fenêtre de 200K et un prompt de 195K ne peut pas honorer max_tokens: 8000. Calculez le reste et limitez max_tokens à cette valeur.

La mise en cache des prompts résout-elle le dépassement de contexte ?

Non : la mise en cache réduit le COÛT des prompts longs répétés, pas leur taille. Le nombre de tokens pris en compte dans la fenêtre est identique, que le prompt soit mis en cache ou non.

Guides associés

La sémantique détaillée des erreurs est disponible dans référence des erreurs ; obtenir une clé prend une minute via inscription et la guide d’authentification.