Volver a las guías
Solución de problemas·17 de julio de 2026·6 min de lectura

context_length_exceeded / la indicación es demasiado larga: soluciones que no dejan tu aplicación incapacitada

Todos los modelos tienen una ventana de contexto; este 400 significa que la indicación más la salida solicitada no caben. La solución ingenua —truncar la indicación a ciegas— hace que las aplicaciones RAG sean silenciosamente menos inteligentes. Así puedes ajustarte a la ventana sin perder el hilo.

Última revisión: .

Todos los modelos tienen una ventana de contexto; este 400 significa que la indicación más la salida solicitada no caben. La solución ingenua —truncar la indicación a ciegas— hace que las aplicaciones RAG sean silenciosamente menos inteligentes. Así puedes ajustarte a la ventana sin perder el hilo.

El error

response (HTTP 400)
// Anthropic:
{"type":"error","error":{"type":"invalid_request_error",
 "message":"prompt is too long: 214481 tokens > 200000 maximum"}}

// OpenAI-compatible:
{"error":{"type":"invalid_request_error","code":"context_length_exceeded",
 "message":"This model's maximum context length is 128000 tokens..."}}

Causas y soluciones de un vistazo

CausaSolución
Historial de chat sin límiteConserva una ventana móvil y un resumen acumulativo; no reproduzcas toda la transcripción en cada turno.
RAG recupera demasiados fragmentos o fragmentos demasiado grandesRecupera menos fragmentos y más pequeños, y vuelve a clasificarlos: la calidad supera al volumen mucho antes de llenar la ventana.
max_tokens es demasiado grande para el espacio restanteLa ventana cubre la entrada Y la salida: presupuesto = ventana − entrada. Ajusta max_tokens al espacio restante.
La carga de trabajo necesita realmente más contextoCambia a un nivel de modelos con contexto largo (por ejemplo, modelos con una ventana de 1 M) en lugar de desarrollar soluciones alternativas para hacer encajar el contenido en una ventana demasiado pequeña.

Mide antes de recortar

Cuenta los tokens del mismo modo que la API (Anthropic tiene un endpoint count_tokens; tiktoken aproxima los modelos compatibles con el protocolo de OpenAI). Registra el recuento de cada solicitud: la solución es diferente si excedes 1,05× o 5×.

Recorta la recuperación y el historial, nunca las instrucciones

Recorta en este orden: (1) turnos de chat obsoletos → resume; (2) fragmentos recuperados → vuelve a clasificarlos y conserva los top-k; (3) ejemplos few-shot extensos → usa menos y más concisos. Las instrucciones del sistema van al final: ahí reside el comportamiento.

Escala a una ventana más larga cuando sea algo estructural

Si las entradas legítimas superan la ventana cada semana, es un problema de selección del modelo. Los niveles de contexto largo (200K–1M) existen precisamente para análisis de contratos, preguntas y respuestas sobre bases de código y trabajo con varios documentos. Compara el precio de la actualización con el tiempo de ingeniería que dedicas a recortar.

Si llamas a través de Kunavo

El catálogo de Kunavo abarca varios niveles de contexto, incluidos los modelos de la familia Claude 5 con ventana de 1 M, detrás de una sola clave. Por tanto, escalar una carga de trabajo de una ventana de 200K a una de 1 M solo requiere cambiar la cadena del modelo, y cada página de modelo indica su ventana junto al precio por token para presupuestar la compensación.

Preguntas frecuentes

¿max_tokens cuenta para la ventana de contexto?

Sí: la ventana limita la entrada más la salida generada. Un modelo con ventana de 200K y una indicación de 195K no puede cumplir max_tokens: 8000. Calcula el espacio restante y limita max_tokens a ese valor.

¿El almacenamiento en caché de indicaciones soluciona el desbordamiento de contexto?

No: el almacenamiento en caché reduce el COSTE de las indicaciones largas repetidas, no su tamaño. El recuento de tokens contra la ventana es idéntico tanto si están en caché como si no.

Guías relacionadas

Encontrarás más detalles sobre el significado de los errores en referencia de errores; obtener una clave lleva un minuto mediante registro y la guía de autenticación.