Volver a las guías
Precios·4 de septiembre de 2026·Actualizado el 3 de octubre de 2026·8 min de lectura

Cuánto cuesta un flujo de trabajo de Claude Code — la expansión que nadie calcula

El coste de un flujo de trabajo es su expansión. Ese es su propósito y también su factura.

Última revisión: .

El coste de un flujo de trabajo es su expansión, y ninguna de las guías sobre flujos de trabajo lo menciona. La documentación de Anthropic es el lugar adecuado para aprender qué son los flujos de trabajo dinámicos y cómo escribir uno. Esta página responde a la pregunta que tienes justo después: ¿cuánto cuesta ejecutar uno y qué ajuste cambia ese coste?

Versión corta: un flujo de trabajo que se expande a cinco subagentes consume aproximadamente los tokens de cinco agentes, no de uno. Ese es su propósito y también su factura.

La aritmética

# A workflow's cost is not "one task". It is the fan-out.
#
#   workflow_cost = orchestrator_steps x step_cost
#                 + subagents x subagent_steps x step_cost
#
# A step is 25,000 in / 1,200 out — the same sizing used on
# every other cost page here, so these numbers are comparable.
#
#   Claude Sonnet 5      $0.043 / step
#   Claude Haiku 4.5     $0.022 / step
#
# Same job, three shapes:
#
#   one thread, 20 steps, all Sonnet
#     = 20 x $0.043 = $0.868
#
#   5 subagents x 8 steps + 6 orchestrator steps, all Sonnet
#     = 46 x $0.043 = $2.00
#
#   same fan-out, subagents on Haiku, orchestrator on Sonnet
#     = 40 x $0.022 + 6 x $0.043 = $1.13
#
# The fan-out costs more than the single thread. Mapping the fan-out
# to the cheap tier is what buys most of it back.

Lee las tres formas como el mismo trabajo realizado de tres maneras. La expansión es más cara que el hilo único en todos los casos; lo que cambia es cuánto más cuesta, y eso lo determina casi por completo el nivel en el que se ejecutan los subagentes.

La única línea que lo cambia

El trabajo de subagente en un flujo de trabajo suele estar acotado y ser mecánico: leer un archivo, resumir un diff, comprobar una condición, informar del resultado. Para eso sirve un modelo pequeño. El orquestador es lo contrario: mantiene el plan, y un mal plan desperdicia el trabajo de todos los subagentes que dependen de él, así que ahí es donde un nivel potente justifica su precio.

# The one line that changes every workflow run: the tier the
# background and sub-task work lands on.

export ANTHROPIC_BASE_URL=https://api.kunavo.com
export ANTHROPIC_AUTH_TOKEN=sk-kn-...
export ANTHROPIC_MODEL=claude-sonnet-5                # orchestration
export ANTHROPIC_DEFAULT_OPUS_MODEL=claude-opus-5-5   # agents that ask for opus
export ANTHROPIC_DEFAULT_SONNET_MODEL=claude-sonnet-5 # agents that ask for sonnet
export ANTHROPIC_DEFAULT_HAIKU_MODEL=claude-haiku-4-5 # the fan-out

Claude Code dirige automáticamente las llamadas de subtareas al modelo asignado al nivel Haiku, por lo que esta asignación se utiliza en cada ejecución, aunque no uses explícitamente los flujos de trabajo. La línea de Opus existe porque el valor predeterminado integrado de Claude Code y su alias opus resuelven ambos al Opus más reciente; si Kunavo aún no ofrece ese modelo, cualquier elemento que recurra a él devuelve 404. La línea fija ambos en Opus 5.5 (claude-opus-5-5), que requiere Claude Code v2.1.280 o posterior (ejecuta claude update en versiones anteriores). La línea de Sonnet es más importante para los flujos de trabajo: el alias sonnet solicita Sonnet 5.5, que Kunavo no ofrece; sin esta línea, todos los subagentes configurados como model: sonnet, la fase de ejecución de opusplan y /model sonnet devuelven 404. El punto de equilibrio del nivel del orquestador —cuánto peor debe ser un modelo más barato antes de dejar de serlo— se explica en Opus frente a Sonnet y Haiku.

Dos cosas que la estimación no incluirá

Reintentos. Un subagente que falla y vuelve a ejecutarse se factura dos veces, y la expansión multiplica las probabilidades de que ocurra al menos uno. Esto es invisible en cualquier estimación realizada al planificar y solo aparece en el registro de uso.

Contexto en caché. En sentido contrario: los subagentes iniciados por el mismo orquestador suelen compartir un prefijo estable, y un acierto de caché se factura a una fracción de la tarifa de entrada. En un flujo de trabajo largo, esa es la mayor reducción individual disponible, mayor que el cambio de nivel anterior. El mecanismo y las tres formas en que el enrutamiento mediante una pasarela lo rompe se explican en Almacenamiento en caché de prompts de Claude.

Decidir si expandirse o no

Los flujos de trabajo no son una optimización de costes, y conviene dejarlo claro porque el enfoque determina la respuesta. Aportan latencia y amplitud: varios subagentes trabajando a la vez terminan antes y cubren más terreno que un solo hilo recorriendo la misma lista. La pregunta es si eso justifica el múltiplo, y la aritmética anterior te da el múltiplo para tu propia configuración.

Para la función en sí —cómo definir un flujo de trabajo, cómo se orquestan los subagentes y cuál es la sintaxis— la documentación de Anthropic es la autoridad, y esta página no intenta repetirla. Lo que ejecuta los modelos subyacentes es una URL base y una clave, y el aspecto de suscripción frente a tokens de la misma decisión se explica en Límites de Claude Pro y Max.

Preguntas frecuentes

¿Cuánto cuesta un flujo de trabajo de Claude Code?

Más que el mismo trabajo en un único hilo, porque el coste de un flujo de trabajo depende de su expansión. Modélalo como los pasos del orquestador más los subagentes multiplicados por sus pasos, todo ello multiplicado por el coste de un paso. A las tarifas de Kunavo, un paso de 25.000 tokens de entrada y 1.200 de salida cuesta $0.043 en Claude Sonnet 5: un único hilo de 20 pasos cuesta aproximadamente $0.868, mientras que cinco subagentes de ocho pasos cada uno más seis pasos del orquestador suman 46 pasos y aproximadamente $2.00. La expansión aporta paralelismo y amplitud; no aporta ningún descuento.

¿Cómo abaratar los flujos de trabajo sin renunciar al fan-out?

Pon el fan-out en el nivel más barato y mantén la orquestación en uno potente. Las subtareas de un flujo de trabajo suelen ser acotadas y mecánicas —leer esto, resumir aquello, comprobar lo otro—, que es precisamente para lo que sirve un modelo pequeño, mientras que el orquestador mantiene el plan y debe acertar. Asignar así el mismo ejemplo de 46 pasos cuesta aproximadamente $1.13 en lugar de $2.00, y el cambio consiste en una variable de entorno, no en reescribir el código.

¿Merecen la pena los flujos de trabajo si cuestan más?

A menudo sí, pero debes decidirlo con el criterio adecuado. Un flujo de trabajo no es una optimización de costes, sino una optimización de latencia y amplitud: varios subagentes trabajando a la vez terminan antes y cubren más terreno que un único hilo que realiza el mismo trabajo en serie. La pregunta es si el paralelismo vale el múltiplo, no si el múltiplo existe: existe, y cualquier página que diga lo contrario no ha hecho las cuentas.

¿Qué modelo debe usar el orquestador?

El orquestador crea el plan y lee los resultados, así que es el lugar donde un modelo débil te cuesta más: un mal plan desperdicia el trabajo de todos los subagentes que dependen de él. Claude Sonnet 5, a $1.40 / $7.00 por 1M de tokens, es la opción predeterminada de trabajo; Claude Opus 5.5, a $2.80 / $14.00, justifica su precio en trabajos realmente ambiguos. El punto de equilibrio en número de intentos entre los niveles se encuentra en la página de comparación de niveles.

¿Los flujos de trabajo funcionan mediante un endpoint de API personalizado?

Sí: los flujos de trabajo son una función de orquestación del lado del cliente, por lo que se ejecutan dondequiera que se ejecute Claude Code, y Claude Code lee ANTHROPIC_BASE_URL de forma nativa. Cada llamada de subagente se dirige al mismo endpoint que el del orquestador, lo que también hace visible el coste en un solo lugar: la expansión de un flujo de trabajo aparece como un pico de solicitudes en una única vista de uso, en lugar de repartirse entre varias cuentas.

¿Cómo puedo ver cuánto gastó realmente un flujo de trabajo?

Léelo por solicitud en lugar de estimarlo a partir del plan, porque el número de pasos de subagente se decide en tiempo de ejecución y rara vez coincide con tu cálculo. Con una clave facturada por token, cada llamada de la expansión es una línea que puedes sumar, incluidos los reintentos producidos por un subagente que falló; estos se facturan y son invisibles en cualquier estimación previa.