O custo de um fluxo de trabalho é sua distribuição, e nenhum dos guias sobre fluxos menciona isso. A documentação da própria Anthropic é o lugar certo para aprender o que são fluxos dinâmicos e como escrevê-los. Esta página responde à pergunta que vem logo depois: quanto custa executar um e qual configuração altera esse valor.
Versão curta — um fluxo de trabalho que se distribui para cinco subagentes consome aproximadamente tokens equivalentes aos de cinco agentes, não de um. Esse é o objetivo do recurso e também a cobrança.
A matemática
# A workflow's cost is not "one task". It is the fan-out.
#
# workflow_cost = orchestrator_steps x step_cost
# + subagents x subagent_steps x step_cost
#
# A step is 25,000 in / 1,200 out — the same sizing used on
# every other cost page here, so these numbers are comparable.
#
# Claude Sonnet 5 $0.043 / step
# Claude Haiku 4.5 $0.022 / step
#
# Same job, three shapes:
#
# one thread, 20 steps, all Sonnet
# = 20 x $0.043 = $0.868
#
# 5 subagents x 8 steps + 6 orchestrator steps, all Sonnet
# = 46 x $0.043 = $2.00
#
# same fan-out, subagents on Haiku, orchestrator on Sonnet
# = 40 x $0.022 + 6 x $0.043 = $1.13
#
# The fan-out costs more than the single thread. Mapping the fan-out
# to the cheap tier is what buys most of it back.Leia os três formatos como o mesmo trabalho feito de três maneiras. A distribuição é mais cara que a thread única em todos os casos — o que muda é quanto mais cara, e isso é decidido quase inteiramente pelo tier em que os subagentes são executados.
A única linha que muda o resultado
O trabalho dos subagentes em um fluxo costuma ser delimitado e mecânico: ler um arquivo, resumir um diff, verificar uma condição, informar o resultado. É para isso que serve um modelo pequeno. O orquestrador é o oposto — ele mantém o plano, e um plano ruim desperdiça todos os subagentes abaixo dele; é aí que um tier forte justifica seu preço.
# The one line that changes every workflow run: the tier the
# background and sub-task work lands on.
export ANTHROPIC_BASE_URL=https://api.kunavo.com
export ANTHROPIC_AUTH_TOKEN=sk-kn-...
export ANTHROPIC_MODEL=claude-sonnet-5 # orchestration
export ANTHROPIC_DEFAULT_OPUS_MODEL=claude-opus-5-5 # agents that ask for opus
export ANTHROPIC_DEFAULT_SONNET_MODEL=claude-sonnet-5 # agents that ask for sonnet
export ANTHROPIC_DEFAULT_HAIKU_MODEL=claude-haiku-4-5 # the fan-outO Claude Code encaminha automaticamente suas chamadas de subtarefas para o que estiver mapeado na categoria Haiku; portanto, esse mapeamento é usado em toda execução, mesmo que você não esteja usando workflows explicitamente. A linha do Opus existe porque o padrão integrado do Claude Code e seu alias opus resolvem para o Opus mais recente; se a Kunavo ainda não oferecer esse modelo, qualquer fallback para ele retornará 404. A linha fixa ambos em Opus 5.5 (claude-opus-5-5), que exige o Claude Code v2.1.280 ou posterior (em uma versão mais antiga, execute claude update). A linha do Sonnet é mais importante para workflows: o alias sonnet solicita o Sonnet 5.5, que a Kunavo não oferece; sem essa configuração, todo subagente definido como model: sonnet, a fase de execução de opusplan e /model sonnet retornarão 404. O ponto de equilíbrio da categoria do orquestrador — quanto pior um modelo mais barato precisa ser para deixar de ser mais barato — está em Opus vs Sonnet vs Haiku.
Duas coisas que a estimativa não captura
Tentativas novamente. Um subagente que falha e é executado novamente é cobrado duas vezes, e a distribuição aumenta a probabilidade de que pelo menos um falhe. Isso é invisível em qualquer estimativa feita no momento do planejamento e só aparece no registro de uso.
Contexto em cache. No sentido oposto, subagentes lançados pelo mesmo orquestrador frequentemente compartilham um prefixo estável, e um acerto de cache é cobrado por uma fração da tarifa de entrada. Em um fluxo longo, essa é a maior redução individual disponível — maior que a alteração de tier acima. O mecanismo e as três formas pelas quais o roteamento por um gateway o interrompe estão em cache de prompts do Claude.
Decidir se deve distribuir o trabalho
Fluxos de trabalho não são uma otimização de custos, e vale deixar isso claro, porque esse enquadramento determina a resposta. Eles compram latência e abrangência: vários subagentes trabalhando ao mesmo tempo terminam mais rápido e cobrem mais terreno do que uma única thread percorrendo a mesma lista. A questão é se isso vale o múltiplo, e a matemática acima fornece o múltiplo para o seu próprio caso.
Quanto ao recurso em si — como definir um fluxo, como os subagentes são orquestrados e qual é a sintaxe — a documentação da Anthropic é a autoridade, e esta página não tenta repeti-la. O que executa os modelos por baixo é uma URL base e uma chave; o lado da decisão entre assinatura e cobrança por token está em limites do Claude Pro e Max.
Perguntas frequentes
Quanto custa um fluxo de trabalho do Claude Code?
Mais do que o mesmo trabalho em uma única thread, porque o custo de um workflow é sua ramificação. Modele-o como etapas do orquestrador mais subagentes multiplicados por suas etapas, tudo multiplicado pelo custo de uma etapa. Nas tarifas da Kunavo, uma etapa de 25.000 tokens de entrada e 1.200 de saída custa $0.043 em Claude Sonnet 5: uma thread única de 20 etapas custa cerca de $0.868, enquanto cinco subagentes de oito etapas cada mais seis etapas do orquestrador totalizam 46 etapas e cerca de $2.00. A ramificação compra paralelismo e amplitude; não compra desconto.
Como tornar os fluxos de trabalho mais baratos sem abrir mão da distribuição?
Coloque a distribuição no tier mais barato e mantenha a orquestração em um tier forte. As subtarefas de um fluxo geralmente são delimitadas e mecânicas — leia isto, resuma aquilo, verifique o outro — exatamente o tipo de tarefa para um modelo pequeno, enquanto o orquestrador mantém o plano e precisa acertar. Mapeando o mesmo exemplo de 46 etapas dessa forma, o custo fica em cerca de $1.13 em vez de $2.00, e a alteração é uma variável de ambiente, não uma reescrita.
Os fluxos de trabalho valem a pena se custam mais?
Frequentemente, sim, mas decida pelo eixo correto. Um fluxo de trabalho não é uma otimização de custos; é uma otimização de latência e abrangência: vários subagentes trabalhando ao mesmo tempo terminam mais rápido e cobrem mais terreno do que uma única thread fazendo o mesmo trabalho em série. A pergunta é se o paralelismo vale o múltiplo, não se o múltiplo existe — ele existe, e qualquer página que diga o contrário não fez as contas.
Qual modelo o orquestrador deve usar?
O orquestrador cria o plano e lê os resultados, então é nele que um modelo fraco mais custa — um plano ruim desperdiça todos os subagentes abaixo dele. Claude Sonnet 5 a $1.40 / $7.00 por 1 milhão de tokens é o padrão operacional; Claude Opus 5.5 a $2.80 / $14.00 vale o preço em trabalhos realmente ambíguos. O ponto de equilíbrio em número de tentativas entre os níveis está na página de comparação de níveis.
Os fluxos de trabalho funcionam por meio de um endpoint de API personalizado?
Sim — fluxos de trabalho são um recurso de orquestração no lado do cliente, portanto funcionam onde quer que o Claude Code funcione, e o Claude Code lê ANTHROPIC_BASE_URL nativamente. Cada chamada de subagente vai para o mesmo endpoint do orquestrador, o que também torna o custo visível em um único lugar: a distribuição de um fluxo aparece como um pico de solicitações em uma única visão de uso, em vez de ficar espalhada entre contas.
Como ver quanto um fluxo de trabalho realmente gastou?
Leia por solicitação, em vez de estimar pelo plano, porque o número de etapas dos subagentes é decidido em tempo de execução e raramente corresponde à sua estimativa. Em uma chave cobrada por token, cada chamada da distribuição é uma linha que você pode somar, incluindo as tentativas novamente geradas por um subagente que falhou — elas são cobradas e ficam invisíveis em qualquer estimativa antecipada.