Voltar aos guias
Preços·1 de outubro de 2026·8 min de leitura

Preços do DeepSeek Harness: o harness é gratuito, o modelo não — e o que cada interação envia

A fatura corresponde ao preço por token da DeepSeek. O que o harness acrescenta é o formato de cada solicitação: 24 ferramentas, limite de saída de 256.000 tokens com o thinking ativado, uma chamada de título por sessão e um registro de sessão enviado.

Última revisão em .

O DeepSeek Harness não custa nada para executar; a cobrança é do modelo e, na rota integrada, é da API da DeepSeek — deepseek-flash a US$ 0,30 por milhão de tokens de entrada e US$ 1,20 por milhão de tokens de saída no pico, metade disso fora do pico, e US$ 0,006 por milhão em caso de cache hit. O que faz o próprio harness importar para a cobrança é o que ele envia: em uma execução registrada da versão 0.2.0-rc.2, cada rodada carregou 24 definições de ferramentas, solicitou até 256.000 tokens de saída com o pensamento ativado e cada nova sessão adicionou uma solicitação de título. Preços consultados em 1º de outubro de 2026.

Para dsh com o agente da Anthropic, consulte DeepSeek Harness vs Claude Code; para apontá-lo para outro endpoint, consulte a página de configuração do DeepSeek Harness da Kunavo.

O harness é gratuito; o modelo, não

O DeepSeek Harness (dsh) é licenciado sob MIT e instalado pelo npm como @deepseek-ai/dsh; 0.2.0-rc.2 (29 de setembro de 2026) é a tag atual, e o README ainda o chama de prévia para desenvolvedores, com "compatibility-breaking changes" previstas. Pronto para uso, ele roteia para a API oficial da DeepSeek com o modelo deepseek-flash, pelo endpoint no formato Anthropic da DeepSeek, usando sua chave da DeepSeek. Você pode adicionar outros provedores; não pode comprar nada do dsh.

Preços da DeepSeek

ModeloEntrada, cache hitEntrada, cache missSaída
deepseek-flash (DeepSeek-V4.1-Flash)US$ 0.006 no pico / US$ 0.003 fora do pico$0.3 / $0.15$1.2 / $0.60
deepseek-v4-proUS$ 0.044 no pico / US$ 0.022 fora do pico$1.32 / $0.66$3.96 / $1.98

Por milhão de tokens, conforme a página de preços da DeepSeek em 1º de outubro de 2026. As tarifas fora do pico são metade das tarifas de pico; os horários de pico são 01:00–04:00 e 06:00–10:00 UTC, de segunda a sexta-feira, excluindo feriados públicos chineses. deepseek-flash é servido pelo DeepSeek-V4.1-Flash; o nome antigo deepseek-v4-flash ainda é aceito e cobrado pelo preço do Flash. As cobranças são descontadas de um saldo pré-pago da DeepSeek.

O que uma rodada envia — medido

Executamos o dsh 0.2.0-rc.2 sem interface gráfica contra um endpoint substituto local que registra as solicitações, com uma tarefa que lê um arquivo e responde — três sessões novas por rota, todas as nove concluindo a ida e volta da ferramenta, com tamanhos de solicitação idênticos entre as execuções. Na rota integrada da DeepSeek:

SolicitaçãoTamanhoO que há nela
Rodada do agente, primeira chamada65.321 bytes24 definições de ferramentas (18.606), prompt do sistema (2.734), tarefa mais contexto de execução, max_tokens: 256000, pensamento ativado, output_config.effort: "high" e dois campos que não são do modelo: dsh_session_log (33.342) e dsh_plugin_packages (5.800)
Título da sessão39.906 bytesmax_tokens: 64, pensamento desativado, o primeiro prompt — e os mesmos dois campos que não são do modelo
Rodada do agente após o resultado da ferramenta36.189 bytesA conversa até o momento, com o registro da sessão agora enviado incrementalmente

Três consequências para o custo. A chamada de título ocorre uma vez por sessão, representa poucos tokens, mas é real, e vai para o mesmo modelo. O pensamento vem ativado por padrão com esforço alto, e os tokens de raciocínio são cobrados como saída, portanto a configuração de esforço no seletor de modelos controla o custo. O prefixo do prompt é estável — as ferramentas e o prompt do sistema eram idênticos byte a byte entre as execuções —, o que é recompensado pelo preço de cache hit da DeepSeek. Os dois campos dsh_ não são entrada do modelo; não há documentação sobre se a DeepSeek os contabiliza para alguma finalidade, e nada aqui presume que sim. Estes são bytes de solicitação de um substituto, não contagens de tokens da DeepSeek.

Quanto custa uma sessão

Aritmética de tokens, não uma cobrança medida. Uma sessão que envia 200,000 tokens de entrada e recebe 12,000 tokens de saída, com preços de pico:

OpçãoSem cache80% da entrada em cacheCobrado por
deepseek-flash, no pico$0.074$0.027DeepSeek
deepseek-v4-pro, no pico$0.312$0.107DeepSeek
deepseek-flash, fora do pico$0.037$0.014DeepSeek
Claude Haiku 4.5 pela Kunavo$0.182—Kunavo
Claude Sonnet 5 pela Kunavo$0.364—Kunavo

A coluna de cache pressupõe que o cache automático da DeepSeek atende a 80% da entrada, algo plausível com um prefixo estável, mas que somente sua própria página de uso pode confirmar. As linhas da Kunavo são tarifas de catálogo ao vivo, sem cache, para leitores que querem usar Claude por trás do mesmo harness; a Kunavo não vende modelos da DeepSeek, cobra por token a partir de um saldo pré-pago com uma recarga mínima de US$ 10 (cobrança) e trata o valor do catálogo como um piso, não como um teto. A diferença de preço é real — assim como a diferença entre a menor tarifa e a tarefa concluída pelo menor custo.

Outros provedores e o que muda

Uma API de modelo personalizada recebe uma URL base e um protocolo. Na execução, openai-completions com uma URL base terminada em /v1 enviou uma requisição POST para /v1/chat/completions; anthropic-messages com a raiz sem caminho enviou uma requisição POST para /v1/messages?beta=true, e com /v1 no final enviou uma requisição POST para /v1/v1/messages — um 404 em qualquer gateway real. Essas rotas solicitaram max_tokens: 32768 em vez de 256.000, não enviaram nenhum dos campos dsh_ e sua solicitação de título tinha menos de 800 bytes.

O campo de registro da sessão é a metade de privacidade da mesma escolha. Na rota integrada, o plugin dsh-session-log-deepseek vem ativado por padrão e envia eventos da sessão, incluindo o caminho do seu diretório de trabalho, com cada solicitação — para qualquer URL base usada pela rota. Desative-o em Settings → General, "Upload Session Log when using the official model API". A exportação de feedback do OpenTelemetry do dsh é outra configuração padrão, para o coletor da DeepSeek; DSH_TELEMETRY_MODE=DISABLED a desativa, que é como essas execuções foram realizadas.

Perguntas frequentes

Quanto custa o DeepSeek Harness?

O harness é gratuito: o DeepSeek Harness (dsh) é licenciado sob MIT, e a versão 0.2.0-rc.2 no npm (29 de setembro de 2026) ainda é uma prévia para desenvolvedores. O que você paga é o modelo. A rota integrada envia para a própria API da DeepSeek, onde deepseek-flash custa US$ 0,30 por milhão de tokens de entrada em caso de cache miss, US$ 0,006 em caso de cache hit e US$ 1,20 por milhão de tokens de saída nos horários de pico, exatamente a metade fora do pico; deepseek-v4-pro custa US$ 1,32, US$ 0,044 e US$ 3,96 nos horários de pico. Os horários de pico são 01:00–04:00 e 06:00–10:00 UTC, de segunda a sexta-feira. Não existe assinatura do dsh.

O que uma rodada do DeepSeek Harness envia?

Na rota integrada da DeepSeek na versão 0.2.0-rc.2, a primeira solicitação de uma tarefa de uma linha tinha 65.321 bytes: 24 definições de ferramentas (18.606 bytes), um prompt do sistema de 2.734 bytes, a tarefa com uma observação de contexto de execução e dois campos que não são entrada do modelo — dsh_session_log (33.342 bytes nessa primeira chamada) e dsh_plugin_packages (5.800). Ela solicita max_tokens 256.000, com o pensamento ativado e effort "high". Cada nova sessão também envia uma solicitação curta de título. Esses números são bytes da solicitação registrados por um endpoint substituto, não a contagem de tokens da DeepSeek.

O DeepSeek Harness envia minha sessão?

Na rota integrada da DeepSeek, sim, por padrão. O plugin dsh-session-log-deepseek vem ativado e adiciona um campo dsh_session_log — os eventos da sessão, incluindo o caminho do diretório de trabalho — às solicitações normais do agente, de compactação e de título, até 8 MiB por solicitação; o modelo não o vê. Na execução aqui, o campo foi enviado para o endereço indicado por DEEPSEEK_BASE_URL, não apenas para a DeepSeek. A opção Settings → General → "Upload Session Log when using the official model API" da interface Web o desativa, assim como enabled: false para esse plugin. Provedores personalizados de pi-ai não o transportaram.

Qual é a forma mais barata de executar o DeepSeek Harness?

Pelo preço de tabela, deepseek-flash fora do pico com cache aquecido: US$ 0,15 por milhão de tokens de entrada em caso de miss, US$ 0,003 em caso de hit e US$ 0,60 por milhão de tokens de saída. Para uma sessão que envia 200.000 tokens de entrada e recebe 12.000 de saída, isso corresponde a cerca de US$ 0,014 fora do pico com 80% da entrada em cache, US$ 0,037 fora do pico sem cache hits e US$ 0,074 no pico sem cache hits. A menor tarifa listada e a forma mais barata de concluir a tarefa são questões diferentes: um modelo que precisa de três tentativas custa mais do que um que precisa de uma.

O DeepSeek Harness pode usar uma API diferente, como Claude por meio de um gateway?

Sim. Uma API de modelo personalizada em Settings → Models (armazenada no cordis.patch.yml do perfil) recebe uma URL base e um protocolo: openai-completions, openai-responses ou anthropic-messages. Na execução da versão 0.2.0-rc.2, openai-completions com uma URL base terminada em /v1 publicou em /v1/chat/completions, e anthropic-messages publicou em /v1/messages?beta=true quando recebeu a raiz sem caminho — com uma URL base terminada em /v1, publicou em /v1/v1/messages, o que um gateway real retornaria como 404. A página do DeepSeek Harness da Kunavo contém a configuração de openai-completions.

Execução em 1º de outubro de 2026: @deepseek-ai/dsh 0.2.0-rc.2 do npm, dsh --profile headless, telemetria desativada, chaves falsas, contra um substituto local de gravação que retorna uma chamada de ferramenta e uma resposta fixa — três rotas, três sessões cada. O substituto não é a DeepSeek, a Kunavo nem um modelo: ele mostra o que o dsh envia, não o que um provedor cobra ou se aceita os campos extras. Preços da página de preços da DeepSeek e do catálogo ao vivo da Kunavo no mesmo dia; comportamento do pacote baseado nos READMEs distribuídos de dsh-llm-deepseek e dsh-session-log-deepseek.