Voltar aos guias
Preços·18 de setembro de 2026·Atualizado em 30 de setembro de 2026·9 min de leitura

Preços do Hermes Agent: quanto custa executá-lo de fato

O software custa $0. Sua fatura é composta por tokens — e três multiplicadores que nenhuma tabela de preços informa.

Última revisão em .

O Hermes Agent custa $0 para instalar: o software é de código aberto sob a licença MIT e a única cobrança inevitável são os tokens do modelo. Todo o restante é opcional e tem preço separado: uma assinatura do Nous Portal de $0, $20, $100 ou $200 por mês, hospedagem do Hermes Cloud a partir de $0.56 por dia e uso do Tool Gateway, um recurso de assinatura paga que não publica uma tarifa por uso.

Esta página trata do Hermes Agent, o agente de código aberto da Nous Research. Uma verificação ao vivo de o repositório em 21 de setembro de 2026 retornou archived: false, uma licença MIT e um push no mesmo dia; o release publicado mais recente é Hermes Agent v0.21.3, marcado como v2026.9.14 em 14 de setembro de 2026. Ele não é o Hermes 3 nem o Hermes 4, a família de modelos de pesos abertos da Nous, e também não é a marca de artigos de luxo com o mesmo nome.

Quatro cobranças separadas, apenas uma obrigatória

O que você está comprandoPreço publicadoOnde isso é declarado
Software Hermes Agent: CLI, interface de terminal, Desktop, gateway de mensagens$0, licenciado sob a MITFAQ do Hermes: você paga apenas pelo uso da API de LLM do provedor escolhido
Tokens do modeloO que quer que seu provedor escolhido cobreA própria tabela de preços do seu provedor
Assinatura do Nous Portal (opcional)$0 / $20 / $100 / $200 por mêsPlanos do Portal
Nous Tool Gateway: pesquisa na web, geração de imagens, TTS, navegador na nuvemUm recurso de assinatura paga; pagamento conforme o uso dentro da assinatura. Nenhuma tarifa por uso publicada. O mesmo documento observa que algumas contas têm direito a um pequeno conjunto gratuito de ferramentasDocumentação do Tool Gateway
Hospedagem do Hermes Cloud (opcional)Medium $0.56/dia em execução, $0.03/dia parada; Large $1.09/dia em execução, $0.03/dia parada; mínimo de $2 em créditos, ou uma assinatura ativa, para fazer a implantaçãoHermes Cloud
Hermes Business / EnterpriseNenhum preço publicado. Ambos estão vinculados no rodapé do próprio Portal; nenhuma das páginas retornou a um cliente HTTP simples em 21 de setembro de 2026, portanto seus termos não foram verificados aquiPágina Business

O Hermes Cloud cobra a instância diariamente em atraso, e a própria página informa que a inferência e o uso de ferramentas são cobrados separadamente, além do preço da instância. Portanto, uma cotação de hospedagem nunca é a cobrança total. Modelos locais, segundo o mesmo FAQ, são totalmente gratuitos para executar depois que você possui o hardware. Todos os valores foram verificados em 21 de setembro de 2026. A mesma divisão em quatro cobranças aplicada a outro agente está em preços do OpenClaw.

Planos do Nous Portal: você está comprando créditos, não um desconto por token

NívelPreço mensalCréditos mensaisLimite de rollover
Gratuita$0$0 — somente modelos gratuitos, limites de taxa padrão—
Plus$20$22 (um bônus de 10 por cento), uso de ferramentas hospedadas, limites de taxa altos$10
Super$100$110$50
Ultra$200$220$100
Recarga única+$10 / +$20 / +$50 / +$100 / +$200, ou um valor arbitrárioPago pela Stripe—

Os créditos são o produto. Uma assinatura de $20 compra $22 em gastos com modelos, portanto sua vantagem sobre o pagamento por token é o bônus, além das ferramentas e dos limites incluídos — não uma tarifa menor para cada modelo. No catálogo público consultado em 21 de setembro de 2026, as entradas Claude tinham as tarifas que a Anthropic publica — Opus 5 a $5.00 de entrada / $25.00 de saída, Fable 5.1 a $10.00 / $50.00 — sem redução indicada. Não é possível verificar nessa página se há desconto em outra coisa: ela mostra uma tarifa por entrada e nenhum preço de referência ao lado. O que ela mostra é que um modelo pode aparecer várias vezes com tarifas diferentes, porque as variantes regionais e em lote são listadas como entradas separadas — Kimi K3 a $1.70 / $8.50, sua entrada :US a $3.63 / $18.15, sua entrada em lote a $3.00 / $15.00. Faça o orçamento com base no ID exato da entrada que você chamará e registre a data de qualquer valor citado.

Três ressalvas antes de fazer o orçamento. O nível gratuito é real, mas restrito às entradas cujo ID de modelo contém o sufixo :free — sete delas na consulta de 21 de setembro de 2026 — e essa lista é reconstruída a partir do catálogo ativo, portanto a recomendação de “usar o gratuito” fica desatualizada rapidamente. As próprias interfaces do Portal exibem dois valores arredondados diferentes para o tamanho do catálogo — um menor em cada cartão de plano pago e um maior na seção acima do próprio catálogo — enquanto a lista publicada continha 360 entradas nessa consulta; trate qualquer um desses valores como marketing, não como dado para orçamento. Também não aparecem números de taxa de solicitações nos cartões de plano; eles dizem apenas limites de taxa “padrão” e “altos”, portanto trate a concorrência como não verificada até observá-la em sua própria conta. A tabela de planos está na página inicial do Portal e em manage-subscription, onde um cliente HTTP simples recebe um checkpoint de segurança da Vercel em vez da página — leia-a em um navegador.

Para onde os tokens realmente vão

Uma tabela de preços define o preço de uma chamada. O Hermes cobra uma carga de trabalho, e há três multiplicadores documentados entre as duas coisas.

Slots auxiliares. O painel expõe 11 slots de tarefas auxiliares — geração de títulos, visão, compressão, aprovação, extração da web, central de skills, roteamento MCP e outros — e todos usam auto por padrão, o que significa que o Hermes também tenta usar seu modelo principal para esse trabalho. O próprio exemplo de desperdício da documentação é a compressão: um modelo de chat rápido faz esse trabalho a um quinquagésimo do custo de um modelo de raciocínio. Uma única interação do usuário pode, portanto, resultar em várias chamadas cobradas.

Delegação. A documentação de delegação afirma que um lote paralelo de subagentes normalmente consome a grande maioria dos tokens totais de uma execução, razão pela qual o modelo de trabalho pode ser configurado separadamente como delegation.model. O próprio aviso de custo observa que max_spawn_depth: 3 com max_concurrent_children: 3 pode chegar a 27 agentes folha simultâneos; a profundidade padrão é 1.

Continuidade do cache. A mesma página de configuração de modelos alerta que os caches de prompt são associados ao modelo que atende à solicitação; portanto, qualquer mudança de modelo no meio da conversa — uma alternância explícita /model, um fallback automático ou uma rotação do pool de credenciais para outra conta — faz a próxima mensagem reler toda a conversa pelo preço integral de entrada, em vez da tarifa com cache, que a página indica ser aproximadamente 75 a 90 por cento menor. Um mecanismo de proteção padrão, model.switch_context_confirm_tokens: 100000, existe precisamente porque essa releitura única pode superar em muito a diferença por token entre os dois modelos.

O trabalho agendado é onde isso tem maior impacto, e não na direção que você esperaria: a documentação de cron informa que uma tarefa sem modelo próprio executa usando o que estiver definido em hermes model ou /model no momento em que for executada; portanto, mudar o modelo de chat move toda a frota de cron na próxima execução. Fixe a tarefa (hermes cron create/edit --pin, ou um --model / --provider explícito) ou defina um padrão para toda a frota com cron.model quando uma tarefa não supervisionada não puder seguir uma alternância. Tarefas somente de script — o modo no_agent da documentação — nunca tocam a camada de inferência. Em vez de estimar qualquer uma dessas coisas, meça-as: o FAQ documenta /usage, /compress e hermes prompt-size, e o painel web documenta uma visualização de análises com tokens totais, porcentagem de acertos de cache e detalhamento por modelo.

Escolhendo o modelo para cada tarefa

Nenhum benchmark aqui sustenta uma classificação de qualidade; portanto, esta é uma tabela do que determina cada escolha, não um ranking.

FunçãoO que realmente determina isso
Interação principal (o loop de chamadas de ferramentas)Chamadas de ferramentas confiáveis e contexto suficiente. Um modelo que conversa bem, mas chama ferramentas mal, custa mais em novas tentativas do que sua tarifa sugere
Compressão, títulos, pontuação de aprovação, extração da webO modelo de chat capaz mais barato. A documentação considera modelos de raciocínio um desperdício aqui
Workers de delegaçãoOnde o volume se concentra. Defina delegation.model explicitamente em vez de herdar o modelo principal
VisãoDeclare model.supports_vision: true quando o modelo não estiver em models.dev ou quando as imagens forem pré-processadas em vez de roteadas nativamente
Tarefas cron não supervisionadasUma tarefa não fixada executa no modelo principal conforme ele estiver definido no momento da execução; portanto, fixe-a ou defina cron.model. Mantenha o conjunto de ferramentas pequeno — um esquema grande de ferramentas aumenta o prompt em cada chamada

Vale conhecer duas posições oficiais. A Nous fornece um padrão de baixo custo: o manifesto remoto de modelos, datado de 20 de setembro de 2026 e consultado no dia seguinte, marca z-ai/glm-5.2 como padrão, e a documentação do catálogo informa que o padrão é deliberadamente um modelo capaz e de baixo custo, nunca o carro-chefe mais caro. A Nous também recomenda não usar seus próprios pesos dentro do agente: a página de integração do Portal afirma que o Hermes 4 não é recomendado dentro do Hermes Agent porque é ajustado para chat e raciocínio, e não para o loop rápido de chamadas de ferramentas. A lista dessa página — Claude Sonnet 4.6 como opção agentic de uso geral, GPT-5.5 Pro, uma prévia do Gemini 3 Pro com contexto longo e DeepSeek V4 Pro como codificador econômico — está defasada em relação ao manifesto e ao catálogo ativo; trate-a como um ponto de partida e confirme se o ID do modelo é resolvido.

O uso observado também não é um ranking. A página pública do app Hermes Agent no OpenRouter, consultada em 21 de setembro de 2026, mostrou que o volume de tokens em 30 dias era liderado por MiniMax M3, uma entrada sem rótulo chamada Ox Alpha, Ling 3.0 Flash Fin, GPT-4o-mini e duas compilações do DeepSeek V4 Flash — modelos baratos e rápidos, não carros-chefe. Isso registra o que as pessoas executaram por meio de um gateway, não o que teve melhor desempenho em sua tarefa.

“Modelos Hermes” são duas perguntas diferentes

Uma é qual modelo apontar para o agente, respondida acima. A outra é a família Hermes 4 de pesos abertos — Hermes-4-405B, -70B e -14B no Hugging Face, com Hermes 3 distribuído pelo Ollama. Esses são pesos de modelos da mesma empresa, não o agente, e a Nous diz para não executar o Hermes 4 dentro dele. Uma afirmação aqui está não verificada: a documentação de integração do Portal diz que os modelos Hermes 4 estão disponíveis no Portal com tarifas fortemente descontadas, mas uma busca por “hermes” e “nous” em todo o catálogo público ativo não retornou linhas correspondentes em 21 de setembro de 2026. Eles podem estar visíveis somente após o login ou a documentação pode estar desatualizada. Não faça o orçamento com base em um preço do Hermes 4 no Portal que você não consegue ver em sua própria conta.

Melhor e mais barata API para o Hermes Agent

Essas são afirmações diferentes e devem permanecer separadas. O menor preço listado é um fato da tabela de tarifas; o menor custo para concluir a tarefa depende de novas tentativas, tamanho do contexto e acertos de cache.

OpçãoQuando ela venceO que verificar primeiro
Assinatura do Nous PortalVocê quer ferramentas, modelos e hospedagem em um único saldo. A Configuração rápida a chama de caminho rápido recomendadoCréditos, não desconto por token. O Tool Gateway é um recurso de nível pago
Chave de API direta do fornecedorUma família de modelos, sem camada intermediária, recursos do fornecedor em primeiro lugarOs planos de chat para consumidores geralmente não funcionam: o Claude Pro não consegue operar o Hermes de forma alguma, o Claude Max exige créditos de uso adicional comprados e os planos para consumidores do Google não têm um caminho documentado
Um gateway de terceiros compatível com OpenAIVocê quer um conjunto específico de modelos pela tarifa indicada sob uma única chaveDefina transport explicitamente e habilite o armazenamento em cache de prompts para cada modelo; nenhum dos dois é inferido
Modelos gratuitos do PortalExploração e trabalho que toleram interrupçõesRestrito aos modelos marcados como gratuitos, e essa lista é reconstruída a partir do catálogo em tempo real
Inferência localVocê já executa hardware adequadoGratuito para executar segundo o FAQ, mas a qualidade das chamadas de ferramentas é problema da infraestrutura de serving, não do Hermes

O Hermes documenta que qualquer serviço com uma API compatível com OpenAI funciona, e sua referência de provedores inclui até receitas para gateways concorrentes; portanto, o caminho de endpoint personalizado é uma rota de primeira classe, e não uma solução alternativa. O diferencial da Kunavo é mais específico do que ser “a mais barata”: seu catálogo abrange modelos das classes Claude e GPT, além de modelos de mídia, enquanto os modelos de pesos abertos que dominam o uso observado do Hermes não estão disponíveis nela. Se sua configuração já executa esses modelos, a Kunavo não é a rota mais barata. Ela é a rota para manter as principais interações com Claude ou GPT pela tarifa indicada sob uma única chave.

O mesmo modelo, os mesmos tokens, duas listas de preços

USD por milhão de tokens padrão de entrada e saída sem cache. As tarifas diretas da Anthropic vêm de sua página de preços, consultada em 21 de setembro de 2026; a coluna da Kunavo consulta o catálogo em tempo real.

ModeloAnthropic diretamente: entrada / saídaKunavo: entrada / saídaFunção candidata no Hermes
Claude Haiku 4.5$1.00 / $5.00$0.70 / $3.50Slots auxiliares e workers de delegação
Claude Sonnet 5$2.00 / $10.00$1.40 / $7.00Interação principal com chamada de ferramenta
Claude Opus 5$5.00 / $25.00$3.50 / $17.50Tarefas difíceis e escalonamento

Agora, a aritmética. Suponha um mês com 20 milhões de tokens de entrada sem cache e 2 milhões de tokens de saída, contabilizados em conjunto nas interações principais, nos slots auxiliares e nos workers de delegação — essa contagem combinada é o ponto central, porque uma estimativa por interação deixa de fora dois dos três elementos.

Premissa de roteamentoEstimativa do catálogo
Tudo em Claude Sonnet 5$42.00
Interações principais em Claude Sonnet 5 (4M de entrada / 0,6M de saída); slots auxiliares e workers de delegação em Claude Haiku 4.5 (16M de entrada / 1,4M de saída)$25.90
Tudo em Claude Sonnet 5, mas 16M da entrada chegam como leituras do cache a $0.14 por milhão$21.84

Isto é uma aritmética de tokens às tarifas do catálogo, não uma tarefa Hermes medida nem um teto de cobrança. Exclui gravações no cache — as gravações no cache do Claude são cobradas a 1,25 vezes a tarifa de entrada aqui, conforme explicado na documentação de cache — e exclui ferramentas pagas, hospedagem e impostos. Também pressupõe que o modelo mais barato conclua o trabalho atribuído sem tentativas adicionais. Essa premissa, e não a tarifa, é o que determina se a linha mais barata é de fato mais barata; otimização de custos explica como testá-la.

O valor do catálogo da Kunavo é um piso de cobrança, não um teto: quando o upstream informa sua cobrança, a fatura é o maior valor entre o custo do catálogo e o custo do upstream multiplicado pela margem aplicável. O mínimo é uma recarga pré-paga de $10 sem assinatura, que é o dinheiro necessário para abrir uma conta com saldo, não o custo de uma tarefa. Consulte faturamento.

Conectando um endpoint de terceiros ao Hermes

Esta configuração vem da própria referência de provedores do Hermes, revisada como documentação de origem em 21 de setembro de 2026. Nenhuma execução do Hermes contra a Kunavo foi realizada, não existe um guia de configuração da Kunavo para o Hermes, e nada abaixo deve ser interpretado como uma integração testada. Mantenha sua rota atual disponível enquanto você a experimenta.

Um ponto de partida baseado na documentação de provedores do Hermes
# ~/.hermes/config.yaml
providers:
  kunavo:
    api: https://api.kunavo.com/v1
    key_env: KUNAVO_API_KEY
    transport: chat_completions   # set it; do not rely on URL auto-detection
    models:
      claude-sonnet-5:
        prompt_caching: true

model:
  default: claude-sonnet-5
  provider: custom:kunavo
~/.hermes/.env
KUNAVO_API_KEY=your-key

Cinco coisas que um endpoint personalizado não obtém gratuitamente, cada uma com um custo documentado:

  1. Defina transport explicitamente. Deixá-lo em branco recorre à detecção automática baseada na URL, que a referência de provedores descreve como fallback para um campo vazio e ilustra com uma única regra — um caminho /anthropic que resolve para anthropic_messages. O restante dessa heurística não é enumerado em nenhuma página consultada aqui, razão pela qual é melhor nomear o transporte do que presumir que nada será acionado. O próprio teste de regressão do Hermes para esse caminho registra o modo de falha que ele protege: uma entrada openai-api apontada para um host regional da OpenAI foi resolvida silenciosamente para chat_completions, em vez do transporte declarado pelo próprio provedor, e todas as interações com chamada de ferramenta retornaram 400. A Kunavo oferece /v1/chat/completions, /v1/messages e /v1/responses, portanto os três transportes documentados têm um endpoint correspondente no papel — uma correspondência apenas no nível da documentação, não testada. Nomeie o transporte desejado em vez de deixar a detecção escolhê-lo.
  2. Habilite o armazenamento em cache de prompts para cada modelo. Para um gateway que resolve um alias de modelo simples, os marcadores de cache precisam ser declarados por modelo; o Hermes afirma que não inferirá o suporte a cache a partir do nome, host ou família do modelo de um provedor. Deixar isso de fora silenciosamente elimina a tarifa de entrada em cache, que é a maior alavanca em uma sessão longa. Consulte armazenamento em cache de prompts.
  3. Defina context_length quando o padrão estiver incorreto. Endpoints personalizados compatíveis com OpenAI não recebem automaticamente um limite de saída do tamanho do catálogo — aplicam-se os padrões do próprio servidor, que podem ser inferiores ao máximo do modelo. A janela de contexto é resolvida por uma cadeia que termina em models.dev e depois usa um fallback de 128K.
  4. Saiba o que extra_headers abrange. A página de configuração do modelo aplica isso a rotas compatíveis com OpenAI e a rotas anthropic_messages — cliente principal, alternâncias /model, reconstruções e clientes auxiliares — e identifica bedrock_converse como o único modo que não o utiliza. Ela não afirma nada sobre codex_responses, portanto trate essa combinação como não testada. No protocolo Anthropic, o exemplo da documentação do provedor aponta api para um caminho sem informar o sufixo que o Hermes acrescenta; por isso, verifique o caminho da requisição registrada na primeira chamada — a documentação da URL base aborda a armadilha entre origem e /v1 por trás da maioria dos erros 404 nesse caso.
  5. Use hermes model para adicionar um provedor. Durante uma sessão, /model alterna entre endpoints já configurados e não pode adicionar um novo — e essa alternância descarta o cache.

Para um primeiro teste, execute uma tarefa limitada com uma chamada de ferramenta real e depois consulte /usage e o detalhamento do painel antes de transferir trabalho agendado. Crie uma conta Kunavo quando estiver pronto para testar essa rota com uma chave com saldo. Ainda está escolhendo o agente, e não o provedor? Hermes vs OpenClaw compara os dois fluxos de trabalho.

Perguntas frequentes

Quanto custa o Hermes Agent?

O software Hermes Agent não custa nada: é um software de código aberto sob a licença MIT, e o próprio FAQ informa que você paga apenas pelo uso da API de LLM do provedor escolhido. Os componentes pagos opcionais são uma assinatura do Nous Portal de $0, $20, $100 ou $200 por mês, a hospedagem do Hermes Cloud a partir de $0.56 por dia para uma instância Medium em execução e o uso do Nous Tool Gateway, que a documentação descreve como um recurso de assinatura paga — algumas contas recebem um pequeno conjunto gratuito de ferramentas — sem tabela de preços por uso publicada. Preços verificados nas páginas da Nous em 21 de setembro de 2026.

Qual modelo devo usar no Hermes Agent?

A Nous fornece deliberadamente um padrão de baixo custo: o manifesto remoto de modelos, datado de 20 de setembro de 2026 e consultado no dia seguinte, marca z-ai/glm-5.2 como o modelo padrão, e a documentação do catálogo informa que o padrão é escolhido para ser um modelo capaz e de baixo custo, e não o carro-chefe mais caro. A página de integração do Nous Portal lista separadamente Claude Sonnet 4.6 como sua opção agentic de uso geral, além de GPT-5.5 Pro, uma prévia do Gemini 3 Pro com contexto longo e DeepSeek V4 Pro como codificador econômico. Essas recomendações em prosa estão defasadas em relação ao manifesto e ao catálogo ativo, portanto confirme se o ID do modelo é resolvido em sua própria conta. Nenhum benchmark de tarefa sustenta aqui uma classificação de qualidade.

Qual é a API mais barata para o Hermes Agent?

O menor preço listado e o menor custo para concluir uma tarefa são questões diferentes. Um modelo gratuito do Nous Portal tem preço de token zero, mas é restrito aos modelos marcados como gratuitos, e essa lista é reconstruída a partir do catálogo ativo, em vez de ser fixa. Um modelo local é gratuito para executar depois que você possui o hardware. Entre as entradas pagas do catálogo do próprio Portal em 21 de setembro de 2026, as menores tarifas estavam nos modelos de pesos abertos, não nos carros-chefe dos laboratórios — mas um modelo que falha em um loop de chamada de ferramentas e tenta novamente pode custar mais do que um modelo mais caro que conclui a tarefa. Meça usando o próprio /usage do agente e as análises do painel, em vez de escolher apenas com base em uma tabela de preços.

Posso usar minha assinatura Claude Pro ou Claude Max com o Hermes Agent?

O Claude Pro não consegue operar o Hermes Agent de forma alguma: a documentação de provedores do Hermes afirma que assinantes Pro não podem usar o caminho OAuth e os direciona para uma ANTHROPIC_API_KEY. O Claude Max funciona somente com créditos de uso adicional comprados, e todo o uso do Hermes é cobrado como uso adicional, enquanto a franquia incluída do Max permanece intocada. Os planos para consumidores do Google não têm um caminho documentado, e o OAuth da xAI pode retornar HTTP 403 dependendo do nível da assinatura. O acesso à API com pagamento por token é o caminho normal.

Os modelos Hermes 4 são a mesma coisa que o Hermes Agent?

Não. Hermes 3 e Hermes 4 são a família de LLMs de pesos abertos da Nous Research, publicados como Hermes-4-405B, Hermes-4-70B e Hermes-4-14B no Hugging Face. Hermes Agent é o software de agente sob a licença MIT. A Nous recomenda explicitamente não executar o Hermes 4 dentro do Hermes Agent, afirmando que ele é ajustado para chat e raciocínio, e não para o loop rápido de chamadas de ferramentas do qual o agente depende.

Uma assinatura do Nous Portal dá desconto nos modelos Claude?

Não na tarifa de tokens. No catálogo do Portal consultado em 21 de setembro de 2026, as entradas Claude não tinham redução em relação às tarifas publicadas pela Anthropic: Sonnet a $2.00 de entrada e $10.00 de saída por milhão de tokens, Opus 5 a $5.00 e $25.00, Haiku a $1.00 e $5.00, Fable 5.1 a $10.00 e $50.00. O que um nível pago acrescenta é um bônus de 10 por cento em créditos, uso incluído do Tool Gateway e limites de solicitação maiores. O texto do próprio Portal promete opções gratuitas e descontos exclusivos do Portal, mas o catálogo mostra uma única tarifa por entrada, sem preço de referência ao lado; portanto, não é possível verificar na página pública quais entradas têm desconto.

Páginas da Nous Research e da Anthropic consultadas em 21 de setembro de 2026; o estado do repositório e a versão mais recente foram verificados na API do GitHub no mesmo dia. As tarifas da Kunavo e todos os totais acima são calculados a partir do catálogo de modelos em tempo real e são estimativas ilustrativas. A configuração do Hermes é apresentada com base na documentação de origem, não em um teste de execução.