O Hermes Agent custa $0 para instalar: o software é de código aberto sob a licença MIT e a única cobrança inevitável são os tokens do modelo. Todo o restante é opcional e tem preço separado: uma assinatura do Nous Portal de $0, $20, $100 ou $200 por mês, hospedagem do Hermes Cloud a partir de $0.56 por dia e uso do Tool Gateway, um recurso de assinatura paga que não publica uma tarifa por uso.
Esta página trata do Hermes Agent, o agente de código aberto da Nous Research. Uma verificação ao vivo de o repositório em 21 de setembro de 2026 retornou archived: false, uma licença MIT e um push no mesmo dia; o release publicado mais recente é Hermes Agent v0.21.3, marcado como v2026.9.14 em 14 de setembro de 2026. Ele não é o Hermes 3 nem o Hermes 4, a família de modelos de pesos abertos da Nous, e também não é a marca de artigos de luxo com o mesmo nome.
Quatro cobranças separadas, apenas uma obrigatória
| O que você está comprando | Preço publicado | Onde isso é declarado |
|---|---|---|
| Software Hermes Agent: CLI, interface de terminal, Desktop, gateway de mensagens | $0, licenciado sob a MIT | FAQ do Hermes: você paga apenas pelo uso da API de LLM do provedor escolhido |
| Tokens do modelo | O que quer que seu provedor escolhido cobre | A própria tabela de preços do seu provedor |
| Assinatura do Nous Portal (opcional) | $0 / $20 / $100 / $200 por mês | Planos do Portal |
| Nous Tool Gateway: pesquisa na web, geração de imagens, TTS, navegador na nuvem | Um recurso de assinatura paga; pagamento conforme o uso dentro da assinatura. Nenhuma tarifa por uso publicada. O mesmo documento observa que algumas contas têm direito a um pequeno conjunto gratuito de ferramentas | Documentação do Tool Gateway |
| Hospedagem do Hermes Cloud (opcional) | Medium $0.56/dia em execução, $0.03/dia parada; Large $1.09/dia em execução, $0.03/dia parada; mínimo de $2 em créditos, ou uma assinatura ativa, para fazer a implantação | Hermes Cloud |
| Hermes Business / Enterprise | Nenhum preço publicado. Ambos estão vinculados no rodapé do próprio Portal; nenhuma das páginas retornou a um cliente HTTP simples em 21 de setembro de 2026, portanto seus termos não foram verificados aqui | Página Business |
O Hermes Cloud cobra a instância diariamente em atraso, e a própria página informa que a inferência e o uso de ferramentas são cobrados separadamente, além do preço da instância. Portanto, uma cotação de hospedagem nunca é a cobrança total. Modelos locais, segundo o mesmo FAQ, são totalmente gratuitos para executar depois que você possui o hardware. Todos os valores foram verificados em 21 de setembro de 2026. A mesma divisão em quatro cobranças aplicada a outro agente está em preços do OpenClaw.
Planos do Nous Portal: você está comprando créditos, não um desconto por token
| Nível | Preço mensal | Créditos mensais | Limite de rollover |
|---|---|---|---|
| Gratuita | $0 | $0 — somente modelos gratuitos, limites de taxa padrão | — |
| Plus | $20 | $22 (um bônus de 10 por cento), uso de ferramentas hospedadas, limites de taxa altos | $10 |
| Super | $100 | $110 | $50 |
| Ultra | $200 | $220 | $100 |
| Recarga única | +$10 / +$20 / +$50 / +$100 / +$200, ou um valor arbitrário | Pago pela Stripe | — |
Os créditos são o produto. Uma assinatura de $20 compra $22 em gastos com modelos, portanto sua vantagem sobre o pagamento por token é o bônus, além das ferramentas e dos limites incluídos — não uma tarifa menor para cada modelo. No catálogo público consultado em 21 de setembro de 2026, as entradas Claude tinham as tarifas que a Anthropic publica — Opus 5 a $5.00 de entrada / $25.00 de saída, Fable 5.1 a $10.00 / $50.00 — sem redução indicada. Não é possível verificar nessa página se há desconto em outra coisa: ela mostra uma tarifa por entrada e nenhum preço de referência ao lado. O que ela mostra é que um modelo pode aparecer várias vezes com tarifas diferentes, porque as variantes regionais e em lote são listadas como entradas separadas — Kimi K3 a $1.70 / $8.50, sua entrada :US a $3.63 / $18.15, sua entrada em lote a $3.00 / $15.00. Faça o orçamento com base no ID exato da entrada que você chamará e registre a data de qualquer valor citado.
Três ressalvas antes de fazer o orçamento. O nível gratuito é real, mas restrito às entradas cujo ID de modelo contém o sufixo :free — sete delas na consulta de 21 de setembro de 2026 — e essa lista é reconstruída a partir do catálogo ativo, portanto a recomendação de “usar o gratuito” fica desatualizada rapidamente. As próprias interfaces do Portal exibem dois valores arredondados diferentes para o tamanho do catálogo — um menor em cada cartão de plano pago e um maior na seção acima do próprio catálogo — enquanto a lista publicada continha 360 entradas nessa consulta; trate qualquer um desses valores como marketing, não como dado para orçamento. Também não aparecem números de taxa de solicitações nos cartões de plano; eles dizem apenas limites de taxa “padrão” e “altos”, portanto trate a concorrência como não verificada até observá-la em sua própria conta. A tabela de planos está na página inicial do Portal e em manage-subscription, onde um cliente HTTP simples recebe um checkpoint de segurança da Vercel em vez da página — leia-a em um navegador.
Para onde os tokens realmente vão
Uma tabela de preços define o preço de uma chamada. O Hermes cobra uma carga de trabalho, e há três multiplicadores documentados entre as duas coisas.
Slots auxiliares. O painel expõe 11 slots de tarefas auxiliares — geração de títulos, visão, compressão, aprovação, extração da web, central de skills, roteamento MCP e outros — e todos usam auto por padrão, o que significa que o Hermes também tenta usar seu modelo principal para esse trabalho. O próprio exemplo de desperdício da documentação é a compressão: um modelo de chat rápido faz esse trabalho a um quinquagésimo do custo de um modelo de raciocínio. Uma única interação do usuário pode, portanto, resultar em várias chamadas cobradas.
Delegação. A documentação de delegação afirma que um lote paralelo de subagentes normalmente consome a grande maioria dos tokens totais de uma execução, razão pela qual o modelo de trabalho pode ser configurado separadamente como delegation.model. O próprio aviso de custo observa que max_spawn_depth: 3 com max_concurrent_children: 3 pode chegar a 27 agentes folha simultâneos; a profundidade padrão é 1.
Continuidade do cache. A mesma página de configuração de modelos alerta que os caches de prompt são associados ao modelo que atende à solicitação; portanto, qualquer mudança de modelo no meio da conversa — uma alternância explícita /model, um fallback automático ou uma rotação do pool de credenciais para outra conta — faz a próxima mensagem reler toda a conversa pelo preço integral de entrada, em vez da tarifa com cache, que a página indica ser aproximadamente 75 a 90 por cento menor. Um mecanismo de proteção padrão, model.switch_context_confirm_tokens: 100000, existe precisamente porque essa releitura única pode superar em muito a diferença por token entre os dois modelos.
O trabalho agendado é onde isso tem maior impacto, e não na direção que você esperaria: a documentação de cron informa que uma tarefa sem modelo próprio executa usando o que estiver definido em hermes model ou /model no momento em que for executada; portanto, mudar o modelo de chat move toda a frota de cron na próxima execução. Fixe a tarefa (hermes cron create/edit --pin, ou um --model / --provider explícito) ou defina um padrão para toda a frota com cron.model quando uma tarefa não supervisionada não puder seguir uma alternância. Tarefas somente de script — o modo no_agent da documentação — nunca tocam a camada de inferência. Em vez de estimar qualquer uma dessas coisas, meça-as: o FAQ documenta /usage, /compress e hermes prompt-size, e o painel web documenta uma visualização de análises com tokens totais, porcentagem de acertos de cache e detalhamento por modelo.
Escolhendo o modelo para cada tarefa
Nenhum benchmark aqui sustenta uma classificação de qualidade; portanto, esta é uma tabela do que determina cada escolha, não um ranking.
| Função | O que realmente determina isso |
|---|---|
| Interação principal (o loop de chamadas de ferramentas) | Chamadas de ferramentas confiáveis e contexto suficiente. Um modelo que conversa bem, mas chama ferramentas mal, custa mais em novas tentativas do que sua tarifa sugere |
| Compressão, títulos, pontuação de aprovação, extração da web | O modelo de chat capaz mais barato. A documentação considera modelos de raciocínio um desperdício aqui |
| Workers de delegação | Onde o volume se concentra. Defina delegation.model explicitamente em vez de herdar o modelo principal |
| Visão | Declare model.supports_vision: true quando o modelo não estiver em models.dev ou quando as imagens forem pré-processadas em vez de roteadas nativamente |
| Tarefas cron não supervisionadas | Uma tarefa não fixada executa no modelo principal conforme ele estiver definido no momento da execução; portanto, fixe-a ou defina cron.model. Mantenha o conjunto de ferramentas pequeno — um esquema grande de ferramentas aumenta o prompt em cada chamada |
Vale conhecer duas posições oficiais. A Nous fornece um padrão de baixo custo: o manifesto remoto de modelos, datado de 20 de setembro de 2026 e consultado no dia seguinte, marca z-ai/glm-5.2 como padrão, e a documentação do catálogo informa que o padrão é deliberadamente um modelo capaz e de baixo custo, nunca o carro-chefe mais caro. A Nous também recomenda não usar seus próprios pesos dentro do agente: a página de integração do Portal afirma que o Hermes 4 não é recomendado dentro do Hermes Agent porque é ajustado para chat e raciocínio, e não para o loop rápido de chamadas de ferramentas. A lista dessa página — Claude Sonnet 4.6 como opção agentic de uso geral, GPT-5.5 Pro, uma prévia do Gemini 3 Pro com contexto longo e DeepSeek V4 Pro como codificador econômico — está defasada em relação ao manifesto e ao catálogo ativo; trate-a como um ponto de partida e confirme se o ID do modelo é resolvido.
O uso observado também não é um ranking. A página pública do app Hermes Agent no OpenRouter, consultada em 21 de setembro de 2026, mostrou que o volume de tokens em 30 dias era liderado por MiniMax M3, uma entrada sem rótulo chamada Ox Alpha, Ling 3.0 Flash Fin, GPT-4o-mini e duas compilações do DeepSeek V4 Flash — modelos baratos e rápidos, não carros-chefe. Isso registra o que as pessoas executaram por meio de um gateway, não o que teve melhor desempenho em sua tarefa.
“Modelos Hermes” são duas perguntas diferentes
Uma é qual modelo apontar para o agente, respondida acima. A outra é a família Hermes 4 de pesos abertos — Hermes-4-405B, -70B e -14B no Hugging Face, com Hermes 3 distribuído pelo Ollama. Esses são pesos de modelos da mesma empresa, não o agente, e a Nous diz para não executar o Hermes 4 dentro dele. Uma afirmação aqui está não verificada: a documentação de integração do Portal diz que os modelos Hermes 4 estão disponíveis no Portal com tarifas fortemente descontadas, mas uma busca por “hermes” e “nous” em todo o catálogo público ativo não retornou linhas correspondentes em 21 de setembro de 2026. Eles podem estar visíveis somente após o login ou a documentação pode estar desatualizada. Não faça o orçamento com base em um preço do Hermes 4 no Portal que você não consegue ver em sua própria conta.
Melhor e mais barata API para o Hermes Agent
Essas são afirmações diferentes e devem permanecer separadas. O menor preço listado é um fato da tabela de tarifas; o menor custo para concluir a tarefa depende de novas tentativas, tamanho do contexto e acertos de cache.
| Opção | Quando ela vence | O que verificar primeiro |
|---|---|---|
| Assinatura do Nous Portal | Você quer ferramentas, modelos e hospedagem em um único saldo. A Configuração rápida a chama de caminho rápido recomendado | Créditos, não desconto por token. O Tool Gateway é um recurso de nível pago |
| Chave de API direta do fornecedor | Uma família de modelos, sem camada intermediária, recursos do fornecedor em primeiro lugar | Os planos de chat para consumidores geralmente não funcionam: o Claude Pro não consegue operar o Hermes de forma alguma, o Claude Max exige créditos de uso adicional comprados e os planos para consumidores do Google não têm um caminho documentado |
| Um gateway de terceiros compatível com OpenAI | Você quer um conjunto específico de modelos pela tarifa indicada sob uma única chave | Defina transport explicitamente e habilite o armazenamento em cache de prompts para cada modelo; nenhum dos dois é inferido |
| Modelos gratuitos do Portal | Exploração e trabalho que toleram interrupções | Restrito aos modelos marcados como gratuitos, e essa lista é reconstruída a partir do catálogo em tempo real |
| Inferência local | Você já executa hardware adequado | Gratuito para executar segundo o FAQ, mas a qualidade das chamadas de ferramentas é problema da infraestrutura de serving, não do Hermes |
O Hermes documenta que qualquer serviço com uma API compatível com OpenAI funciona, e sua referência de provedores inclui até receitas para gateways concorrentes; portanto, o caminho de endpoint personalizado é uma rota de primeira classe, e não uma solução alternativa. O diferencial da Kunavo é mais específico do que ser “a mais barata”: seu catálogo abrange modelos das classes Claude e GPT, além de modelos de mídia, enquanto os modelos de pesos abertos que dominam o uso observado do Hermes não estão disponíveis nela. Se sua configuração já executa esses modelos, a Kunavo não é a rota mais barata. Ela é a rota para manter as principais interações com Claude ou GPT pela tarifa indicada sob uma única chave.
O mesmo modelo, os mesmos tokens, duas listas de preços
USD por milhão de tokens padrão de entrada e saída sem cache. As tarifas diretas da Anthropic vêm de sua página de preços, consultada em 21 de setembro de 2026; a coluna da Kunavo consulta o catálogo em tempo real.
| Modelo | Anthropic diretamente: entrada / saída | Kunavo: entrada / saída | Função candidata no Hermes |
|---|---|---|---|
| Claude Haiku 4.5 | $1.00 / $5.00 | $0.70 / $3.50 | Slots auxiliares e workers de delegação |
| Claude Sonnet 5 | $2.00 / $10.00 | $1.40 / $7.00 | Interação principal com chamada de ferramenta |
| Claude Opus 5 | $5.00 / $25.00 | $3.50 / $17.50 | Tarefas difíceis e escalonamento |
Agora, a aritmética. Suponha um mês com 20 milhões de tokens de entrada sem cache e 2 milhões de tokens de saída, contabilizados em conjunto nas interações principais, nos slots auxiliares e nos workers de delegação — essa contagem combinada é o ponto central, porque uma estimativa por interação deixa de fora dois dos três elementos.
| Premissa de roteamento | Estimativa do catálogo |
|---|---|
| Tudo em Claude Sonnet 5 | $42.00 |
| Interações principais em Claude Sonnet 5 (4M de entrada / 0,6M de saída); slots auxiliares e workers de delegação em Claude Haiku 4.5 (16M de entrada / 1,4M de saída) | $25.90 |
| Tudo em Claude Sonnet 5, mas 16M da entrada chegam como leituras do cache a $0.14 por milhão | $21.84 |
Isto é uma aritmética de tokens às tarifas do catálogo, não uma tarefa Hermes medida nem um teto de cobrança. Exclui gravações no cache — as gravações no cache do Claude são cobradas a 1,25 vezes a tarifa de entrada aqui, conforme explicado na documentação de cache — e exclui ferramentas pagas, hospedagem e impostos. Também pressupõe que o modelo mais barato conclua o trabalho atribuído sem tentativas adicionais. Essa premissa, e não a tarifa, é o que determina se a linha mais barata é de fato mais barata; otimização de custos explica como testá-la.
O valor do catálogo da Kunavo é um piso de cobrança, não um teto: quando o upstream informa sua cobrança, a fatura é o maior valor entre o custo do catálogo e o custo do upstream multiplicado pela margem aplicável. O mínimo é uma recarga pré-paga de $10 sem assinatura, que é o dinheiro necessário para abrir uma conta com saldo, não o custo de uma tarefa. Consulte faturamento.
Conectando um endpoint de terceiros ao Hermes
Esta configuração vem da própria referência de provedores do Hermes, revisada como documentação de origem em 21 de setembro de 2026. Nenhuma execução do Hermes contra a Kunavo foi realizada, não existe um guia de configuração da Kunavo para o Hermes, e nada abaixo deve ser interpretado como uma integração testada. Mantenha sua rota atual disponível enquanto você a experimenta.
# ~/.hermes/config.yaml
providers:
kunavo:
api: https://api.kunavo.com/v1
key_env: KUNAVO_API_KEY
transport: chat_completions # set it; do not rely on URL auto-detection
models:
claude-sonnet-5:
prompt_caching: true
model:
default: claude-sonnet-5
provider: custom:kunavoKUNAVO_API_KEY=your-keyCinco coisas que um endpoint personalizado não obtém gratuitamente, cada uma com um custo documentado:
- Defina
transportexplicitamente. Deixá-lo em branco recorre à detecção automática baseada na URL, que a referência de provedores descreve como fallback para um campo vazio e ilustra com uma única regra — um caminho/anthropicque resolve paraanthropic_messages. O restante dessa heurística não é enumerado em nenhuma página consultada aqui, razão pela qual é melhor nomear o transporte do que presumir que nada será acionado. O próprio teste de regressão do Hermes para esse caminho registra o modo de falha que ele protege: uma entradaopenai-apiapontada para um host regional da OpenAI foi resolvida silenciosamente parachat_completions, em vez do transporte declarado pelo próprio provedor, e todas as interações com chamada de ferramenta retornaram 400. A Kunavo oferece/v1/chat/completions,/v1/messagese/v1/responses, portanto os três transportes documentados têm um endpoint correspondente no papel — uma correspondência apenas no nível da documentação, não testada. Nomeie o transporte desejado em vez de deixar a detecção escolhê-lo. - Habilite o armazenamento em cache de prompts para cada modelo. Para um gateway que resolve um alias de modelo simples, os marcadores de cache precisam ser declarados por modelo; o Hermes afirma que não inferirá o suporte a cache a partir do nome, host ou família do modelo de um provedor. Deixar isso de fora silenciosamente elimina a tarifa de entrada em cache, que é a maior alavanca em uma sessão longa. Consulte armazenamento em cache de prompts.
- Defina
context_lengthquando o padrão estiver incorreto. Endpoints personalizados compatíveis com OpenAI não recebem automaticamente um limite de saída do tamanho do catálogo — aplicam-se os padrões do próprio servidor, que podem ser inferiores ao máximo do modelo. A janela de contexto é resolvida por uma cadeia que termina em models.dev e depois usa um fallback de 128K. - Saiba o que
extra_headersabrange. A página de configuração do modelo aplica isso a rotas compatíveis com OpenAI e a rotasanthropic_messages— cliente principal, alternâncias/model, reconstruções e clientes auxiliares — e identificabedrock_conversecomo o único modo que não o utiliza. Ela não afirma nada sobrecodex_responses, portanto trate essa combinação como não testada. No protocolo Anthropic, o exemplo da documentação do provedor apontaapipara um caminho sem informar o sufixo que o Hermes acrescenta; por isso, verifique o caminho da requisição registrada na primeira chamada — a documentação da URL base aborda a armadilha entre origem e/v1por trás da maioria dos erros 404 nesse caso. - Use
hermes modelpara adicionar um provedor. Durante uma sessão,/modelalterna entre endpoints já configurados e não pode adicionar um novo — e essa alternância descarta o cache.
Para um primeiro teste, execute uma tarefa limitada com uma chamada de ferramenta real e depois consulte /usage e o detalhamento do painel antes de transferir trabalho agendado. Crie uma conta Kunavo quando estiver pronto para testar essa rota com uma chave com saldo. Ainda está escolhendo o agente, e não o provedor? Hermes vs OpenClaw compara os dois fluxos de trabalho.
Perguntas frequentes
Quanto custa o Hermes Agent?
O software Hermes Agent não custa nada: é um software de código aberto sob a licença MIT, e o próprio FAQ informa que você paga apenas pelo uso da API de LLM do provedor escolhido. Os componentes pagos opcionais são uma assinatura do Nous Portal de $0, $20, $100 ou $200 por mês, a hospedagem do Hermes Cloud a partir de $0.56 por dia para uma instância Medium em execução e o uso do Nous Tool Gateway, que a documentação descreve como um recurso de assinatura paga — algumas contas recebem um pequeno conjunto gratuito de ferramentas — sem tabela de preços por uso publicada. Preços verificados nas páginas da Nous em 21 de setembro de 2026.
Qual modelo devo usar no Hermes Agent?
A Nous fornece deliberadamente um padrão de baixo custo: o manifesto remoto de modelos, datado de 20 de setembro de 2026 e consultado no dia seguinte, marca z-ai/glm-5.2 como o modelo padrão, e a documentação do catálogo informa que o padrão é escolhido para ser um modelo capaz e de baixo custo, e não o carro-chefe mais caro. A página de integração do Nous Portal lista separadamente Claude Sonnet 4.6 como sua opção agentic de uso geral, além de GPT-5.5 Pro, uma prévia do Gemini 3 Pro com contexto longo e DeepSeek V4 Pro como codificador econômico. Essas recomendações em prosa estão defasadas em relação ao manifesto e ao catálogo ativo, portanto confirme se o ID do modelo é resolvido em sua própria conta. Nenhum benchmark de tarefa sustenta aqui uma classificação de qualidade.
Qual é a API mais barata para o Hermes Agent?
O menor preço listado e o menor custo para concluir uma tarefa são questões diferentes. Um modelo gratuito do Nous Portal tem preço de token zero, mas é restrito aos modelos marcados como gratuitos, e essa lista é reconstruída a partir do catálogo ativo, em vez de ser fixa. Um modelo local é gratuito para executar depois que você possui o hardware. Entre as entradas pagas do catálogo do próprio Portal em 21 de setembro de 2026, as menores tarifas estavam nos modelos de pesos abertos, não nos carros-chefe dos laboratórios — mas um modelo que falha em um loop de chamada de ferramentas e tenta novamente pode custar mais do que um modelo mais caro que conclui a tarefa. Meça usando o próprio /usage do agente e as análises do painel, em vez de escolher apenas com base em uma tabela de preços.
Posso usar minha assinatura Claude Pro ou Claude Max com o Hermes Agent?
O Claude Pro não consegue operar o Hermes Agent de forma alguma: a documentação de provedores do Hermes afirma que assinantes Pro não podem usar o caminho OAuth e os direciona para uma ANTHROPIC_API_KEY. O Claude Max funciona somente com créditos de uso adicional comprados, e todo o uso do Hermes é cobrado como uso adicional, enquanto a franquia incluída do Max permanece intocada. Os planos para consumidores do Google não têm um caminho documentado, e o OAuth da xAI pode retornar HTTP 403 dependendo do nível da assinatura. O acesso à API com pagamento por token é o caminho normal.
Os modelos Hermes 4 são a mesma coisa que o Hermes Agent?
Não. Hermes 3 e Hermes 4 são a família de LLMs de pesos abertos da Nous Research, publicados como Hermes-4-405B, Hermes-4-70B e Hermes-4-14B no Hugging Face. Hermes Agent é o software de agente sob a licença MIT. A Nous recomenda explicitamente não executar o Hermes 4 dentro do Hermes Agent, afirmando que ele é ajustado para chat e raciocínio, e não para o loop rápido de chamadas de ferramentas do qual o agente depende.
Uma assinatura do Nous Portal dá desconto nos modelos Claude?
Não na tarifa de tokens. No catálogo do Portal consultado em 21 de setembro de 2026, as entradas Claude não tinham redução em relação às tarifas publicadas pela Anthropic: Sonnet a $2.00 de entrada e $10.00 de saída por milhão de tokens, Opus 5 a $5.00 e $25.00, Haiku a $1.00 e $5.00, Fable 5.1 a $10.00 e $50.00. O que um nível pago acrescenta é um bônus de 10 por cento em créditos, uso incluído do Tool Gateway e limites de solicitação maiores. O texto do próprio Portal promete opções gratuitas e descontos exclusivos do Portal, mas o catálogo mostra uma única tarifa por entrada, sem preço de referência ao lado; portanto, não é possível verificar na página pública quais entradas têm desconto.
Páginas da Nous Research e da Anthropic consultadas em 21 de setembro de 2026; o estado do repositório e a versão mais recente foram verificados na API do GitHub no mesmo dia. As tarifas da Kunavo e todos os totais acima são calculados a partir do catálogo de modelos em tempo real e são estimativas ilustrativas. A configuração do Hermes é apresentada com base na documentação de origem, não em um teste de execução.