O SillyTavern não vende API nem assinatura, portanto escolher a melhor API para o SillyTavern é uma compra de modelo e provedor — e o número decisivo é o custo de um turno no seu Context Size, não o preço anunciado por milhão de tokens. O SillyTavern reenvia o cartão do personagem, o prompt do sistema e o máximo de histórico que couber em cada geração, portanto a cobrança cresce com a conversa mesmo que a tarifa nunca mude.
A versão 1.19.0 foi publicada em 14 de setembro de 2026 sob AGPL-3.0, e o último push do repositório foi em 14 de setembro de 2026 (verificado em 18 de setembro de 2026). Duas coisas que não são o SillyTavern: TavernAI, o projeto ancestral separado — a documentação data o SillyTavern de "fevereiro de 2023 como um fork do TavernAI 1.2.8" — e SillyTavern-Extras, cuja descrição do repositório agora começa com "[OBSOLETE]". Tutoriais que orientam a instalação do Extras estão desatualizados.
O que é gratuito e o que não é
| O que você está comprando | Preço | Fonte |
|---|---|---|
| SillyTavern, todas as plataformas | $0, AGPL-3.0, sem nível pago e sem serviço hospedado vendido pelo projeto | A documentação afirma que ele "será sempre gratuito e de código aberto" |
| Algo para executá-lo | Node.js 20 ou mais recente | package.json declara "engines": { "node": ">= 20" } |
| O modelo que escreve as respostas | Esta é toda a cobrança recorrente | A documentação o chama de "uma interface de usuário instalada localmente que permite interagir com LLMs de geração de texto" |
| "Hospedagem do SillyTavern" de terceiros ou aplicativos móveis pagos | Produto de outra pessoa | sillytavern.app não publica nenhum preço |
Fontes verificadas em 18 de setembro de 2026: o repositório do projeto e a FAQ oficial. A FAQ divide os backends entre modelos auto-hospedados, gratuitos para executar, e serviços web pagos que, em suas palavras, "custam dinheiro para usar".
Como um chat do SillyTavern gera sua cobrança
A documentação de Context Size do SillyTavern define a configuração como o número máximo de tokens que o SillyTavern enviará à API como prompt, menos o comprimento da resposta, e diz que o contexto "é composto por informações do personagem, prompts do sistema, histórico do chat etc." As mensagens acima da linha pontilhada no chat simplesmente não são enviadas, em vez de serem resumidas. Portanto, um turno custa aproximadamente context tokens × input rate + reply tokens × output rate, e uma resposta regenerada cobra novamente todo o lado da entrada.
O contexto padrão do Chat Completion é de 4.095 tokens, definido nos padrões distribuídos (lidos em 18 de setembro de 2026); o controle deslizante o aumenta em ordens de magnitude, e ainda mais com o contexto desbloqueado. O Context Size é, portanto, o maior controle de orçamento do aplicativo: quadruplicá-lo aproximadamente quadruplica a cobrança de entrada em cada mensagem subsequente à mesma tarifa.
Lista de modelos e quanto cada um custa
USD por milhão de tokens de entrada / saída: tarifas atuais do catálogo da Kunavo ao lado do preço de lista publicado pelo próprio fornecedor, todos verificados em 18 de setembro de 2026.
| Modelo | Kunavo: entrada / saída | Lista do fornecedor: entrada / saída | Indicação de uso |
|---|---|---|---|
| GPT-5.6 Terra | $0.70 / $4.20 | $2.00 / $12.00 | Uma voz que não é Claude, útil para uma segunda opinião sobre o mesmo cartão de personagem |
| Claude Haiku 4.5 | $0.70 / $3.50 | $1.00 / $5.00 | A linha de menor preço aqui — o Claude barato para sessões longas em que a entrada por turno predomina |
| Claude Sonnet 5 | $1.40 / $7.00 | $2.00 / $10.00 | Equilíbrio cotidiano entre qualidade e custo por turno |
| Claude Opus 5 | $3.50 / $17.50 | $5.00 / $25.00 | Nível Claude mais alto; compare sua linha antes de presumir que custa mais |
| Claude Fable 5.1 | $7.00 / $35.00 | $10.00 / $50.00 | O mais caro por turno nesta tabela, tanto no preço do catálogo quanto no preço de lista |
Os preços dos fornecedores vêm da página de preços da Anthropic e dos preços para desenvolvedores da OpenAI.
Uma estimativa mensal calculada
Suponha 100 gerações em um mês, um prompt que cresceu para cerca de 16.000 tokens, respostas de 300 tokens e nenhuma nova tentativa. Isso representa 1,6 milhão de tokens de entrada e 30.000 tokens de saída. Nas tarifas do catálogo acima:
| Modelo | Total estimado para 100 turnos |
|---|---|
| GPT-5.6 Terra | $1.25 |
| Claude Haiku 4.5 | $1.22 |
| Claude Sonnet 5 | $2.45 |
| Claude Fable 5.1 | $12.25 |
Isto é aritmética de tokens baseada em números presumidos, não uma sessão medida nem um teto para o que será cobrado. Altere qualquer suposição e a resposta mudará: aumentar o Context Size, regenerar respostas ou executar 500 turnos em vez de 100 dimensiona o lado da entrada. Também não inclui cobranças de cache, assunto da próxima seção.
A diferença de cache que decide um chat longo
Esta é a parte invisível na interface. No branch de release 1.19.0 do backend de chat-completions (lido em 18 de setembro de 2026), cada marcador cache_control fica condicionado a uma verificação de fonte integrada: a fonte Claude, a fonte ElectronHub para IDs de modelo claude-, a fonte OpenRouter para IDs de modelo anthropic/claude, novamente a fonte OpenRouter para os IDs google/gemini que ela identifica como compatíveis com cache, e uma flag do NanoGPT. O branch Custom (OpenAI-compatible) não aparece em nenhuma dessas verificações e não define nenhum campo cache_control — o que ele define é logprobs, um response_format se você configurou um esquema JSON, seus Include Headers e Include Body Parameters, e reasoning_effort ou verbosity onde você os solicitou. Também não há uma seção custom: em a configuração distribuída, onde ficam os controles de cache claude: e gemini:.
A consequência é específica do protocolo da Anthropic: a fonte Custom nunca define um marcador cache_control, portanto, em um modelo Claude, todo o histórico é cobrado novamente pelo preço total de entrada a cada turno, a menos que o endpoint insira os pontos de interrupção por conta própria. Isso não significa que nada seja armazenado em cache nesse caminho. O cache de prompts da OpenAI é ativado por padrão para modelos compatíveis e não exige nada do cliente, portanto uma rota GPT pela mesma fonte Custom pode usar cache enquanto uma rota Claude não usa. O cache é decidido pelo modelo e pelo endpoint, não pelo que o SillyTavern envia. A tradução da Kunavo de OpenAI para Anthropic insere esses pontos — nos blocos de ferramentas e do sistema, além de um ponto de interrupção rotativo na mensagem final quando a conversa já contém um turno do assistente, que é a estrutura de um chat do SillyTavern após o primeiro turno. Ela precisa de 8.192 caracteres de prompt antes de ser ativada e nunca excede o limite de quatro pontos de interrupção do fornecedor. Detalhes estão na documentação de cache, escrita para chamadores que definem os pontos de interrupção por conta própria.
O que isso vale, como melhor cenário e não como previsão: se 12.000 daqueles 16.000 tokens de prompt fossem lidos do cache a cada turno à tarifa de leitura de cache da Kunavo para Claude Sonnet 5 ($0.14 por milhão), os mesmos 100 turnos chegariam a cerca de $0.94, em vez de $2.45. Considere isso a maior economia disponível, não um teto do que você pagará: a suposição é de um acerto de cache em todos os turnos e nenhuma gravação de cache, portanto uma cobrança real ficará acima desse valor. A Anthropic cobra uma leitura de cache a 0,1× da entrada base (0,025× no Fable 5.1), mas uma gravação de cache a 1,25× por uma janela de cinco minutos — um usuário de roleplay que demora mais do que isso entre mensagens paga novamente pela gravação, em vez da leitura. A Anthropic também vende uma gravação de uma hora a 2×. Nenhuma sessão real do SillyTavern foi cobrada pelo gateway para este guia, portanto verifique primeiro o uso informado no seu próprio primeiro chat longo antes de fazer um orçamento com base em acertos de cache.
Quando direto, um gateway, uma assinatura ou o uso local vence
| Opção | Compre quando | A troca |
|---|---|---|
| Fornecedor direto (Anthropic, OpenAI, Google) | Você quer um fornecedor e a fonte integrada do SillyTavern para ele | A fonte Claude integrada expõe configurações de cache para as quais a fonte Custom não tem caminho de código; uma conta por fornecedor |
| Gateway multimodelo | Você quer IDs Claude e GPT por trás de uma chave e um saldo | O SillyTavern fala com ele usando chat OpenAI simples, portanto os controles específicos do provedor que ele expõe permanecem nas fontes integradas |
| Host de pesos abertos com tarifa fixa | Você conversa diariamente e quer um valor mensal previsível | Verifique o limite do nível: os planos da Arli AI são separados pelo comprimento máximo de contexto, o recurso exato consumido por um chat longo |
| Hospedagem gratuita | Experimentando o aplicativo ou usando chats que toleram uma fila | Prioridade e limites de taxa em vez de uma cobrança |
| Modelo local | Você tem o hardware e quer nenhum filtro de conteúdo e nenhuma chave | Sua máquina, sua manutenção, seu teto de qualidade |
Números concretos, verificados em 18 de setembro de 2026. A OpenRouter repassa os preços dos provedores e cobra 5,5% (mínimo de $0,80) nas compras de crédito com cartão, com modelos gratuitos limitados a 50 solicitações por dia, ou 1.000 após a compra de pelo menos $10 em créditos. A NanoGPT vende pagamento conforme o uso e uma assinatura opcional de $12 por mês, com depósito mínimo de $0,10 em criptomoeda ou $1 por cartão. A Arli AI oferece um nível gratuito e níveis mensais de $10, $15, $20, $30 e $160, que diferem pelo comprimento máximo de contexto (12K no nível gratuito até 512K no nível superior), pelo tamanho do modelo e pelas solicitações paralelas; a Infermatic lista um plano gratuito e planos de $9, $16 e $20; a Featherless lista Chat a $25 por mês e Developer a $50. O AI Horde se descreve como "Gratuito · administrado pela comunidade · de código aberto"; sua FAQ explica que a posição na fila segue seu saldo total de kudos e que usuários anônimos começam em zero, portanto usuários registrados ficam acima deles. O Google publica um nível gratuito do Gemini, mas sua página de limites de taxa não lista números por modelo para o nível gratuito e direciona você ao AI Studio; trate, portanto, qualquer cota específica do nível gratuito lida em outro lugar como não verificada.
A Kunavo não oferece nível gratuito nem crédito de cadastro: o mínimo é $10 em crédito pré-pago, sem assinatura e com saldo que não expira. Uma estimativa do catálogo também não é um teto de preço — consulte cobrança para saber como uma cobrança é liquidada.
As regras de conteúdo vêm antes do preço
A própria FAQ do SillyTavern diz que os serviços web pagos "costumam ser censurados e se recusam a conversar com você sobre certos assuntos". Esta é uma informação de primeira parte e é a expectativa correta a estabelecer. A Usage Policy da Anthropic proíbe chat erótico e geração sexualmente explícita, sem exceção para usuários adultos, e um gateway não altera a política sob a qual o modelo é servido — a própria política da Kunavo afirma que as políticas dos provedores upstream se aplicam ao que você envia. Nada nesta página deve ser interpretado como oferta de um endpoint sem filtros. Se roleplay adulto irrestrito for seu requisito, a resposta honesta é um modelo local ou um host de pesos abertos, e a lista de modelos acima não é a seção certa para você.
Configure-o e depois controle a cobrança
O caminho documentado é Chat Completion → Custom (OpenAI-compatible), preenchendo Custom Endpoint (Base URL) e Custom API Key. Não acrescente /chat/completions; adicione /v1 se a conexão falhar. Quatro coisas importantes antes do seu primeiro chat longo:
- Os parâmetros de amostragem são enviados, a menos que o ID do modelo esteja em uma lista de remoção. O construtor de solicitações do frontend coloca
temperature,top_p,frequency_penaltyepresence_penaltyem cada solicitação de Chat Completion. No branch de release 1.19.0, ele então remove esses quatro e tambémtop_kpara qualquer ID de modelo que corresponda aclaude-fable,claude-opus-5ouclaude-sonnet-5— essa regra usa o ID do modelo sem verificar a fonte, portanto também é acionada na fonte Custom. Ela não abrange Claude Haiku 4.5, e a regra equivalente para GPT-5 ao lado dela funciona apenas nas fontes integradas OpenAI, Azure e OpenRouter, portanto esses IDs ainda levam campos de amostragem a um endpoint personalizado. O catálogo da Kunavo marca separadamentetemperature,top_petop_kcomo incompatíveis com os modelos Claude 5 listados acima e os remove antes da chamada ao upstream; em um endpoint que não faça isso, deixe-os em branco por meio de Exclude Body Parameters no painel Additional Parameters, ou um modelo que rejeite esses campos responderá com um 400. - Comece o processamento posterior do prompt em None. A API Messages da Anthropic combina internamente turnos consecutivos da mesma função e não possui uma função system, portanto um gateway de tradução eleva as mensagens do sistema ao parâmetro de nível superior. A documentação do SillyTavern define None como "nenhum processamento explícito aplicado, a menos que seja estritamente exigido pela API", Semi-strict como a combinação de funções, permitindo apenas uma mensagem system opcional, e Strict como também exigindo primeiro uma mensagem do usuário — portanto, se você vir um 400 sobre funções de mensagens, passe para Semi-strict. Observe que Merge, Semi-strict e Strict também removem chamadas de ferramentas, a menos que você escolha a variante "with tools".
- O contador de tokens é uma estimativa. A documentação do tokenizador do SillyTavern diz que as contagens são "estimadas com base no tipo de tokenizador selecionado" sempre que o backend não fornece um, e suas regras de melhor correspondência nomeiam fornecedores específicos, não um endpoint personalizado arbitrário. A Anthropic afirma que os modelos Claude 4.7 e posteriores usam um tokenizador mais recente que produz "aproximadamente 30% mais tokens para o mesmo texto", portanto uma contagem produzida por um tokenizador mais antigo fica abaixo do que esses modelos cobram.
- A gaveta Reverse Proxy é um recurso diferente. Seu bloco de aviso na interface fornecida é limitado às fontes integradas (
data-source="openai,claude,mistralai,…") e diz: "QUAISQUER solicitações de suporte serão RECUSADAS se você estiver usando um proxy." A página de documentação com esse nome é sobre colocar o próprio SillyTavern atrás do Traefik, NGINX ou Caddy, o que é outro assunto. A fonte Custom é o caminho compatível e não corresponde a essa gaveta.
A Kunavo publica um guia de configuração do SillyTavern com os valores exatos dos campos — uma configuração escrita, não um teste de compatibilidade em tempo de execução realizado em seu nome. Se as tarifas acima forem adequadas aos seus chats, crie uma conta e comece com o mínimo de $10, em vez de uma assinatura.
Perguntas frequentes
Quanto custa o SillyTavern?
O próprio SillyTavern não custa nada. É um software AGPL-3.0 que você instala e executa localmente; a versão 1.19.0 foi publicada em 14 de setembro de 2026, e a documentação do projeto diz que ele “será sempre gratuito e de código aberto”. O que custa dinheiro é a API do modelo à qual ele se conecta, cobrada por token pelo provedor escolhido, ou o hardware e a eletricidade se você executar um modelo localmente. Uma página que anuncia um preço para o SillyTavern está vendendo hospedagem ou uma assinatura de API, não o aplicativo.
Qual é a API mais barata para o SillyTavern?
As rotas que não geram cobrança incluem inferência local (KoboldCpp, llama.cpp, Ollama, Oobabooga) e o AI Horde, um serviço administrado por voluntários ao qual o SillyTavern se conecta imediatamente; nesse caso, a troca é prioridade na fila, não dinheiro. Alguns fornecedores também publicam seu próprio nível gratuito. Entre os endpoints pagos, a menor tarifa listada e o chat concluído mais barato são afirmações diferentes: o SillyTavern reenvia o prompt inteiro a cada geração, portanto uma tarifa baixa por token em um modelo que exige várias novas tentativas pode custar mais do que um modelo mais caro que acerta a resposta de primeira. Compare o custo por turno no seu Context Size real, não na tarifa anunciada.
Qual é o melhor modelo para o SillyTavern?
Esta página não classifica nenhum modelo pela qualidade da prosa, porque não mediu nenhuma — escolha pela restrição que você consegue realmente precificar: o custo por turno. Para o menor custo por turno em chats longos, considere um nível barato como Claude Haiku 4.5. Para um equilíbrio cotidiano, Claude Sonnet 5 ou Claude Opus 5. Claude Fable 5.1 é o mais caro por turno entre os modelos comparados nesta página, portanto só vale a pena se você conseguir perceber a diferença nos seus próprios chats. As notas de versão do SillyTavern 1.19.0 registram suporte de backend adicionado para Claude Fable 5 e 5.1, Claude Opus 4.8 e 5, Claude Sonnet 5 e os modelos GPT-5.6, portanto suas fontes integradas Anthropic e OpenAI já conhecem esses IDs.
O SillyTavern funciona com uma API personalizada compatível com OpenAI?
Sim, e esse é um caminho documentado de primeira classe, não uma solução alternativa. Defina API como Chat Completion, Chat Completion Source como Custom (OpenAI-compatible) e preencha Custom Endpoint (Base URL) e Custom API Key. A documentação do SillyTavern diz para não adicionar o sufixo /chat/completions à URL base e para tentar adicionar /v1 se a conexão falhar. Se o endpoint implementar GET /v1/models, o menu Available Models será preenchido automaticamente; caso contrário, você digita o ID do modelo manualmente.
Por que a cobrança do SillyTavern aumenta à medida que o chat fica mais longo?
Porque o prompt cresce. O SillyTavern envia o cartão do personagem, o prompt do sistema e o máximo possível do histórico do chat dentro do Context Size a cada geração, portanto o turno 200 cobra muito mais entrada do que o turno 2 à mesma tarifa por token. O cache de prompts é o mecanismo que muda isso, mas no branch de release 1.19.0 cada cache_control enviado pelo SillyTavern depende de uma fonte integrada: sua própria fonte Claude, sua fonte ElectronHub para IDs de modelo claude-*, sua fonte OpenRouter para IDs de modelo anthropic/claude e para os modelos google/gemini que aceitam cache, além de uma flag específica do NanoGPT. A fonte Custom (OpenAI-compatible) não está entre elas, portanto, em um endpoint personalizado, o cache precisa vir do próprio endpoint.
Posso usar uma API paga para roleplay sem censura?
Não com os fornecedores de fronteira. A própria FAQ do SillyTavern alerta que os serviços web pagos costumam ser censurados e se recusam a tratar de certos assuntos, e a Usage Policy da Anthropic proíbe completamente chat erótico e geração sexualmente explícita. Encaminhar a mesma solicitação por um gateway não altera a política sob a qual o modelo é servido, e a política de uso aceitável da Kunavo afirma que as políticas dos provedores upstream se aplicam ao conteúdo enviado por ela. Se o requisito for conteúdo adulto irrestrito, essa decisão pertence a modelos locais ou hosts de pesos abertos, não a um endpoint Claude, GPT ou Gemini.
Status das versões do SillyTavern, documentação, código-fonte fornecido e preços dos concorrentes verificados em 18 de setembro de 2026. As tarifas da Kunavo são lidas do catálogo ativo; todos os totais aqui são cálculos de tokens baseados nas premissas declaradas, não sessões medidas.