O software do AnythingLLM é gratuito — o aplicativo Desktop é um download de US$ 0 e a edição Docker auto-hospedada é gratuita sob a licença MIT do repositório do projeto — portanto, na prática, “preços do AnythingLLM” significa duas cobranças que ninguém publica: uma assinatura opcional de hospedagem ou licença e os tokens da API do modelo que você fornece. A única lista oficial de preços, anythingllm.com/cloud, define o preço da hospedagem e diz isso em seu próprio item: “Basta trazer uma chave de API de LLM”. Observe que anythingllm.com/pricing não é uma página real — ela redireciona para a mesma página de nuvem.
Este guia separa as três camadas: o que o AnythingLLM cobra, o que aumenta a conta de tokens e qual rota de provedor vence para cada carga de trabalho. Todos os valores têm fonte e data, e os cálculos são identificados como cálculos.
Já tem um workspace? Vá para a configuração do provedor de chat e verificação da primeira cobrança. Mantenha o provedor de embeddings separado; atualmente, o Kunavo não oferece nenhum modelo de embeddings.
Duas coisas diferentes são chamadas de “API do AnythingLLM”
Resolva isso antes de comparar preços, porque as duas não têm nenhuma relação entre si.
Na própria documentação do AnythingLLM, a API é a API local de desenvolvedor e gerenciamento que sua instância disponibiliza em /api/docs — criar espaços de trabalho, enviar documentos, conversar com um espaço de trabalho — autenticada por uma chave que você gera dentro da sua própria instância. Ela não tem preço, porque é o seu servidor conversando consigo mesmo.
A API que um comprador que pesquisa “melhor API para o AnythingLLM” quase sempre quer dizer é o endpoint do modelo upstream que entra no campo Base URL do provedor de chat. Essa tem um preço por token e é a única parte de uma implantação do AnythingLLM que escala com o uso. Tudo abaixo trata da segunda.
O que o próprio AnythingLLM cobra
| Produto | Preço publicado | O que você recebe e o que isso não inclui |
|---|---|---|
| Desktop (macOS / Windows / Linux) | $0 | Download gratuito. Inclui um mecanismo de LLM local integrado e um embedder local integrado |
| Docker auto-hospedado | US$ 0, MIT | “Auto-hospede com Docker gratuitamente”. Você paga pela máquina e por qualquer API de modelo para a qual apontá-la |
| Desktop Pro — anual | US$ 15/mês, cobrado anualmente (US$ 180/ano) | Uso diário ilimitado de três recursos Magic em todo o sistema operacional, além de documentos sem marca d’água. Zero tokens de modelo |
| Desktop Pro — mensal | $20/mês | Os mesmos recursos, teste gratuito de 14 dias, sem compromisso anual |
| Cloud — Basic | $50/mês | Instância privada, subdomínio personalizado, “Basta trazer uma chave de API de LLM”. Somente hospedagem |
| Cloud — Pro | US$ 99/mês | Recursos prioritários e SLA de suporte de 72 horas. Ainda somente hospedagem |
| Cloud — Enterprise | Entre em contato conosco | Implantação on-premise, SSO e RBAC. Nenhum preço publicado |
| Dispositivo móvel (Android) | Não publicado | A documentação móvel não contém nenhuma declaração de preços; esta página não verificou a listagem na loja |
| Community Hub | Nenhum preço publicado | Os itens públicos não precisam de uma chave de Connection; apenas a obtenção de itens privados precisa. Ainda em beta |
Os preços do Cloud foram lidos em anythingllm.com/cloud em 19 de setembro de 2026. Os valores do Desktop Pro exigem uma ressalva: vêm da captura de tela do checkout incorporada pelo AnythingLLM em sua própria documentação, porque o checkout ativo da Mintplex Labs fica atrás de um desafio antirobô que não foi contornado. Essa imagem traz sua própria ressalva — o preço “não reflete promoções, testes gratuitos elegíveis ou cupons aplicados no checkout”. Considere US$ 15/US$ 20/US$ 180 como o valor publicado pelo AnythingLLM e confirme o número no checkout antes de comprar.
Duas armadilhas em torno da palavra “Pro”. O Cloud Pro de US$ 99 não é o Desktop Pro. São produtos separados, e vários resumos de terceiros citam o preço da hospedagem como o da licença de desktop. E o Desktop Pro é mais limitado do que o nome sugere: a visão geral do Pro do AnythingLLM afirma que “o AnythingLLM Desktop será e sempre será gratuito para usar em 99% dos nossos recursos” e que o Pro “simplesmente remove esses limites diários” dos recursos Magic. Ele não restringe chat, RAG, agentes nem acesso a modelos. A cota diária gratuita de cada recurso Magic é descrita apenas como “generosa” — nenhum número é publicado, portanto nenhum é citado aqui. Separadamente, Magic Tab e Magic Beacon estão disponíveis apenas no macOS e Windows; a página do Beacon indica o Linux como “Atualmente não suportado”.
Mais uma desambiguação: publicadores não relacionados revendem imagens de VM do AnythingLLM nos marketplaces da Microsoft e da AWS com suas próprias tarifas horárias. Essas listagens não são publicadas pela Mintplex Labs e seus preços não são preços do AnythingLLM. Esta página não leu os valores — as páginas dos marketplaces retornaram 403 — portanto nenhum aparece aqui.
O que nenhum desses preços inclui
Nenhum plano do AnythingLLM inclui tokens de modelo, e os planos Cloud deixam isso explícito. A página de limitações do Cloud afirma que “a nuvem hospedada do AnythingLLM não vem com um LLM integrado que você possa usar como em nossa instância desktop” — portanto, um assinante do Cloud precisa fornecer um endpoint externo, o que torna os US$ 50 ou US$ 99 um piso, não um total. A mesma página alerta que o embedder integrado “não impedirá você de tentar incorporar um PDF de 5.000 páginas, mas fará sua instância travar”, e que agentes personalizados não são compatíveis com o Cloud hospedado.
O Desktop Pro conta a mesma história em miniatura. Sua documentação do Magic Tab diz que a geração de sugestões é “feita no dispositivo usando o provedor e o modelo de LLM configurados”, portanto uma assinatura Pro não compra inferência — compra a remoção de um limite diário de recursos que então consomem seu próprio orçamento de tokens.
O caminho genuíno de zero tokens existe e é exclusivo do Desktop: o provedor integrado executa um modelo local usando o mecanismo licenciado sob MIT do Ollama, marcado como “SOMENTE DESKTOP!” na documentação. Se um modelo local responder aos seus documentos de forma suficientemente boa, essa metade da conta será US$ 0 para sempre.
De onde vem efetivamente a conta de tokens
Uma conta do AnythingLLM tem duas metades independentes, cobradas por dois provedores separados que você configura separadamente.
Ingestão é única: cada documento é dividido em partes e incorporado uma vez. Chat é recorrente: cada turno reenvia um prompt do sistema, o histórico repetido, as partes recuperadas e a pergunta. A metade recorrente é a que importa, e os padrões incluídos determinam seu tamanho.
| Padrão incluído | Valor | O que ele multiplica |
|---|---|---|
| Tamanho da parte de texto | 1.000 caracteres (~250 tokens) | O tamanho de cada parte recuperada desses documentos, até que sejam excluídos e reincorporados |
| Sobreposição das partes | 20 caracteres | Quanto texto duplicado entra no índice |
Partes recuperadas (topN) | 4 | Contexto de fundamentação por turno |
| Histórico de chat | 20 mensagens | Entrada repetida por turno — geralmente o maior componente |
| Limite de similaridade | 0,25 | Quantas partes ultrapassam o limite |
O tamanho e a sobreposição das partes vêm da documentação de divisão de texto, que também fornece a conversão de ~4 caracteres por token usada acima, nomeia o RecursiveCharacterTextSplitter do LangChain como a única estratégia e alerta que as alterações se aplicam apenas aos documentos incorporados depois. Os outros três são lidos do esquema Prisma incluído (topN 4, openAiHistory 20, similarityThreshold 0.25), que é a fonte de autoridade. Há um conflito a conhecer: a página de RAG do AnythingLLM diz “4-6 partes de texto”, mas essa página se identifica como documentação legada substituída na v1.8.5. O padrão do esquema é 4, e ele pode ser ajustado pelo usuário.
O erro caro aqui não é uma configuração. Anexar um documento não é o mesmo que incorporá-lo. A introdução ao chat com documentos do AnythingLLM diz que, por padrão, ele “inserirá o texto completo dos seus documentos na janela de chat” e que, se você exceder a janela de contexto ao adicionar documentos, perguntará se deseja dividi-los em partes — isto é, incorporá-los. Até aceitar essa oferta, o caminho de anexos reenvia o documento inteiro a cada turno em vez de quatro partes, e a diferença de custo é de uma ordem de grandeza — quantificada abaixo.
A metade de embeddings e a parte que a Kunavo não fornece
Seja direto sobre isso: a Kunavo não tem nenhum modelo de embedding habilitado. kunavo.com/llms.txt afirma que o formato de protocolo /v1/embeddings está implementado, mas nenhum modelo de embedding está listado atualmente, e orienta os agentes a não recomendar a Kunavo para embeddings; o mesmo vale para conversão de fala em texto e texto em fala (verificado em 19 de setembro de 2026). Como o embedder do AnythingLLM é um provedor separado do modelo de chat, definido para todo o sistema em vez de por espaço de trabalho, a compatibilidade de chat nunca implica compatibilidade de embeddings. Execute a metade da ingestão localmente ou com um fornecedor dedicado de embeddings.
A opção mais barata para essa metade também é a padrão. O embedder integrado do AnythingLLM é o all-MiniLM-L6-v2, um modelo de CPU de 25 MB que precisa de cerca de 2 GB de RAM e é treinado principalmente em inglês. Ele não custa nada por documento. Se você precisar de um embedder hospedado, o AnythingLLM publica sua própria referência de custo em páginas por dólar.
| Opção de embedding | ~Páginas por dólar | Entrada máxima |
|---|---|---|
| Local integrado (all-MiniLM-L6-v2) | Sem cobrança por página | Executado na sua própria CPU |
| text-embedding-3-small | 62.500 | 8.191 |
| text-embedding-ada-002 | 12.500 | 8.191 |
| text-embedding-3-large | 9.615 | 8.191 |
A Kunavo não fornece essa etapa nem informa um preço para ela — todas as tarifas dessa tabela são cobradas diretamente pela OpenAI, na própria conta da OpenAI. Os valores de páginas por dólar são do próprio AnythingLLM, extraídos de sua página do embedder da OpenAI (verificada em 19 de setembro de 2026); a mesma página observa que o aplicativo exibe uma estimativa de preço antes da execução. Eles são consistentes com as tarifas publicadas pela OpenAI de US$ 0,02, US$ 0,10 e US$ 0,13 por milhão de tokens, respectivamente. Na primeira linha, uma ingestão de 500 páginas custa aproximadamente US$ 0,008 — esse é o ponto central: a etapa de ingestão quase nunca é a responsável pelos custos de uma conta do AnythingLLM.
A única exceção é a reindexação. A visão geral do embedder alerta que, depois que você começa a incorporar, “é melhor não alterá-lo”, porque a troca significa excluir e reincorporar todos os documentos. Planeje uma reindexação como uma repetição do custo da ingestão e lembre-se de que um embedder local torna essa repetição gratuita.
A metade do chat: um provedor, dois padrões caros
Um endpoint compatível com OpenAI para o qual o AnythingLLM não oferece nenhuma integração nomeada entra pelo provedor literalmente chamado Generic OpenAI. Sua página de configuração alerta que ele é “um provedor de LLM voltado para desenvolvedores — você não deve usá-lo a menos que saiba o que está fazendo” e o descreve como a forma de alcançar “qualquer provedor de LLM com o qual não nos integramos explicitamente”. Verifique primeiro a lista de provedores: vários serviços com formato OpenAI têm provedores nomeados com seus próprios campos de URL base no .env.example incluído — entre eles LM Studio, LocalAI, LiteLLM, KoboldCpp e Text Generation WebUI — e mantêm seus próprios padrões, em vez dos genéricos abaixo.
| Campo da interface | Chave de ambiente | Por que isso importa para o custo |
|---|---|---|
| URL base | GENERIC_OPEN_AI_BASE_PATH | Passado literalmente ao SDK da OpenAI, portanto o sufixo /v1 é obrigatório, embora o placeholder o omita |
| Chave de API | GENERIC_OPEN_AI_API_KEY | Sua chave de gateway ou fornecedor |
| Modelo selecionado | GENERIC_OPEN_AI_MODEL_PREF | Sem validação prévia — a verificação sempre retorna true, portanto um erro de digitação falha no momento da chamada |
| Janela de contexto do modelo | GENERIC_OPEN_AI_MODEL_TOKEN_LIMIT | Assumido como 4096 quando vazio. Os orçamentos de histórico, sistema e usuário são então calculados contra uma janela fictícia |
| Max Tokens | GENERIC_OPEN_AI_MAX_TOKENS | O padrão é 1024, o que trunca respostas longas até ser aumentado |
Os nomes dos campos e os padrões foram lidos do server/.env.example incluído pelo AnythingLLM e do código-fonte do provedor OpenAI genérico no branch master, em 19 de setembro de 2026 — a chave MAX_TOKENS está apenas no código-fonte, não em .env.example. Dois extras: GENERIC_OPEN_AI_CUSTOM_HEADERS, documentado em .env.example para gateways que precisam de cabeçalhos adicionais, e GENERIC_OPENAI_STREAMING_DISABLED no código-fonte do provedor, que força respostas sem streaming.
# CHAT ONLY. Key names from AnythingLLM's server/.env.example, except
# GENERIC_OPEN_AI_MAX_TOKENS, which appears only in the provider source.
LLM_PROVIDER='generic-openai'
# The value is handed straight to the OpenAI SDK as baseURL, so /v1 is required.
# The UI placeholder ("eg: https://proxy.openai.com") omits it. Include it anyway.
GENERIC_OPEN_AI_BASE_PATH='https://api.kunavo.com/v1'
GENERIC_OPEN_AI_API_KEY='sk-kn-...'
# Any string is accepted here: the provider's pre-flight check always returns
# true, so a typo fails at call time rather than at save time.
GENERIC_OPEN_AI_MODEL_PREF='claude-sonnet-4-6'
# Leave this empty and AnythingLLM assumes 4096 — not your model's real window —
# then budgets history and context against that made-up number.
GENERIC_OPEN_AI_MODEL_TOKEN_LIMIT=1000000
# Defaults to 1024, which truncates long answers until you raise it.
GENERIC_OPEN_AI_MAX_TOKENS=8192Um limite a considerar, expresso de forma restrita. O provedor Anthropic nativo do AnythingLLM constrói seu cliente SDK apenas com uma chave de API e cabeçalhos padrão: não passa uma URL base, e o AnythingLLM não expõe nenhum campo Base URL nem documenta uma substituição para esse provedor. Esse é o limite da superfície própria do AnythingLLM — não é uma afirmação de que o tráfego não possa ser redirecionado, porque o SDK TypeScript da Anthropic que ele constrói define seu baseURL como process.env.ANTHROPIC_BASE_URL por padrão, portanto essa variável do processo do servidor ainda chega até ele. O AnythingLLM não documenta nem oferece suporte a isso, então trate-o como não documentado, não como uma rota: a forma compatível de acessar um endpoint de terceiros é o OpenAI genérico por meio de conclusões de chat.
A consequência para o cache é igualmente restrita. ANTHROPIC_CACHE_CONTROL é a chave que faz o provedor nativo inserir um marcador cache_control no prompt do sistema, e nada no caminho OpenAI genérico envia esse marcador — portanto, uma rota cujo protocolo exige que o cliente solicite o cache não obtém um acerto de cache por esse caminho. Isso nada diz sobre endpoints que fazem cache automaticamente sem um marcador do cliente; saber se o seu faz isso é uma questão para a documentação do próprio provedor. O cache de prompts explica o valor dessa alavanca onde uma rota oferece suporte a ela.
Dois limites adicionais que vale a pena conhecer antes de fazer seu orçamento. O suporte a visão e anexos neste provedor é feito da melhor forma possível — a fonte afirma em um comentário que presume uma matriz de conteúdo genuinamente no formato da OpenAI e não será atualizada para provedores que diferem. E a geração de imagens não tem uma opção genérica de URL base: a página de geração de imagens documenta quatro provedores nomeados — OpenAI, OpenRouter, Ollama e Lemonade — e nenhuma linha para endpoint personalizado; portanto, /img chega a um gateway somente quando esse gateway é uma das integrações nomeadas, como OpenRouter, e não apontando a Generic OpenAI Base URL para ele.
Uma estimativa prática de custo da API do AnythingLLM
Isto é aritmética de tokens baseada em tarifas publicadas, não um custo de tarefa medido nem um teto de cobrança. Considere os padrões enviados acima e um turno composto por: um prompt do sistema de 200 tokens, 4 trechos recuperados com 250 tokens cada, 20 mensagens de histórico reproduzidas com média de 120 tokens e uma pergunta de 40 tokens — 3.640 tokens de entrada — retornando 400 tokens de saída. O prompt do sistema, o tamanho do histórico e o tamanho da resposta são suposições; a quantidade de trechos, o tamanho dos trechos e a quantidade de mensagens do histórico são padrões próprios do AnythingLLM. A última coluna mantém tudo igual, mas anexa um documento de 30.000 tokens em vez de recuperar trechos, fazendo com que o texto completo acompanhe cada turno. As tarifas são preços atuais do catálogo da Kunavo por milhão de tokens.
| Modelo | Entrada / saída por 1M | Por interação | 1.000 turnos | 1.000 turnos, documento anexado |
|---|---|---|---|---|
| Claude Haiku 4.5 | $0,70 / $3,50 | $0,0039 | $3,95 | $24,25 |
| GPT-5.6 Terra | $0,70 / $4,20 | $0,0042 | $4,23 | $24,53 |
| Claude Sonnet 4.6 | $2,10 / $10,50 | $0,0118 | $11,84 | $72,74 |
| Claude Opus 5 | $3,50 / $17,50 | $0,0197 | $19,74 | $121,24 |
Três conclusões. Primeiro, com essas suposições, um mês de perguntas e respostas fundamentadas em modelos Claude Sonnet 4.6 custa $11,84 — menos que um único mês do Cloud Basic, a $50. Para uma carga desse tamanho, a decisão de hospedagem, não a decisão do provedor, é a parcela maior; por isso, as duas cobranças precisam ser dimensionadas separadamente, em vez de compensadas. Segundo, anexar o documento em vez de indexá-lo leva a mesma carga em Claude Sonnet 4.6 a $72,74: com essas suposições, o desenho da recuperação movimenta mais dinheiro do que a escolha do provedor. Terceiro, a diferença entre modelos é real, mas secundária — modelos Claude Haiku 4.5 a $3,95 contra Claude Opus 5 a $19,74 para os mesmos turnos.
Escale esses valores pelos seus próprios turnos por dia antes de tratá-los como orçamento e acrescente o custo de ingestão somente quando você reindexar. O valor do catálogo da Kunavo é um piso de cobrança, não um teto: quando o upstream informa sua cobrança, a fatura é o maior valor entre o custo do catálogo e o custo do upstream multiplicado pela margem aplicável. As cobranças de cache e as ferramentas externas ficam fora deste exemplo. O aporte mínimo da Kunavo é $10 em crédito pré-pago, que é um mínimo de financiamento, não uma taxa por tarefa nem uma assinatura — consulte detalhes de cobrança.
Melhor API e melhor modelo para o AnythingLLM: qual rota vence em cada situação
| Opção | Vantagens | O que você abre mão |
|---|---|---|
| Modelo local integrado (somente Desktop) | Cargas privadas ou pequenas, sem nenhuma cobrança por solicitação | Somente Desktop; não é um substituto completo do Ollama e tem uma lacuna de recursos em relação aos modelos de ponta hospedados |
| API direta do fornecedor | O modelo principal de um único fornecedor o dia todo, com seus próprios descontos de cache e lote | Um segundo fornecedor significa uma segunda conta e um segundo saldo |
| Gateway compatível com OpenAI | Você troca de modelo por espaço de trabalho e quer uma única chave e um único saldo | Você entra como Generic OpenAI, então a janela de contexto e os campos de max-tokens são definidos por você, e o provedor nativo Anthropic do AnythingLLM — com seu alternador cache_control — não é a rota que você está usando |
| Assinatura da nuvem mais sua própria chave | Você quer que a instância seja gerenciada e não quer executar o Docker | $50 ou $99 por mês além da cobrança de tokens, sem LLM integrado e sem agentes personalizados no Cloud hospedado |
| Licença do Desktop Pro | Você usa os recursos Magic de todo o sistema operacional depois de exceder sua franquia diária gratuita | $15–20 por mês, sem incluir tokens; Magic Tab e Beacon estão disponíveis somente no macOS e no Windows |
Sobre o “melhor modelo”, o AnythingLLM oferece a resposta honesta como um recurso. O Model Router — auto-hospedado para um ou vários usuários e disponível no Desktop desde a v1.13.0 — encaminha mensagens simples para um modelo barato ou local e somente as difíceis para um modelo remoto caro, tendo “Economizar dinheiro” como finalidade declarada. Para perguntas e respostas fundamentadas, um modelo intermediário geralmente é suficiente, porque os trechos recuperados fornecem os fatos; reserve um modelo de ponta para síntese e execuções de agentes. Os agentes acrescentam sua própria pressão sobre os tokens, algo que o AnythingLLM aborda com a Intelligent Tool Selection — ativada por padrão na v1.15.0, ela envia para a janela do prompt apenas as ferramentas de que um chat precisa, em vez de todas as ferramentas registradas; a sua documentação afirma que isso vale “economizar até 80% em cada chat”. Esse é um número do próprio AnythingLLM, referente aos tokens que as definições das ferramentas adicionariam de outra forma, não à cobrança total, e não medido de forma independente. Uma melhoria recente menor: a v1.16.1 observa que cancelar a inferência agora realmente a interrompe no upstream, portanto uma resposta abandonada não é mais cobrada até a conclusão.
Para uma comparação mais ampla de provedores, consulte alternativas ao OpenRouter e melhor gateway de LLM; para o desenho de recuperação que determina a maior parte da cobrança acima, consulte implementação de RAG e otimização de custos de IA. Se você ainda estiver escolhendo o próprio cliente, AnythingLLM vs Open WebUI compara os dois quanto à hospedagem e ao formato da cobrança.
Salve a lista de verificação da migração do gateway antes de alterar sua configuração em funcionamento.
Configurando e verificando a primeira cobrança
A Kunavo está configurada aqui como um endpoint Generic OpenAI usando as configurações acima; a página da API compatível com OpenAI aborda o formato das solicitações, e o índice de integrações lista os clientes que já têm uma página de configuração escrita. O AnythingLLM não foi testado em tempo de execução contra o endpoint da Kunavo para este guia; portanto, trate a configuração acima como um ponto de partida documentado, não como um resultado de compatibilidade: mantenha uma rota funcional disponível, defina a janela de contexto e os campos de max-tokens antes da primeira conversa real, execute um espaço de trabalho limitado e depois leia a cobrança efetivamente registrada na sua conta. Crie uma conta Kunavo quando estiver pronto para financiar uma chave — e mantenha o embedder no modelo local gratuito, porque a Kunavo não vende essa parte.
Perguntas frequentes
Quanto custa o AnythingLLM?
O software é gratuito. O AnythingLLM Desktop para macOS, Windows e Linux é um download de US$ 0, e a edição Docker auto-hospedada é gratuita e licenciada sob a MIT — a própria página de nuvem do anythingllm.com oferece “Auto-hospede com Docker gratuitamente” (verificado em 19 de setembro de 2026). O dinheiro aparece em três lugares opcionais: hospedagem do AnythingLLM Cloud por US$ 50 ou US$ 99 por mês, uma licença do AnythingLLM Desktop Pro exibida por US$ 15 por mês com cobrança anual ou US$ 20 mensais na própria documentação de checkout do AnythingLLM, e a cobrança da API do modelo do provedor que você configurar. Nenhuma das assinaturas inclui tokens de modelo.
O AnythingLLM Pro custa US$ 99 por mês?
Somente se você estiver falando do Cloud Pro. Dois produtos diferentes são chamados de Pro. O AnythingLLM Cloud Pro custa US$ 99 por mês e é hospedagem para equipes — uma instância privada, recursos prioritários e o que a página chama de SLA de suporte de 72 horas. O AnythingLLM Desktop Pro é uma chave de licença vendida pelo checkout da Mintplex Labs, exibida por US$ 15 por mês com cobrança anual (US$ 180 por ano) ou US$ 20 por mês com cobrança mensal e teste de 14 dias, e desbloqueia apenas o uso diário ilimitado de três recursos Magic em todo o sistema operacional, além de documentos gerados sem marca d’água. Citar US$ 99 como preço do desktop é o erro mais comum em textos de terceiros.
Qual é a melhor API para o AnythingLLM?
Primeiro, separe duas coisas que compartilham o nome. A API do AnythingLLM em sua própria documentação é a API local de desenvolvedor e gerenciamento que sua própria instância disponibiliza em /api/docs, autenticada por uma chave gerada dentro da instância — ela não tem preço. A API que as pessoas querem dizer ao pesquisar isso é o endpoint do modelo upstream que entra no campo Base URL do provedor OpenAI genérico. Nesse caso, uma API direta do fornecedor vence quando você usa um fornecedor o dia todo e quer o cache e os descontos de lote próprios dele; um gateway compatível com OpenAI, como a Kunavo, vence quando você alterna modelos por espaço de trabalho e quer uma única chave e um único saldo; um modelo local pelo mecanismo integrado da versão Desktop vence quando você não quer nenhuma cobrança por solicitação. Escolha com base na forma como você trabalha, não em um único vencedor.
Qual é a API mais barata para o AnythingLLM?
Para a parte de indexação, a opção mais barata é gratuita e já vem incluída: o embedder integrado do AnythingLLM é o all-MiniLM-L6-v2, um modelo de 25 MB que é baixado na primeira incorporação e executado na CPU, portanto a incorporação não custa nada por documento. Para a parte de chat, a menor tarifa anunciada e o menor custo para concluir o trabalho são questões diferentes — um modelo barato que exige uma segunda e uma terceira pergunta sobre o mesmo documento pode custar mais do que um que responde corretamente na primeira vez. Selecione o modelo mais barato que responda de forma aceitável a perguntas sobre seus próprios documentos e depois confira a cobrança efetivamente registrada na sua conta do provedor. As configurações de recuperação geralmente afetam a conta mais do que o provedor: por padrão, 20 mensagens do histórico do chat são reenviadas.
Qual é o melhor modelo para o AnythingLLM?
Não há uma única resposta, e o AnythingLLM inclui um recurso que deixa isso claro. O Model Router, disponível nos modos auto-hospedado de usuário único e multiusuário e no Desktop desde a v1.13.0, permite que um espaço de trabalho envie mensagens simples para um modelo barato ou local e apenas as difíceis para um modelo remoto caro; a própria documentação do AnythingLLM apresenta “Economizar dinheiro” como o motivo de sua existência. Para perguntas e respostas fundamentadas sobre seus próprios documentos, um modelo intermediário geralmente é suficiente porque a recuperação fornece os fatos. Reserve um modelo de fronteira para síntese e trabalho de agente, e observe que o provedor OpenAI genérico não faz pré-verificação do modelo — qualquer string de ID de modelo é aceita e só falha quando uma solicitação é enviada.
Posso apontar o provedor Anthropic do AnythingLLM para um endpoint de terceiros?
Não por meio de algo que o AnythingLLM exponha ou documente. O provedor Anthropic nativo constrói o cliente do SDK da Anthropic com uma chave de API e cabeçalhos padrão, e nada além disso — não passa baseURL, e não há campo Base URL na interface desse provedor. Isso é uma afirmação sobre o AnythingLLM, não sobre o protocolo: o SDK TypeScript da Anthropic define process.env.ANTHROPIC_BASE_URL como seu baseURL padrão, portanto essa variável do processo do servidor ainda redireciona o cliente construído pelo AnythingLLM. O AnythingLLM não documenta nem oferece suporte a isso, então a rota compatível para um endpoint de terceiros é o provedor OpenAI genérico por meio de conclusões de chat. Uma consequência que vale prever: ANTHROPIC_CACHE_CONTROL é o que faz o provedor nativo inserir um marcador cache_control no prompt do sistema, e o caminho OpenAI genérico não envia esse marcador — portanto, um protocolo que exige que o cliente solicite o cache não fará cache por esse caminho. Endpoints que fazem cache automaticamente sem um marcador do cliente são uma questão separada, a ser verificada na documentação do seu provedor.
A Kunavo pode fornecer o embedder do AnythingLLM?
Não — a Kunavo não fornece embeddings. kunavo.com/llms.txt afirma que o formato de protocolo /v1/embeddings existe, mas nenhum modelo de embedding está listado, e orienta os agentes a não recomendar a Kunavo para embeddings. O mesmo vale para conversão de fala em texto e texto em fala, que a Kunavo também não fornece. Como o embedder do AnythingLLM é um provedor separado do provedor de chat, esta é uma parte real do produto que a Kunavo não cobre: use o embedder local integrado gratuito ou um fornecedor dedicado de embeddings, e mantenha a Kunavo apenas para o provedor de chat. Observe também que o embedder é de todo o sistema, não por espaço de trabalho, e alterá-lo significa excluir e reincorporar todos os documentos.
Preços, documentação, .env.example distribuído, esquema do Prisma e código-fonte do provedor do AnythingLLM verificados em 19 de setembro de 2026; endpoint da Kunavo e disponibilidade de embeddings reverificados em kunavo.com/llms.txt no mesmo dia. O preço do Desktop Pro vem de uma captura de tela do checkout do próprio AnythingLLM, não do checkout ao vivo, que não estava acessível. As tarifas de tokens da Kunavo vêm do catálogo ao vivo, e todo exemplo em dólares nesta página é aritmética ilustrativa de tokens, não um custo de tarefa medido.