Em uma Plataforma AutoGPT auto-hospedada, o agente de chat AutoPilot é executado em qualquer endpoint compatível com OpenAI que você fornecer — quatro variáveis de ambiente, definidas no contêiner. Executamos a imagem oficial em contêiner único da v0.8.2 dessa forma contra um endpoint substituto que registrava as requisições em 1º de outubro de 2026: uma interação de chat e três ciclos de ida e volta de ferramentas foram concluídos, e o arquivo do workspace escrito pelo AutoPilot foi lido novamente pela API. O serviço agpt.co hospedado não aceita um endpoint personalizado, e o bloco AI Text Generator dentro dos grafos de agentes também não.
Para saber quanto o AutoGPT custa no total — planos hospedados, créditos e auto-hospedagem — consulte preços do AutoGPT. Se estiver deixando o AutoGPT, veja alternativas ao AutoGPT. Esta página trata especificamente da rota de endpoint personalizado.
O que pode usar seu endpoint e o que não pode
| Parte do AutoGPT | Aceita um endpoint personalizado? | Base |
|---|---|---|
| Chat do AutoPilot, auto-hospedado | Sim — CHAT_BASE_URL | Executado na v0.8.2: chat e chamadas de ferramentas concluídos |
| Títulos de conversas | Sim, mesmo endpoint e modelo | Observado na execução: uma chamada curta sem streaming por sessão |
| Simulador de execução de teste do Builder, extração durante a integração inicial | Sim, segundo o guia do AutoGPT | Documentado; não testado aqui |
| Memória do Graphiti | Mesma URL base, com modelos próprios (GRAPHITI_*_MODEL) | Observado na execução: /v1/responses mais uma chamada de embedding por interação |
| Busca semântica do marketplace | Mesma URL base, STORE_EMBEDDING_MODEL (deve retornar vetores de 1.536 dimensões) | Observado na execução: 200 chamadas de embedding na inicialização |
| Bloco AI Text Generator em grafos de agentes | Não — provedores fixos; somente um host nativo do Ollama pode ser definido | Código-fonte da v0.8.2 |
| agpt.co hospedado | Não | Guia do AutoGPT: a implantação na nuvem ignora essas variáveis |
Configurando
O AutoGPT chama isso de transporte local porque Ollama é o destino usual, mas CHAT_BASE_URL é apenas uma URL — o próprio guia lista uma API gerenciada compatível com OpenAI entre as configurações que funcionam. Quatro variáveis importam: CHAT_USE_LOCAL=true, CHAT_BASE_URL terminando em /v1, CHAT_API_KEY (obrigatória — o transporte deliberadamente não usa uma chave OpenAI como fallback) e CHAT_FAST_STANDARD_MODEL como um ID de modelo simples. Se você deixar os modelos avançado, de títulos e de simulação sem definir, o AutoGPT os deriva do modelo padrão, para que nenhum nome exclusivo da nuvem chegue ao seu endpoint.
docker run -d --name autogpt \
--shm-size 2g --ulimit nofile=65536:65536 \
-p 127.0.0.1:3000:3000 \
-e AUTOGPT_PUBLIC_URL=http://localhost:3000 \
-e CHAT_USE_LOCAL=true \
-e CHAT_BASE_URL=https://api.kunavo.com/v1 \
-e CHAT_API_KEY=sk-kn-... \
-e CHAT_FAST_STANDARD_MODEL=claude-haiku-4-5 \
-e CHAT_FAST_ADVANCED_MODEL=claude-sonnet-5 \
-v autogpt-data:/data \
significantgravitas/autogpt:v0.8.2
# Compose installs put the same four CHAT_* lines in autogpt_platform/backend/.env.
# Check them inside the running container:
docker exec autogpt env | grep ^CHAT_De dentro do Docker, localhost é o contêiner, não sua máquina: um endpoint no host é http://host.docker.internal:<port>/v1 no Docker Desktop, que foi como a execução alcançou seu substituto. Um endpoint hospedado, como o do Kunavo, não exige nenhuma configuração especial de rede. A primeira inicialização executa migrações do banco de dados e leva vários minutos; aguarde até o contêiner informar que está saudável.
O que uma interação envia — medido
| Solicitação | Tamanho | Observações |
|---|---|---|
POST /v1/chat/completions, primeira chamada de uma interação | 41,876 bytes | Streaming; 16 ferramentas — entre elas bash_exec, web_fetch, run_agent, write_workspace_file; apenas os campos de corpo messages, model, stream, tools |
| Igual, após um resultado de ferramenta | 42,677 bytes | Quatro mensagens: a chamada da ferramenta e seu resultado anexados |
| Título | Cerca de 0,6 KB | Sem streaming, uma vez por sessão, mesmo modelo |
| Memória do Graphiti | Por interação | POST /v1/responses com o nome de modelo Ornith padrão e uma chamada de embedding para nomic-embed-text |
| Consultas da janela de contexto | Por sessão | GET /api/ps, /props, /api/v0/models, /v1/models |
Os tamanhos foram idênticos em bytes nas três execuções. São bytes de solicitação de um substituto, não uma contagem de tokens do provedor. O formato da solicitação é o Chat Completions simples da OpenAI — sem extensões do fornecedor — portanto, um endpoint que ofereça chamadas de ferramentas em streaming é tudo de que o caminho de chat precisa.
Tráfego secundário a considerar
Tudo acima foi para a mesma URL base. Duas consequências se seu endpoint for um gateway de chat, e não uma pilha local completa. Embeddings: o índice do marketplace solicitou text-embedding-3-small 200 vezes na inicialização, e o Graphiti solicitou nomic-embed-text a cada interação; um endpoint sem modelos de embedding retorna 404, a busca no armazenamento usa fallback somente lexical e a extração de memória registra rastreamentos de erro — o chat em si não foi afetado. O Kunavo não oferece modelos de embedding, portanto esse é o estado esperado no Kunavo. Nomes dos modelos de memória: as chamadas de /v1/responses do Graphiti usam seu próprio nome de modelo padrão, a menos que GRAPHITI_LLM_MODEL e GRAPHITI_RERANKER_MODEL estejam definidos como modelos servidos pelo seu endpoint.
Quanto custa por interação
Como aritmética aproximada, não uma cobrança: uma interação com ferramenta enviou 84,553 bytes em duas chamadas — cerca de 21,138 tokens de entrada considerando quatro caracteres por token — mais algumas centenas de tokens de saída; assumimos 600.
| Modelo pelo Kunavo | Tarifa por 1M de entrada / saída | Uma interação com ferramenta |
|---|---|---|
| Claude Haiku 4.5 | $0.70 / $3.50 | $0.017 |
| Claude Sonnet 5 | $1.40 / $7.00 | $0.034 |
As conversas crescem, portanto as interações posteriores enviam mais dados. O Kunavo cobra por token a partir de um saldo pré-pago, com recarga mínima de $10 e sem assinatura (cobrança); o valor do catálogo é um piso de cobrança, não um limite máximo. Ninguém no Kunavo executou o AutoGPT contra o próprio endpoint — a execução aqui usou um substituto local — portanto, verifique a cobrança da primeira interação no seu registro de uso.
Perguntas frequentes
O AutoGPT pode usar um endpoint de API personalizado?
Sim, em uma parte do produto e somente quando você o hospeda. Em uma Plataforma AutoGPT auto-hospedada, o agente de chat AutoPilot aceita qualquer endpoint compatível com OpenAI por meio de CHAT_USE_LOCAL=true, CHAT_BASE_URL, CHAT_API_KEY e CHAT_FAST_STANDARD_MODEL. Executamos a imagem oficial em contêiner único da v0.8.2 dessa forma em 1º de outubro de 2026, contra um endpoint local substituto: uma interação de chat e três ciclos de ida e volta de ferramentas foram concluídos, e o arquivo escrito pelo AutoPilot foi lido novamente pela API do workspace. O serviço agpt.co hospedado ignora essas variáveis, e o bloco AI Text Generator dentro dos grafos de agentes não as lê.
O bloco AI Text Generator usa CHAT_BASE_URL?
Não. O próprio guia do AutoGPT afirma que o caminho de chat do AutoPilot e a camada de blocos leem variáveis diferentes. No código-fonte da v0.8.2, os clientes OpenAI e Anthropic da camada de blocos são criados sem URL base, e o único host que pode ser definido ali é um host Ollama para a API nativa do Ollama — portanto, os grafos de agentes que chamam o bloco AI Text Generator continuam usando os provedores fornecidos pelo AutoGPT, independentemente do valor de CHAT_BASE_URL.
Qual é a melhor ou mais barata API para o AutoGPT?
For the self-hosted chat path, the cheapest is a model you run yourself — AutoGPT's guide uses Ollama — and the cheapest metered option is whichever OpenAI-compatible endpoint serves a capable tool-calling model at the lowest rate. Each tool turn in our run sent about 85 KB across two chat calls with 16 tool definitions, roughly 21,000 input tokens at four characters per token; at Kunavo's Claude Haiku 4.5 rates that is about $0.017 a turn, and about $0.034 on Claude Sonnet 5. Cheapest listed rate and cheapest finished task are different questions: a model that fumbles tool calls costs more turns.
Por que meu endpoint do AutoGPT recebe solicitações de embedding e /v1/responses?
Porque outros recursos seguem a mesma URL base. Em nossa execução, o endpoint recebeu 200 solicitações de embedding para text-embedding-3-small na inicialização (o índice semântico do marketplace) e, após cada interação de chat, a memória do Graphiti enviou uma chamada /v1/responses usando seu nome de modelo padrão e uma chamada de embedding para nomic-embed-text. Um endpoint sem esses modelos responde 404; o chat continuou funcionando, e o contêiner registrou rastreamentos de erro do Graphiti. Defina GRAPHITI_LLM_MODEL, GRAPHITI_RERANKER_MODEL e GRAPHITI_EMBEDDER_MODEL como modelos servidos pelo seu endpoint, ou aceite memória degradada e busca lexical somente no armazenamento.
Como verifico se o AutoPilot está realmente usando meu endpoint?
Três verificações, todas do guia do AutoGPT e todas observadas em nossa execução: entre no contêiner com docker exec e filtre o ambiente por CHAT_; envie uma interação de chat e procure por "Using baseline service" nos logs; e confirme que seu endpoint registrou uma solicitação de streaming /v1/chat/completions com o modelo definido. Antes da primeira interação, o AutoPilot também consulta /api/ps, /props, /api/v0/models e /v1/models para descobrir a janela de contexto; endpoints que não informam nenhuma janela usam 32k como fallback, segundo o guia.
Execução em 1º de outubro de 2026: significantgravitas/autogpt:v0.8.2 (imagem arm64, sha256:8322941548c6…) no Docker Desktop, com o AutoPilot conduzido por sua própria API de chat usando uma conta local descartável, contra um endpoint substituto local que registrava as requisições e respondeu a uma chamada de ferramenta e depois com texto. Três ciclos de ida e volta de ferramentas, todos concluídos; o arquivo escrito foi lido novamente pela API do workspace. O comportamento além da execução vem do guia copilot-local-llm do AutoGPT e do código-fonte da v0.8.2. O substituto não é um provedor nem o Kunavo.