Voltar aos guias
Configuração·1 de outubro de 2026·7 min de leitura

API personalizada do AutoGPT: executando o AutoPilot hospedado por você no seu próprio endpoint compatível com OpenAI

Quatro variáveis de ambiente transferem o chat AutoPilot para seu próprio endpoint em uma instalação hospedada por você. A camada de bloqueio e o serviço hospedado não seguem essa configuração — e as chamadas de embeddings e memória chegam à mesma URL.

Última revisão em .

Em uma Plataforma AutoGPT auto-hospedada, o agente de chat AutoPilot é executado em qualquer endpoint compatível com OpenAI que você fornecer — quatro variáveis de ambiente, definidas no contêiner. Executamos a imagem oficial em contêiner único da v0.8.2 dessa forma contra um endpoint substituto que registrava as requisições em 1º de outubro de 2026: uma interação de chat e três ciclos de ida e volta de ferramentas foram concluídos, e o arquivo do workspace escrito pelo AutoPilot foi lido novamente pela API. O serviço agpt.co hospedado não aceita um endpoint personalizado, e o bloco AI Text Generator dentro dos grafos de agentes também não.

Para saber quanto o AutoGPT custa no total — planos hospedados, créditos e auto-hospedagem — consulte preços do AutoGPT. Se estiver deixando o AutoGPT, veja alternativas ao AutoGPT. Esta página trata especificamente da rota de endpoint personalizado.

O que pode usar seu endpoint e o que não pode

Parte do AutoGPTAceita um endpoint personalizado?Base
Chat do AutoPilot, auto-hospedadoSim — CHAT_BASE_URLExecutado na v0.8.2: chat e chamadas de ferramentas concluídos
Títulos de conversasSim, mesmo endpoint e modeloObservado na execução: uma chamada curta sem streaming por sessão
Simulador de execução de teste do Builder, extração durante a integração inicialSim, segundo o guia do AutoGPTDocumentado; não testado aqui
Memória do GraphitiMesma URL base, com modelos próprios (GRAPHITI_*_MODEL)Observado na execução: /v1/responses mais uma chamada de embedding por interação
Busca semântica do marketplaceMesma URL base, STORE_EMBEDDING_MODEL (deve retornar vetores de 1.536 dimensões)Observado na execução: 200 chamadas de embedding na inicialização
Bloco AI Text Generator em grafos de agentesNão — provedores fixos; somente um host nativo do Ollama pode ser definidoCódigo-fonte da v0.8.2
agpt.co hospedadoNãoGuia do AutoGPT: a implantação na nuvem ignora essas variáveis

Configurando

O AutoGPT chama isso de transporte local porque Ollama é o destino usual, mas CHAT_BASE_URL é apenas uma URL — o próprio guia lista uma API gerenciada compatível com OpenAI entre as configurações que funcionam. Quatro variáveis importam: CHAT_USE_LOCAL=true, CHAT_BASE_URL terminando em /v1, CHAT_API_KEY (obrigatória — o transporte deliberadamente não usa uma chave OpenAI como fallback) e CHAT_FAST_STANDARD_MODEL como um ID de modelo simples. Se você deixar os modelos avançado, de títulos e de simulação sem definir, o AutoGPT os deriva do modelo padrão, para que nenhum nome exclusivo da nuvem chegue ao seu endpoint.

Plataforma AutoGPT v0.8.2, contêiner único — as variáveis da execução com os valores do gateway; a linha de modelo avançado é opcional
docker run -d --name autogpt \
  --shm-size 2g --ulimit nofile=65536:65536 \
  -p 127.0.0.1:3000:3000 \
  -e AUTOGPT_PUBLIC_URL=http://localhost:3000 \
  -e CHAT_USE_LOCAL=true \
  -e CHAT_BASE_URL=https://api.kunavo.com/v1 \
  -e CHAT_API_KEY=sk-kn-... \
  -e CHAT_FAST_STANDARD_MODEL=claude-haiku-4-5 \
  -e CHAT_FAST_ADVANCED_MODEL=claude-sonnet-5 \
  -v autogpt-data:/data \
  significantgravitas/autogpt:v0.8.2

# Compose installs put the same four CHAT_* lines in autogpt_platform/backend/.env.
# Check them inside the running container:
docker exec autogpt env | grep ^CHAT_

De dentro do Docker, localhost é o contêiner, não sua máquina: um endpoint no host é http://host.docker.internal:<port>/v1 no Docker Desktop, que foi como a execução alcançou seu substituto. Um endpoint hospedado, como o do Kunavo, não exige nenhuma configuração especial de rede. A primeira inicialização executa migrações do banco de dados e leva vários minutos; aguarde até o contêiner informar que está saudável.

O que uma interação envia — medido

SolicitaçãoTamanhoObservações
POST /v1/chat/completions, primeira chamada de uma interação41,876 bytesStreaming; 16 ferramentas — entre elas bash_exec, web_fetch, run_agent, write_workspace_file; apenas os campos de corpo messages, model, stream, tools
Igual, após um resultado de ferramenta42,677 bytesQuatro mensagens: a chamada da ferramenta e seu resultado anexados
TítuloCerca de 0,6 KBSem streaming, uma vez por sessão, mesmo modelo
Memória do GraphitiPor interaçãoPOST /v1/responses com o nome de modelo Ornith padrão e uma chamada de embedding para nomic-embed-text
Consultas da janela de contextoPor sessãoGET /api/ps, /props, /api/v0/models, /v1/models

Os tamanhos foram idênticos em bytes nas três execuções. São bytes de solicitação de um substituto, não uma contagem de tokens do provedor. O formato da solicitação é o Chat Completions simples da OpenAI — sem extensões do fornecedor — portanto, um endpoint que ofereça chamadas de ferramentas em streaming é tudo de que o caminho de chat precisa.

Tráfego secundário a considerar

Tudo acima foi para a mesma URL base. Duas consequências se seu endpoint for um gateway de chat, e não uma pilha local completa. Embeddings: o índice do marketplace solicitou text-embedding-3-small 200 vezes na inicialização, e o Graphiti solicitou nomic-embed-text a cada interação; um endpoint sem modelos de embedding retorna 404, a busca no armazenamento usa fallback somente lexical e a extração de memória registra rastreamentos de erro — o chat em si não foi afetado. O Kunavo não oferece modelos de embedding, portanto esse é o estado esperado no Kunavo. Nomes dos modelos de memória: as chamadas de /v1/responses do Graphiti usam seu próprio nome de modelo padrão, a menos que GRAPHITI_LLM_MODEL e GRAPHITI_RERANKER_MODEL estejam definidos como modelos servidos pelo seu endpoint.

Quanto custa por interação

Como aritmética aproximada, não uma cobrança: uma interação com ferramenta enviou 84,553 bytes em duas chamadas — cerca de 21,138 tokens de entrada considerando quatro caracteres por token — mais algumas centenas de tokens de saída; assumimos 600.

Modelo pelo KunavoTarifa por 1M de entrada / saídaUma interação com ferramenta
Claude Haiku 4.5$0.70 / $3.50$0.017
Claude Sonnet 5$1.40 / $7.00$0.034

As conversas crescem, portanto as interações posteriores enviam mais dados. O Kunavo cobra por token a partir de um saldo pré-pago, com recarga mínima de $10 e sem assinatura (cobrança); o valor do catálogo é um piso de cobrança, não um limite máximo. Ninguém no Kunavo executou o AutoGPT contra o próprio endpoint — a execução aqui usou um substituto local — portanto, verifique a cobrança da primeira interação no seu registro de uso.

Perguntas frequentes

O AutoGPT pode usar um endpoint de API personalizado?

Sim, em uma parte do produto e somente quando você o hospeda. Em uma Plataforma AutoGPT auto-hospedada, o agente de chat AutoPilot aceita qualquer endpoint compatível com OpenAI por meio de CHAT_USE_LOCAL=true, CHAT_BASE_URL, CHAT_API_KEY e CHAT_FAST_STANDARD_MODEL. Executamos a imagem oficial em contêiner único da v0.8.2 dessa forma em 1º de outubro de 2026, contra um endpoint local substituto: uma interação de chat e três ciclos de ida e volta de ferramentas foram concluídos, e o arquivo escrito pelo AutoPilot foi lido novamente pela API do workspace. O serviço agpt.co hospedado ignora essas variáveis, e o bloco AI Text Generator dentro dos grafos de agentes não as lê.

O bloco AI Text Generator usa CHAT_BASE_URL?

Não. O próprio guia do AutoGPT afirma que o caminho de chat do AutoPilot e a camada de blocos leem variáveis diferentes. No código-fonte da v0.8.2, os clientes OpenAI e Anthropic da camada de blocos são criados sem URL base, e o único host que pode ser definido ali é um host Ollama para a API nativa do Ollama — portanto, os grafos de agentes que chamam o bloco AI Text Generator continuam usando os provedores fornecidos pelo AutoGPT, independentemente do valor de CHAT_BASE_URL.

Qual é a melhor ou mais barata API para o AutoGPT?

For the self-hosted chat path, the cheapest is a model you run yourself — AutoGPT's guide uses Ollama — and the cheapest metered option is whichever OpenAI-compatible endpoint serves a capable tool-calling model at the lowest rate. Each tool turn in our run sent about 85 KB across two chat calls with 16 tool definitions, roughly 21,000 input tokens at four characters per token; at Kunavo's Claude Haiku 4.5 rates that is about $0.017 a turn, and about $0.034 on Claude Sonnet 5. Cheapest listed rate and cheapest finished task are different questions: a model that fumbles tool calls costs more turns.

Por que meu endpoint do AutoGPT recebe solicitações de embedding e /v1/responses?

Porque outros recursos seguem a mesma URL base. Em nossa execução, o endpoint recebeu 200 solicitações de embedding para text-embedding-3-small na inicialização (o índice semântico do marketplace) e, após cada interação de chat, a memória do Graphiti enviou uma chamada /v1/responses usando seu nome de modelo padrão e uma chamada de embedding para nomic-embed-text. Um endpoint sem esses modelos responde 404; o chat continuou funcionando, e o contêiner registrou rastreamentos de erro do Graphiti. Defina GRAPHITI_LLM_MODEL, GRAPHITI_RERANKER_MODEL e GRAPHITI_EMBEDDER_MODEL como modelos servidos pelo seu endpoint, ou aceite memória degradada e busca lexical somente no armazenamento.

Como verifico se o AutoPilot está realmente usando meu endpoint?

Três verificações, todas do guia do AutoGPT e todas observadas em nossa execução: entre no contêiner com docker exec e filtre o ambiente por CHAT_; envie uma interação de chat e procure por "Using baseline service" nos logs; e confirme que seu endpoint registrou uma solicitação de streaming /v1/chat/completions com o modelo definido. Antes da primeira interação, o AutoPilot também consulta /api/ps, /props, /api/v0/models e /v1/models para descobrir a janela de contexto; endpoints que não informam nenhuma janela usam 32k como fallback, segundo o guia.

Execução em 1º de outubro de 2026: significantgravitas/autogpt:v0.8.2 (imagem arm64, sha256:8322941548c6…) no Docker Desktop, com o AutoPilot conduzido por sua própria API de chat usando uma conta local descartável, contra um endpoint substituto local que registrava as requisições e respondeu a uma chamada de ferramenta e depois com texto. Três ciclos de ida e volta de ferramentas, todos concluídos; o arquivo escrito foi lido novamente pela API do workspace. O comportamento além da execução vem do guia copilot-local-llm do AutoGPT e do código-fonte da v0.8.2. O substituto não é um provedor nem o Kunavo.