Volver a las guías
Configuración·1 de octubre de 2026·7 min de lectura

API personalizada de AutoGPT: ejecutar AutoPilot autoalojado en tu propio endpoint compatible con OpenAI

Cuatro variables de entorno trasladan el chat de AutoPilot a tu propio endpoint en una instalación autoalojada. La capa de bloqueo y el servicio alojado no siguen ese cambio, y las llamadas de embeddings y memoria llegan a la misma URL.

Última revisión: .

En una Plataforma AutoGPT autohospedada, el agente de chat AutoPilot se ejecuta en cualquier endpoint compatible con OpenAI que le proporciones: cuatro variables de entorno configuradas en el contenedor. Ejecutamos así la imagen oficial de contenedor único de la versión v0.8.2 contra un sustituto de grabación el 1 de octubre de 2026: se completaron un turno de chat y tres rondas de herramientas, y el archivo del espacio de trabajo escrito por AutoPilot se leyó de nuevo mediante la API. El servicio alojado agpt.co no acepta un endpoint personalizado, y tampoco lo hace el bloque AI Text Generator dentro de los grafos de agentes.

Para conocer el coste total de AutoGPT —planes alojados, créditos y autohospedaje— consulta precios de AutoGPT. Si estás dejando AutoGPT, consulta alternativas a AutoGPT. Esta página explica precisamente la ruta de endpoint personalizado.

Qué puede usar tu endpoint y qué no

Parte de AutoGPT¿Acepta un endpoint personalizado?Base
Chat de AutoPilot, autohospedadoSí — CHAT_BASE_URLEjecutado en v0.8.2: se completaron el chat y las llamadas de herramientas
Títulos de conversaciónSí, el mismo endpoint y modeloObservado en la ejecución: una llamada breve sin streaming por sesión
Simulador de prueba en seco del Builder, extracción durante la incorporaciónSí, según la guía de AutoGPTDocumentado; no se probó aquí
Memoria de GraphitiLa misma URL base, con sus propios modelos (GRAPHITI_*_MODEL)Observado en la ejecución: /v1/responses más una llamada de embeddings por turno
Búsqueda semántica del marketplaceLa misma URL base, STORE_EMBEDDING_MODEL (debe devolver vectores de 1,536 dimensiones)Observado en la ejecución: 200 llamadas de embeddings al arrancar
Bloque AI Text Generator en los grafos de agentesNo: proveedores fijos; solo se puede configurar un host nativo de OllamaCódigo fuente de v0.8.2
agpt.co alojadoNoGuía de AutoGPT: la implementación en la nube ignora estas variables

Configuración

AutoGPT llama a este transporte local porque Ollama es el destino habitual, pero CHAT_BASE_URL es solo una URL; su propia guía incluye una API gestionada compatible con OpenAI entre las formas compatibles. Importan cuatro variables: CHAT_USE_LOCAL=true, CHAT_BASE_URL que termina en /v1, CHAT_API_KEY (obligatoria: el transporte no recurre deliberadamente a una clave de OpenAI) y CHAT_FAST_STANDARD_MODEL como ID de modelo sin más. Si dejas sin configurar los modelos avanzados, de títulos y de simulación, AutoGPT los deriva del modelo estándar para que ningún nombre exclusivo de la nube llegue a tu endpoint.

Plataforma AutoGPT v0.8.2, contenedor único: las variables de la ejecución con los valores del gateway; la línea de modelos avanzados es opcional
docker run -d --name autogpt \
  --shm-size 2g --ulimit nofile=65536:65536 \
  -p 127.0.0.1:3000:3000 \
  -e AUTOGPT_PUBLIC_URL=http://localhost:3000 \
  -e CHAT_USE_LOCAL=true \
  -e CHAT_BASE_URL=https://api.kunavo.com/v1 \
  -e CHAT_API_KEY=sk-kn-... \
  -e CHAT_FAST_STANDARD_MODEL=claude-haiku-4-5 \
  -e CHAT_FAST_ADVANCED_MODEL=claude-sonnet-5 \
  -v autogpt-data:/data \
  significantgravitas/autogpt:v0.8.2

# Compose installs put the same four CHAT_* lines in autogpt_platform/backend/.env.
# Check them inside the running container:
docker exec autogpt env | grep ^CHAT_

Desde Docker, localhost es el contenedor, no tu máquina: un endpoint en el host es http://host.docker.internal:<port>/v1 en Docker Desktop, que es como la ejecución llegó a su sustituto. Un endpoint alojado como el de Kunavo no necesita ninguna configuración de red especial. El primer arranque ejecuta migraciones de base de datos y tarda varios minutos; espera a que el contenedor indique que está saludable.

Qué envía un turno: medición

SolicitudTamañoNotas
POST /v1/chat/completions, primera llamada de un turno41,876 bytesStreaming; 16 herramientas, entre ellas bash_exec, web_fetch, run_agent, write_workspace_file; solo los campos del cuerpo messages, model, stream, tools
Lo mismo, después de un resultado de herramienta42,677 bytesCuatro mensajes: la llamada de herramienta y su resultado añadidos
TítuloAproximadamente 0.6 KBSin streaming, una vez por sesión, mismo modelo
Memoria de GraphitiPor turnoPOST /v1/responses con el nombre de modelo Ornith predeterminado, y una llamada de embeddings para nomic-embed-text
Consultas de la ventana de contextoPor sesiónGET /api/ps, /props, /api/v0/models, /v1/models

Los tamaños fueron idénticos byte por byte en tres ejecuciones. Son bytes de solicitud de un sustituto, no el recuento de tokens de un proveedor. La estructura de la solicitud es OpenAI Chat Completions simple, sin extensiones de proveedor, por lo que un endpoint que sirva llamadas de herramientas en streaming es todo lo que necesita la ruta de chat.

Tráfico adicional que debes prever

Todo lo anterior fue a la misma URL base. Hay dos consecuencias si tu endpoint es un gateway de chat en lugar de una pila local completa. Embeddings: el índice del marketplace solicitó text-embedding-3-small 200 veces al arrancar, y Graphiti solicitó nomic-embed-text en cada turno; un endpoint sin modelos de embeddings devuelve 404, la búsqueda del almacén recurre a un modo exclusivamente léxico y la extracción de memoria registra trazas; el chat no se vio afectado. Kunavo no ofrece modelos de embeddings, por lo que ese es el estado esperado en Kunavo. Nombres de modelos de memoria: las llamadas de Graphiti a /v1/responses usan su propio nombre de modelo predeterminado, salvo que GRAPHITI_LLM_MODEL y GRAPHITI_RERANKER_MODEL estén configurados con modelos que sirva tu endpoint.

Cuánto cuesta por turno

Como cálculo aproximado, no como factura: un turno con herramientas envió 84,553 bytes en dos llamadas, aproximadamente 21,138 tokens de entrada a cuatro caracteres por token, más unos cientos de tokens de salida; suponemos 600.

Modelo mediante KunavoTarifa por 1M de entrada / salidaUn turno con herramientas
Claude Haiku 4.5$0.70 / $3.50$0.017
Claude Sonnet 5$1.40 / $7.00$0.034

Las conversaciones crecen, así que los turnos posteriores envían más contenido. Kunavo factura por token a partir de un saldo prepago, con una recarga mínima de $10 y sin suscripción (facturación); el importe del catálogo es un mínimo de facturación, no un límite máximo. Nadie en Kunavo ha ejecutado AutoGPT contra su propio endpoint; la ejecución de aquí utilizó un sustituto local, así que comprueba el cargo del primer turno en tu registro de uso.

Preguntas frecuentes

¿Puede AutoGPT usar un endpoint de API personalizado?

Sí, para una parte del producto y solo cuando lo alojas tú. En una Plataforma AutoGPT autohospedada, el agente de chat AutoPilot acepta cualquier endpoint compatible con OpenAI mediante CHAT_USE_LOCAL=true, CHAT_BASE_URL, CHAT_API_KEY y CHAT_FAST_STANDARD_MODEL. Ejecutamos así la imagen oficial de contenedor único de la versión v0.8.2 el 1 de octubre de 2026, contra un endpoint local de sustitución: se completaron un turno de chat y tres rondas de herramientas, y el archivo que escribió AutoPilot se leyó de nuevo mediante la API del espacio de trabajo. El servicio alojado agpt.co ignora estas variables, y el bloque AI Text Generator dentro de los grafos de agentes tampoco las lee.

¿El bloque AI Text Generator usa CHAT_BASE_URL?

No. La propia guía de AutoGPT indica que la ruta de chat de AutoPilot y la capa de bloques leen variables diferentes. En el código fuente de v0.8.2, los clientes de OpenAI y Anthropic de la capa de bloques se crean sin URL base, y el único host que puedes establecer allí es un host de Ollama para la API nativa de Ollama; por tanto, los grafos de agentes que llaman al bloque AI Text Generator siguen usando los proveedores incluidos por AutoGPT, independientemente de lo que indique CHAT_BASE_URL.

¿Cuál es la API mejor o más barata para AutoGPT?

For the self-hosted chat path, the cheapest is a model you run yourself — AutoGPT's guide uses Ollama — and the cheapest metered option is whichever OpenAI-compatible endpoint serves a capable tool-calling model at the lowest rate. Each tool turn in our run sent about 85 KB across two chat calls with 16 tool definitions, roughly 21,000 input tokens at four characters per token; at Kunavo's Claude Haiku 4.5 rates that is about $0.017 a turn, and about $0.034 on Claude Sonnet 5. Cheapest listed rate and cheapest finished task are different questions: a model that fumbles tool calls costs more turns.

¿Por qué mi endpoint de AutoGPT recibe solicitudes de embeddings y /v1/responses?

Porque otras funciones siguen la misma URL base. En nuestra ejecución, el endpoint recibió 200 solicitudes de embeddings para text-embedding-3-small al arrancar (el índice semántico del marketplace), y después de cada turno de chat la memoria de Graphiti envió una llamada /v1/responses usando su nombre de modelo predeterminado y una llamada de embeddings para nomic-embed-text. Un endpoint sin esos modelos responde 404; el chat siguió funcionando y el contenedor registró trazas de Graphiti. Establece GRAPHITI_LLM_MODEL, GRAPHITI_RERANKER_MODEL y GRAPHITI_EMBEDDER_MODEL en modelos que sirva tu endpoint, o acepta una memoria degradada y una búsqueda léxica únicamente en el almacén.

¿Cómo compruebo que AutoPilot realmente usa mi endpoint?

Hay tres comprobaciones, todas procedentes de la guía de AutoGPT y observadas en nuestra ejecución: entra al contenedor mediante docker exec y busca CHAT_ en el entorno; envía un turno de chat y busca "Using baseline service" en los registros; y confirma que tu endpoint registró una solicitud de streaming /v1/chat/completions con el modelo que configuraste. Antes del primer turno, AutoPilot también consulta /api/ps, /props, /api/v0/models y /v1/models para conocer la ventana de contexto; según la guía, los endpoints que no informan de ninguna vuelven a 32k.

Ejecución del 1 de octubre de 2026: significantgravitas/autogpt:v0.8.2 (imagen arm64, sha256:8322941548c6…) en Docker Desktop, con AutoPilot controlado mediante su propia API de chat y una cuenta local desechable, contra un sustituto local de grabación que respondió a una llamada de herramienta y después con texto. Se completaron tres rondas de herramientas; el archivo escrito se leyó de nuevo mediante la API del espacio de trabajo. El comportamiento más allá de la ejecución procede de la guía copilot-local-llm de AutoGPT y del código fuente de v0.8.2. El sustituto no es un proveedor ni Kunavo.