Retour aux guides
Configuration·1 octobre 2026·7 min de lecture

API personnalisée AutoGPT : exécuter AutoPilot auto-hébergé sur votre propre endpoint compatible OpenAI

Quatre variables d’environnement déplacent le chat AutoPilot vers votre propre endpoint dans une installation auto-hébergée. La couche de blocage et le service hébergé ne suivent pas — et les appels d’embeddings et de mémoire arrivent sur la même URL.

Dernière vérification le .

Sur une instance AutoGPT Platform auto-hébergée, l’agent de chat AutoPilot fonctionne avec n’importe quel point de terminaison compatible avec OpenAI que vous lui fournissez — quatre variables d’environnement, définies sur le conteneur. Nous avons exécuté l’image officielle en conteneur unique de la v0.8.2 de cette manière contre un point de terminaison de substitution enregistrant les requêtes le 1er octobre 2026 : un tour de chat et trois allers-retours d’outils ont abouti, et le fichier de l’espace de travail écrit par AutoPilot a été relu via l’API. Le service hébergé agpt.co n’accepte pas de point de terminaison personnalisé, pas plus que le bloc AI Text Generator dans les graphes d’agents.

Pour connaître le coût global d’AutoGPT — forfaits hébergés, crédits, auto-hébergement — consultez les tarifs d’AutoGPT. Si vous quittez AutoGPT, consultez les alternatives à AutoGPT. Cette page porte précisément sur la méthode du point de terminaison personnalisé.

Ce qui peut utiliser votre point de terminaison, et ce qui ne le peut pas

Composant d’AutoGPTAccepte un point de terminaison personnalisé ?Fondement
Chat AutoPilot, auto-hébergéOui — CHAT_BASE_URLExécuté sur la v0.8.2 : le chat et les appels d’outils ont abouti
Titres des conversationsOui, même point de terminaison et même modèleObservé lors de l’exécution : un court appel non diffusé par session
Simulateur d’exécution à blanc du Builder, extraction d’intégrationOui, selon le guide d’AutoGPTDocumenté ; non testé ici
Mémoire GraphitiMême URL de base, ses propres modèles (GRAPHITI_*_MODEL)Observé lors de l’exécution : /v1/responses plus un appel d’embedding par tour
Recherche sémantique de la marketplaceMême URL de base, STORE_EMBEDDING_MODEL (doit renvoyer des vecteurs de 1 536 dimensions)Observé lors de l’exécution : 200 appels d’embedding au démarrage
Bloc AI Text Generator dans les graphes d’agentsNon — fournisseurs fixes ; seul un hôte natif Ollama peut être définiCode source v0.8.2
agpt.co hébergéNonGuide d’AutoGPT : le déploiement cloud ignore ces variables

Configuration

AutoGPT appelle cela le transport local parce qu’Ollama est la cible habituelle, mais CHAT_BASE_URL n’est qu’une URL — son propre guide répertorie une API gérée compatible avec OpenAI parmi les configurations qui fonctionnent. Quatre variables comptent : CHAT_USE_LOCAL=true, CHAT_BASE_URL se terminant par /v1, CHAT_API_KEY (obligatoire — le transport ne se rabat volontairement pas sur une clé OpenAI), et CHAT_FAST_STANDARD_MODEL en tant qu’identifiant de modèle brut. Si vous ne définissez pas les modèles avancé, de titre et de simulation, AutoGPT les déduit du modèle standard afin qu’aucun nom réservé au cloud n’atteigne votre point de terminaison.

AutoGPT Platform v0.8.2, conteneur unique — les variables de l’exécution avec les valeurs d’une passerelle ; la ligne du modèle avancé est facultative
docker run -d --name autogpt \
  --shm-size 2g --ulimit nofile=65536:65536 \
  -p 127.0.0.1:3000:3000 \
  -e AUTOGPT_PUBLIC_URL=http://localhost:3000 \
  -e CHAT_USE_LOCAL=true \
  -e CHAT_BASE_URL=https://api.kunavo.com/v1 \
  -e CHAT_API_KEY=sk-kn-... \
  -e CHAT_FAST_STANDARD_MODEL=claude-haiku-4-5 \
  -e CHAT_FAST_ADVANCED_MODEL=claude-sonnet-5 \
  -v autogpt-data:/data \
  significantgravitas/autogpt:v0.8.2

# Compose installs put the same four CHAT_* lines in autogpt_platform/backend/.env.
# Check them inside the running container:
docker exec autogpt env | grep ^CHAT_

Depuis Docker, localhost désigne le conteneur, pas votre machine : un point de terminaison sur l’hôte est http://host.docker.internal:<port>/v1 dans Docker Desktop, ce qui a permis à l’exécution d’atteindre son substitut. Un point de terminaison hébergé tel que celui de Kunavo ne nécessite aucune configuration réseau particulière. Le premier démarrage exécute les migrations de base de données et prend plusieurs minutes ; attendez que le conteneur signale qu’il est sain.

Ce qu’un tour envoie — mesures

RequêteTailleRemarques
POST /v1/chat/completions, premier appel d’un tour41,876 octetsStreaming ; 16 outils — notamment bash_exec, web_fetch, run_agent, write_workspace_file ; champs du corps uniquement : messages, model, stream, tools
Identique, après un résultat d’outil42,677 octetsQuatre messages : l’appel d’outil et son résultat ajoutés
TitreEnviron 0,6 KoNon diffusé, une fois par session, même modèle
Mémoire GraphitiPar tourPOST /v1/responses avec le nom de modèle Ornith par défaut, et un appel d’embedding pour nomic-embed-text
Sondes de fenêtre de contextePar sessionGET /api/ps, /props, /api/v0/models, /v1/models

Les tailles étaient identiques en octets lors des trois exécutions. Il s’agit d’octets de requête provenant d’un substitut, et non du nombre de tokens d’un fournisseur. La forme de la requête est celle de Chat Completions OpenAI, sans extensions de fournisseur ; un point de terminaison qui sert les appels d’outils en streaming suffit donc au chemin de chat.

Trafic secondaire à prévoir

Tout ce qui précède est allé vers la même URL de base. Deux conséquences si votre point de terminaison est une passerelle de chat plutôt qu’une pile locale complète. Embeddings : l’index de la marketplace a demandé text-embedding-3-small 200 fois au démarrage, et Graphiti a demandé nomic-embed-text à chaque tour ; un point de terminaison sans modèles d’embedding renvoie 404, la recherche du magasin se rabat sur le lexical uniquement et l’extraction de mémoire enregistre des tracebacks — le chat lui-même n’a pas été affecté. Kunavo ne sert aucun modèle d’embedding ; sur Kunavo, c’est donc l’état attendu. Noms des modèles de mémoire : les appels /v1/responses de Graphiti utilisent leur propre nom de modèle par défaut, sauf si GRAPHITI_LLM_MODEL et GRAPHITI_RERANKER_MODEL sont définis sur des modèles servis par votre point de terminaison.

Coût par tour

Comme calcul approximatif, et non comme facture : un tour avec outil a envoyé 84,553 octets en deux appels — environ 21,138 tokens d’entrée à raison de quatre caractères par token — plus quelques centaines de tokens de sortie ; nous supposons 600.

Modèle via KunavoTarif par million d’entrées / sortiesUn tour avec outil
Claude Haiku 4.5$0.70 / $3.50$0.017
Claude Sonnet 5$1.40 / $7.00$0.034

Les conversations s’allongent, donc les tours suivants envoient davantage de données. Kunavo facture par token à partir d’un solde prépayé, avec un rechargement minimum de $10 et sans abonnement (facturation) ; le montant du catalogue constitue un seuil de facturation, pas un plafond. Personne chez Kunavo n’a exécuté AutoGPT contre son propre point de terminaison — l’exécution présentée ici utilisait un substitut local — vérifiez donc le montant du premier tour dans votre journal d’utilisation.

Questions fréquentes

AutoGPT peut-il utiliser un point de terminaison d’API personnalisé ?

Oui, pour une partie du produit et uniquement lorsque vous l’hébergez. Sur une instance AutoGPT Platform auto-hébergée, l’agent de chat AutoPilot accepte n’importe quel point de terminaison compatible avec OpenAI via CHAT_USE_LOCAL=true, CHAT_BASE_URL, CHAT_API_KEY et CHAT_FAST_STANDARD_MODEL. Nous avons exécuté l’image officielle en conteneur unique de la v0.8.2 de cette manière le 1er octobre 2026, contre un point de terminaison local de substitution : un tour de chat et trois allers-retours d’outils ont abouti, et le fichier écrit par AutoPilot a été relu via l’API de l’espace de travail. Le service hébergé agpt.co ignore ces variables, et le bloc AI Text Generator dans les graphes d’agents ne les lit pas.

Le bloc AI Text Generator utilise-t-il CHAT_BASE_URL ?

Non. Le guide d’AutoGPT indique que le chemin de chat AutoPilot et la couche des blocs lisent des variables différentes. Dans le code source de la v0.8.2, les clients OpenAI et Anthropic de la couche des blocs sont construits sans URL de base, et le seul hôte que vous pouvez y définir est un hôte Ollama pour l’API native d’Ollama — les graphes d’agents qui appellent le bloc AI Text Generator continuent donc d’utiliser les fournisseurs proposés par AutoGPT, quelle que soit la valeur de CHAT_BASE_URL.

Quelle est la meilleure API ou l’API la moins chère pour AutoGPT ?

For the self-hosted chat path, the cheapest is a model you run yourself — AutoGPT's guide uses Ollama — and the cheapest metered option is whichever OpenAI-compatible endpoint serves a capable tool-calling model at the lowest rate. Each tool turn in our run sent about 85 KB across two chat calls with 16 tool definitions, roughly 21,000 input tokens at four characters per token; at Kunavo's Claude Haiku 4.5 rates that is about $0.017 a turn, and about $0.034 on Claude Sonnet 5. Cheapest listed rate and cheapest finished task are different questions: a model that fumbles tool calls costs more turns.

Pourquoi mon point de terminaison AutoGPT reçoit-il des requêtes d’embedding et /v1/responses ?

Parce que d’autres fonctionnalités suivent la même URL de base. Lors de notre exécution, le point de terminaison a reçu au démarrage 200 requêtes d’embedding pour text-embedding-3-small (l’index sémantique de la marketplace), puis, après chaque tour de chat, la mémoire Graphiti a envoyé un appel /v1/responses utilisant son nom de modèle par défaut et un appel d’embedding pour nomic-embed-text. Un point de terminaison dépourvu de ces modèles répond 404 ; le chat a continué de fonctionner et le conteneur a enregistré des tracebacks Graphiti. Définissez GRAPHITI_LLM_MODEL, GRAPHITI_RERANKER_MODEL et GRAPHITI_EMBEDDER_MODEL sur des modèles servis par votre point de terminaison, ou acceptez une mémoire dégradée et une recherche du magasin limitée au lexical.

Comment vérifier qu’AutoPilot utilise réellement mon point de terminaison ?

Trois vérifications, toutes issues du guide d’AutoGPT et toutes observées lors de notre exécution : exécutez docker exec dans le conteneur et recherchez CHAT_ dans l’environnement ; envoyez un tour de chat et recherchez « Using baseline service » dans les journaux ; et confirmez que votre point de terminaison a enregistré une requête /v1/chat/completions en streaming avec le modèle défini. Avant le premier tour, AutoPilot interroge également /api/ps, /props, /api/v0/models et /v1/models pour connaître la fenêtre de contexte ; selon le guide, les points de terminaison qui n’en signalent aucune utilisent 32k par défaut.

Exécution du 1er octobre 2026 : significantgravitas/autogpt:v0.8.2 (image arm64, sha256:8322941548c6…) sur Docker Desktop, AutoPilot piloté via sa propre API de chat avec un compte local temporaire, contre un point de terminaison local de substitution enregistrant les requêtes, qui a répondu à un appel d’outil puis par du texte. Trois allers-retours d’outils, tous aboutis ; le fichier écrit a été relu via l’API de l’espace de travail. Le comportement au-delà de cette exécution provient du guide copilot-local-llm d’AutoGPT et du code source de la v0.8.2. Le substitut n’est ni un fournisseur ni Kunavo.