Auf einer selbst gehosteten AutoGPT Platform läuft der AutoPilot-Chat-Agent auf jedem OpenAI-kompatiblen Endpunkt, den Sie ihm geben — vier Umgebungsvariablen, die im Container gesetzt werden. Wir haben das offizielle Single-Container-Image von v0.8.2 am 1. Oktober 2026 auf diese Weise gegen einen aufzeichnenden Stellvertreter ausgeführt: Eine Chat-Runde und drei Tool-Roundtrips wurden abgeschlossen, und die von AutoPilot geschriebene Workspace-Datei wurde über die API zurückgelesen. Der gehostete Dienst agpt.co akzeptiert keinen benutzerdefinierten Endpunkt, ebenso wenig der Block AI Text Generator innerhalb von Agent-Graphen.
Die Gesamtkosten von AutoGPT — gehostete Tarife, Credits und Self-Hosting — finden Sie unter AutoGPT-Preise. Wenn Sie AutoGPT verlassen, siehe AutoGPT-Alternativen. Diese Seite behandelt selbst die Route über einen benutzerdefinierten Endpunkt.
Was kann Ihren Endpunkt verwenden und was nicht
| Teil von AutoGPT | Akzeptiert einen benutzerdefinierten Endpunkt? | Grundlage |
|---|---|---|
| AutoPilot-Chat, selbst gehostet | Ja — CHAT_BASE_URL | Auf v0.8.2 ausgeführt: Chat- und Tool-Aufrufe abgeschlossen |
| Gesprächstitel | Ja, derselbe Endpunkt und dasselbe Modell | Im Lauf beobachtet: ein kurzer Aufruf ohne Streaming pro Sitzung |
| Builder-Trockenlaufsimulator, Onboarding-Extraktion | Ja, laut AutoGPT-Leitfaden | Dokumentiert, hier nicht ausgeführt |
| Graphiti-Speicher | Dieselbe Basis-URL, eigene Modelle (GRAPHITI_*_MODEL) | Im Lauf beobachtet: /v1/responses plus eine Embedding-Anfrage pro Runde |
| Semantische Marktplatzsuche | Dieselbe Basis-URL, STORE_EMBEDDING_MODEL (muss Vektoren mit 1.536 Dimensionen zurückgeben) | Im Lauf beobachtet: 200 Embedding-Aufrufe beim Start |
| Block AI Text Generator in Agent-Graphen | Nein — feste Anbieter; nur ein nativer Ollama-Host kann gesetzt werden | Quellcode von v0.8.2 |
| Gehostetes agpt.co | Nein | AutoGPT-Leitfaden: Die Cloud-Bereitstellung ignoriert diese Variablen |
Einrichtung
AutoGPT bezeichnet dies als local-Transport, weil Ollama das übliche Ziel ist; CHAT_BASE_URL ist jedoch lediglich eine URL — der eigene Leitfaden führt eine verwaltete OpenAI-kompatible API als eine der funktionierenden Varianten auf. Vier Variablen sind relevant: CHAT_USE_LOCAL=true, CHAT_BASE_URL, endend mit /v1, CHAT_API_KEY (erforderlich — der Transport fällt absichtlich nicht auf einen OpenAI-Schlüssel zurück) und CHAT_FAST_STANDARD_MODEL als einfache Modell-ID. Wenn Sie die erweiterten, Titel- und Simulationsmodelle nicht setzen, leitet AutoGPT sie aus dem Standardmodell ab, sodass kein ausschließlich für die Cloud bestimmter Name Ihren Endpunkt erreicht.
docker run -d --name autogpt \
--shm-size 2g --ulimit nofile=65536:65536 \
-p 127.0.0.1:3000:3000 \
-e AUTOGPT_PUBLIC_URL=http://localhost:3000 \
-e CHAT_USE_LOCAL=true \
-e CHAT_BASE_URL=https://api.kunavo.com/v1 \
-e CHAT_API_KEY=sk-kn-... \
-e CHAT_FAST_STANDARD_MODEL=claude-haiku-4-5 \
-e CHAT_FAST_ADVANCED_MODEL=claude-sonnet-5 \
-v autogpt-data:/data \
significantgravitas/autogpt:v0.8.2
# Compose installs put the same four CHAT_* lines in autogpt_platform/backend/.env.
# Check them inside the running container:
docker exec autogpt env | grep ^CHAT_Innerhalb von Docker ist localhost der Container, nicht Ihr Computer: Ein Endpunkt auf dem Host ist unter Docker Desktop http://host.docker.internal:<port>/v1, wodurch der Lauf seinen Stellvertreter erreichte. Ein gehosteter Endpunkt wie der von Kunavo benötigt keine spezielle Netzwerk configuração. Beim ersten Start werden Datenbankmigrationen ausgeführt, was mehrere Minuten dauert; warten Sie, bis der Container einen gesunden Status meldet.
Was eine Runde sendet — gemessen
| Anfrage | Größe | Hinweise |
|---|---|---|
POST /v1/chat/completions, erster Aufruf einer Runde | 41,876 Byte | Streaming; 16 Tools — darunter bash_exec, web_fetch, run_agent, write_workspace_file; nur die Body-Felder messages, model, stream, tools |
| Dasselbe nach einem Tool-Ergebnis | 42,677 Byte | Vier Nachrichten: der Tool-Aufruf und sein Ergebnis wurden angehängt |
| Titel | Etwa 0,6 KB | Ohne Streaming, einmal pro Sitzung, dasselbe Modell |
| Graphiti-Speicher | Pro Runde | POST /v1/responses mit dem standardmäßigen Ornith-Modellnamen und eine Embedding-Anfrage für nomic-embed-text |
| Prüfungen des Kontextfensters | Pro Sitzung | GET /api/ps, /props, /api/v0/models, /v1/models |
Die Größen waren über drei Läufe byteidentisch. Es handelt sich um Anfragebytes eines Stellvertreters, nicht um die Tokenanzahl eines Anbieters. Die Anfrageform entspricht einfachen OpenAI Chat Completions — ohne Anbietererweiterungen —, daher benötigt der Chatpfad lediglich einen Endpunkt, der Streaming-Tool-Aufrufe bereitstellt.
Zusätzlicher Datenverkehr, den Sie einplanen sollten
Alles oben Genannte ging an dieselbe Basis-URL. Zwei Folgen ergeben sich, wenn Ihr Endpunkt ein Chat-Gateway und kein vollständiger lokaler Stack ist. Embeddings: Der Marktplatzindex forderte text-embedding-3-small beim Start 200-mal an, und Graphiti forderte nomic-embed-text pro Runde an; ein Endpunkt ohne Embedding-Modelle gibt 404 zurück, die Speichersuche fällt auf eine rein lexikalische Suche zurück und die Speicherextraktion protokolliert Tracebacks — der Chat selbst blieb unbeeinträchtigt. Kunavo stellt keine Embedding-Modelle bereit, daher ist dies auf Kunavo der erwartete Zustand. Speichermodellnamen: Die /v1/responses-Aufrufe von Graphiti verwenden ihren eigenen Standardmodellnamen, sofern GRAPHITI_LLM_MODEL und GRAPHITI_RERANKER_MODEL nicht auf Modelle gesetzt sind, die Ihr Endpunkt bereitstellt.
Kosten pro Runde
Als grobe Rechnung, nicht als Abrechnung: Eine Tool-Runde sendete 84,553 Byte über zwei Aufrufe — etwa 21,138 Eingabetoken bei vier Zeichen pro Token — plus einige hundert Ausgabetoken; wir nehmen 600 an.
| Modell über Kunavo | Tarif pro 1 Mio. Ein-/Ausgabe | Eine Tool-Runde |
|---|---|---|
| Claude Haiku 4.5 | $0.70 / $3.50 | $0.017 |
| Claude Sonnet 5 | $1.40 / $7.00 | $0.034 |
Gespräche werden länger, daher senden spätere Runden mehr. Kunavo rechnet pro Token aus einem vorausbezahlten Guthaben mit einer Mindestaufladung von $10 und ohne Abonnement ab (Abrechnung); der Katalogbetrag ist eine Abrechnungsuntergrenze und keine Obergrenze. Niemand bei Kunavo hat AutoGPT gegen den eigenen Endpunkt ausgeführt — der Lauf hier verwendete einen lokalen Stellvertreter —, prüfen Sie daher die Belastung der ersten Runde in Ihrem Nutzungsprotokoll.
Häufig gestellte Fragen
Kann AutoGPT einen benutzerdefinierten API-Endpunkt verwenden?
Ja, für einen Teil des Produkts und nur, wenn Sie es selbst hosten. Auf einer selbst gehosteten AutoGPT Platform akzeptiert der AutoPilot-Chat-Agent über CHAT_USE_LOCAL=true, CHAT_BASE_URL, CHAT_API_KEY und CHAT_FAST_STANDARD_MODEL jeden OpenAI-kompatiblen Endpunkt. Wir haben das offizielle Single-Container-Image von v0.8.2 am 1. Oktober 2026 auf diese Weise gegen einen lokalen Stellvertreter-Endpunkt ausgeführt: Eine Chat-Runde und drei Tool-Roundtrips wurden abgeschlossen, und die von AutoPilot geschriebene Datei wurde über die Workspace-API zurückgelesen. Der gehostete Dienst agpt.co ignoriert diese Variablen, und der Block AI Text Generator innerhalb von Agent-Graphen liest sie nicht.
Verwendet der Block AI Text Generator CHAT_BASE_URL?
Nein. Der eigene Leitfaden von AutoGPT besagt, dass der AutoPilot-Chatpfad und die Blockebene unterschiedliche Variablen lesen. Im Quellcode von v0.8.2 werden die OpenAI- und Anthropic-Clients der Blockebene ohne Basis-URL erstellt; der einzige Host, den Sie dort festlegen können, ist ein Ollama-Host für Ollamas native API. Daher verwenden Agent-Graphen, die den Block AI Text Generator aufrufen, weiterhin die von AutoGPT bereitgestellten Anbieter, unabhängig davon, was CHAT_BASE_URL angibt.
Was ist die beste oder günstigste API für AutoGPT?
For the self-hosted chat path, the cheapest is a model you run yourself — AutoGPT's guide uses Ollama — and the cheapest metered option is whichever OpenAI-compatible endpoint serves a capable tool-calling model at the lowest rate. Each tool turn in our run sent about 85 KB across two chat calls with 16 tool definitions, roughly 21,000 input tokens at four characters per token; at Kunavo's Claude Haiku 4.5 rates that is about $0.017 a turn, and about $0.034 on Claude Sonnet 5. Cheapest listed rate and cheapest finished task are different questions: a model that fumbles tool calls costs more turns.
Warum erhält mein AutoGPT-Endpunkt Embedding- und /v1/responses-Anfragen?
Weil andere Funktionen dieselbe Basis-URL verwenden. In unserem Lauf erhielt der Endpunkt beim Start 200 Embedding-Anfragen für text-embedding-3-small (den semantischen Index des Marktplatzes), und nach jeder Chat-Runde sendete der Graphiti-Speicher einen /v1/responses-Aufruf mit seinem Standardmodellnamen sowie eine Embedding-Anfrage für nomic-embed-text. Ein Endpunkt ohne diese Modelle antwortet mit 404; der Chat funktionierte weiter, und der Container protokollierte Graphiti-Tracebacks. Setzen Sie GRAPHITI_LLM_MODEL, GRAPHITI_RERANKER_MODEL und GRAPHITI_EMBEDDER_MODEL auf Modelle, die Ihr Endpunkt bereitstellt, oder akzeptieren Sie einen eingeschränkten Speicher und eine rein lexikalische Speichersuche.
Wie prüfe ich, ob AutoPilot wirklich meinen Endpunkt verwendet?
Drei Prüfungen, alle aus dem AutoGPT-Leitfaden und alle in unserem Lauf beobachtet: Führen Sie docker exec im Container aus und durchsuchen Sie die Umgebung nach CHAT_; senden Sie eine Chat-Runde und achten Sie in den Logs auf „Using baseline service“; und bestätigen Sie, dass Ihr Endpunkt eine Streaming-Anfrage an /v1/chat/completions mit dem von Ihnen gesetzten Modell protokolliert hat. Vor der ersten Runde prüft AutoPilot außerdem /api/ps, /props, /api/v0/models und /v1/models, um das Kontextfenster zu ermitteln; Endpunkte, die keines melden, fallen laut Leitfaden auf 32k zurück.
Ausgeführt am 1. Oktober 2026: significantgravitas/autogpt:v0.8.2 (arm64-Image, sha256:8322941548c6…) auf Docker Desktop, AutoPilot über seine eigene Chat-API mit einem kurzlebigen lokalen Konto gesteuert, gegen einen lokalen aufzeichnenden Stellvertreter, der auf einen Tool-Aufruf und anschließend mit Text antwortete. Drei Tool-Roundtrips wurden vollständig abgeschlossen; die geschriebene Datei wurde über die Workspace-API zurückgelesen. Verhalten über den Lauf hinaus stammt aus dem AutoGPT-Leitfaden copilot-local-llm und dem Quellcode von v0.8.2. Der Stellvertreter ist weder ein Anbieter noch Kunavo.