가이드 목록으로
설정·2026년 10월 1일·7분 분량

AutoGPT 사용자 지정 API: 자체 OpenAI 호환 엔드포인트에서 자체 호스팅 AutoPilot 실행하기

환경 변수 네 개를 설정하면 자체 호스팅 설치에서 AutoPilot 채팅을 자신의 엔드포인트로 옮길 수 있습니다. 블록 계층과 호스팅 서비스는 이를 따르지 않으며, 임베딩 및 메모리 호출도 동일한 URL로 전송됩니다.

마지막 검토일: .

자체 호스팅 AutoGPT Platform에서는 컨테이너에 설정한 네 가지 환경 변수를 통해 AutoPilot 채팅 에이전트가 사용자가 제공한 모든 OpenAI 호환 엔드포인트에서 실행됩니다. 2026년 10월 1일에 공식 v0.8.2 단일 컨테이너 이미지를 기록용 대체 엔드포인트에 연결해 실행했습니다. 채팅 한 턴과 세 번의 도구 왕복이 완료되었고, AutoPilot이 작성한 워크스페이스 파일을 API를 통해 다시 읽었습니다. 호스팅된 agpt.co 서비스는 사용자 지정 엔드포인트를 지원하지 않으며, 에이전트 그래프 내부의 AI Text Generator 블록도 지원하지 않습니다.

AutoGPT의 전체 비용(호스팅 요금제, 크레딧, 자체 호스팅)은 AutoGPT 가격을 참조하세요. AutoGPT를 떠나는 경우에는 AutoGPT 대안을 참조하세요. 이 페이지는 사용자 지정 엔드포인트 경로 자체를 설명합니다.

사용자 엔드포인트를 사용할 수 있는 부분과 사용할 수 없는 부분

AutoGPT의 구성 요소사용자 지정 엔드포인트를 사용하나요?근거
AutoPilot 채팅, 자체 호스팅예 — CHAT_BASE_URLv0.8.2에서 실행: 채팅 및 도구 호출 완료
대화 제목예, 동일한 엔드포인트와 모델실행에서 확인: 세션당 짧은 비스트리밍 호출 1회
빌더 드라이런 시뮬레이터, 온보딩 추출예, AutoGPT 가이드에 따름문서화되어 있으나 여기서는 실행하지 않음
Graphiti 메모리동일한 기본 URL, 자체 모델(GRAPHITI_*_MODEL)실행에서 확인: /v1/responses 및 턴당 임베딩 호출
마켓플레이스 의미 검색동일한 기본 URL, STORE_EMBEDDING_MODEL(1,536차원 벡터를 반환해야 함)실행에서 확인: 부팅 시 임베딩 호출 200건
에이전트 그래프의 AI Text Generator 블록아니요 — 공급업체가 고정되어 있으며 Ollama 네이티브 호스트만 설정할 수 있음v0.8.2 소스
호스팅된 agpt.co아니요AutoGPT 가이드: 클라우드 배포에서는 이러한 변수를 무시함

설정하기

AutoGPT는 이를 local 전송 방식이라고 부릅니다. Ollama가 일반적인 대상이기 때문입니다. 하지만 CHAT_BASE_URL는 단순한 URL이며, 자체 가이드에는 작동하는 형태 중 하나로 관리형 OpenAI 호환 API가 명시되어 있습니다. 중요한 변수는 네 가지입니다: CHAT_USE_LOCAL=true, CHAT_BASE_URL는 /v1로 끝나야 하며, CHAT_API_KEY(필수 — 전송 방식은 의도적으로 OpenAI 키로 대체하지 않음), 그리고 순수 모델 ID인 CHAT_FAST_STANDARD_MODEL입니다. 고급 모델, 제목 모델, 시뮬레이션 모델을 설정하지 않으면 AutoGPT가 이를 표준 모델에서 파생하므로 클라우드 전용 이름이 엔드포인트로 전달되지 않습니다.

AutoGPT Platform v0.8.2, 단일 컨테이너 — 게이트웨이의 값과 함께 실행에 사용된 변수이며, 고급 모델 행은 선택 사항입니다
docker run -d --name autogpt \
  --shm-size 2g --ulimit nofile=65536:65536 \
  -p 127.0.0.1:3000:3000 \
  -e AUTOGPT_PUBLIC_URL=http://localhost:3000 \
  -e CHAT_USE_LOCAL=true \
  -e CHAT_BASE_URL=https://api.kunavo.com/v1 \
  -e CHAT_API_KEY=sk-kn-... \
  -e CHAT_FAST_STANDARD_MODEL=claude-haiku-4-5 \
  -e CHAT_FAST_ADVANCED_MODEL=claude-sonnet-5 \
  -v autogpt-data:/data \
  significantgravitas/autogpt:v0.8.2

# Compose installs put the same four CHAT_* lines in autogpt_platform/backend/.env.
# Check them inside the running container:
docker exec autogpt env | grep ^CHAT_

Docker 내부에서 localhost는 사용자의 컴퓨터가 아니라 컨테이너입니다. 호스트의 엔드포인트는 Docker Desktop에서 http://host.docker.internal:<port>/v1이며, 실행에서 대체 엔드포인트에 연결할 때 이 주소를 사용했습니다. Kunavo와 같은 호스팅 엔드포인트에는 특별한 네트워킹 설정이 필요하지 않습니다. 첫 부팅 시 데이터베이스 마이그레이션이 실행되며 몇 분이 걸립니다. 컨테이너가 정상 상태를 보고할 때까지 기다리세요.

한 턴에서 전송되는 내용 — 측정값

요청크기참고
POST /v1/chat/completions, 턴의 첫 호출41,876바이트스트리밍; 16개 도구 — 그중에는 bash_exec, web_fetch, run_agent, write_workspace_file가 있으며, 본문 필드는 messages, model, stream, tools만 포함
동일함, 도구 결과 이후42,677바이트네 개의 메시지: 도구 호출과 그 결과가 추가됨
제목약 0.6KB비스트리밍, 세션당 한 번, 동일한 모델
Graphiti 메모리턴당기본 Ornith 모델 이름을 사용하는 POST /v1/responses 및 nomic-embed-text에 대한 임베딩 호출
컨텍스트 창 조회세션당GET /api/ps, /props, /api/v0/models, /v1/models

세 번의 실행에서 크기는 바이트 단위로 동일했습니다. 이는 공급업체의 토큰 수가 아니라 대체 엔드포인트에서 측정한 요청 바이트입니다. 요청 형식은 일반적인 OpenAI Chat Completions이며 공급업체 확장은 없습니다. 따라서 스트리밍 도구 호출을 제공하는 엔드포인트면 채팅 경로에 필요한 모든 조건을 충족합니다.

계획해야 할 부수 트래픽

위의 모든 요청은 동일한 기본 URL로 전송되었습니다. 엔드포인트가 완전한 로컬 스택이 아니라 채팅 게이트웨이인 경우 두 가지 결과가 있습니다. 임베딩: 마켓플레이스 인덱스는 부팅 시 text-embedding-3-small를 200회 요청했고, Graphiti는 매 턴 nomic-embed-text를 요청했습니다. 임베딩 모델이 없는 엔드포인트는 404를 반환하고 저장소 검색은 어휘 기반 전용으로 대체되며 메모리 추출에는 트레이스백이 기록됩니다. 채팅 자체에는 영향이 없었습니다. Kunavo는 임베딩 모델을 제공하지 않으므로 Kunavo에서는 이것이 예상되는 상태입니다. 메모리 모델 이름: Graphiti의 /v1/responses 호출은 GRAPHITI_LLM_MODEL 및 GRAPHITI_RERANKER_MODEL가 엔드포인트가 제공하는 모델로 설정되지 않은 한 자체 기본 모델 이름을 사용합니다.

턴당 비용

청구서가 아닌 대략적인 산술로 보면, 도구 한 턴은 두 번의 호출에 걸쳐 84,553바이트를 전송했습니다. 이는 토큰당 네 글자를 기준으로 약 21,138 입력 토큰에 해당하며, 여기에 수백 개의 출력 토큰이 더해집니다. 600라고 가정합니다.

Kunavo를 통한 모델입력 / 출력 1M당 요금도구 한 턴
Claude Haiku 4.5$0.70 / $3.50$0.017
Claude Sonnet 5$1.40 / $7.00$0.034

대화는 길어지므로 이후 턴에서는 더 많은 내용을 전송합니다. Kunavo는 선불 잔액에서 토큰당 요금을 청구하며, 최소 $10 충전 금액이 있고 구독은 없습니다(청구). 카탈로그 금액은 상한이 아니라 청구 하한입니다. Kunavo에서는 자체 엔드포인트로 AutoGPT를 실행한 사람이 없고, 여기서의 실행은 로컬 대체 엔드포인트를 사용했으므로 첫 번째 턴의 청구 금액은 사용량 로그에서 확인하세요.

자주 묻는 질문

AutoGPT에서 사용자 지정 API 엔드포인트를 사용할 수 있나요?

예. 제품의 한 부분에서만 가능하며, 해당 부분을 직접 호스팅하는 경우에만 사용할 수 있습니다. 자체 호스팅 AutoGPT Platform에서는 CHAT_USE_LOCAL=true, CHAT_BASE_URL, CHAT_API_KEY 및 CHAT_FAST_STANDARD_MODEL을 통해 AutoPilot 채팅 에이전트가 모든 OpenAI 호환 엔드포인트를 사용할 수 있습니다. 2026년 10월 1일에 공식 v0.8.2 단일 컨테이너 이미지를 사용해 로컬 대체 엔드포인트에 연결하여 실행했습니다. 채팅 한 턴과 세 번의 도구 왕복이 완료되었고, AutoPilot이 작성한 파일을 워크스페이스 API를 통해 다시 읽었습니다. 호스팅된 agpt.co 서비스는 이러한 변수를 무시하며, 에이전트 그래프 내부의 AI Text Generator 블록도 이 변수를 읽지 않습니다.

AI Text Generator 블록은 CHAT_BASE_URL을 사용하나요?

아니요. AutoGPT의 자체 가이드에 따르면 AutoPilot 채팅 경로와 블록 계층은 서로 다른 변수를 읽습니다. v0.8.2 소스에서 블록 계층의 OpenAI 및 Anthropic 클라이언트는 기본 URL 없이 생성되며, 여기서 설정할 수 있는 유일한 호스트는 Ollama 네이티브 API용 Ollama 호스트입니다. 따라서 AI Text Generator 블록을 호출하는 에이전트 그래프는 CHAT_BASE_URL의 값과 관계없이 AutoGPT가 제공하는 공급업체를 계속 사용합니다.

AutoGPT에 가장 좋거나 가장 저렴한 API는 무엇인가요?

For the self-hosted chat path, the cheapest is a model you run yourself — AutoGPT's guide uses Ollama — and the cheapest metered option is whichever OpenAI-compatible endpoint serves a capable tool-calling model at the lowest rate. Each tool turn in our run sent about 85 KB across two chat calls with 16 tool definitions, roughly 21,000 input tokens at four characters per token; at Kunavo's Claude Haiku 4.5 rates that is about $0.017 a turn, and about $0.034 on Claude Sonnet 5. Cheapest listed rate and cheapest finished task are different questions: a model that fumbles tool calls costs more turns.

AutoGPT 엔드포인트에 임베딩 및 /v1/responses 요청이 전송되는 이유는 무엇인가요?

다른 기능도 동일한 기본 URL을 따르기 때문입니다. 실행 중 부팅 시 엔드포인트는 text-embedding-3-small에 대한 임베딩 요청 200건(마켓플레이스의 의미 검색 인덱스)을 받았고, 각 채팅 턴 이후 Graphiti 메모리는 기본 모델 이름을 사용한 /v1/responses 호출과 nomic-embed-text에 대한 임베딩 호출을 전송했습니다. 이러한 모델이 없는 엔드포인트는 404를 반환하지만 채팅은 계속 작동했고 컨테이너에는 Graphiti 트레이스백이 기록되었습니다. GRAPHITI_LLM_MODEL, GRAPHITI_RERANKER_MODEL 및 GRAPHITI_EMBEDDER_MODEL을 엔드포인트가 제공하는 모델로 설정하거나, 메모리 기능 저하와 스토어 검색이 어휘 검색으로만 제한되는 상태를 받아들이세요.

AutoPilot이 실제로 내 엔드포인트를 사용하고 있는지 어떻게 확인하나요?

세 가지 확인 방법이 있으며, 모두 AutoGPT 가이드에 설명되어 있고 실행에서도 확인되었습니다. 컨테이너에 docker exec로 들어가 환경에서 CHAT_를 grep합니다. 채팅 턴을 보내고 로그에서 "Using baseline service"를 찾습니다. 그리고 엔드포인트 로그에 설정한 모델을 사용한 스트리밍 /v1/chat/completions 요청이 기록되었는지 확인합니다. 첫 번째 턴 전에 AutoPilot은 컨텍스트 창을 파악하기 위해 /api/ps, /props, /api/v0/models 및 /v1/models도 조회합니다. 가이드에 따르면 아무것도 보고하지 않는 엔드포인트는 32k로 대체됩니다.

2026년 10월 1일 실행: significantgravitas/autogpt:v0.8.2(arm64 이미지, sha256:8322941548c6…)를 Docker Desktop에서 사용했으며, 일회성 로컬 계정으로 AutoPilot 자체 채팅 API를 통해 AutoPilot을 구동했습니다. 하나의 도구 호출 후 텍스트로 응답하는 로컬 기록용 대체 엔드포인트를 사용했습니다. 세 번의 도구 왕복이 모두 완료되었고, 작성된 파일을 워크스페이스 API를 통해 다시 읽었습니다. 실행 외의 동작은 AutoGPT의 copilot-local-llm 가이드와 v0.8.2 소스에 근거합니다. 이 대체 엔드포인트는 공급업체도 Kunavo도 아닙니다.