Gemini는 최상급 AI 중에서도 가성비가 가장 좋은 제품군에 속하며, Kunavo는 OpenAI 호환 단일 API를 통해 Google 정가보다 약 70% 저렴하게 제공합니다. 이 가이드에는 모델별 최신 요금, 직접 확인할 수 있는 비용 예시, 프로덕션에서 Gemini를 가장 저렴하게 호출하는 방법이 담겨 있습니다.
Gemini API 가격 한눈에 보기
요금은 Kunavo에서 청구되는 기준으로 USD 단위, 토큰 1백만 개당 계산됩니다. “Google 정가” 열은 동일한 모델에 대해 Google이 공개한 요금으로, 차이를 확인할 수 있도록 표시했습니다.
| 모델 | 입력 / 1백만 | 출력 / 1백만 | Google 정가 (입력 / 출력) | 절약 금액 |
|---|---|---|---|---|
gemini-2-5-flash | $0.09 | $0.75 | $0.30 / $2.50 | ~70% |
gemini-3-1-pro | $0.70 | $4.20 | $2.00 / $12.00 | ~65% |
Flash는 대량 처리의 주력 모델이고, Pro는 더 어려운 추론, 비전 및 긴 컨텍스트 작업용입니다. 실시간 요금은 항상 가격 페이지와 각 모델 페이지(gemini-2-5-flash, gemini-3-1-pro)에 표시됩니다.
Gemini 토큰당 가격의 작동 방식
입력 토큰(시스템 프롬프트, 검색 결과 컨텍스트, 사용자 메시지 등 보내는 모든 것)과 출력 토큰(모델이 생성하는 것)에 대해 비용을 지불합니다. 출력이 더 비싼 부분이므로 Gemini 청구액에 가장 큰 영향을 주는 요소는 모델이 작성하도록 허용하는 텍스트의 양입니다. 이미지와 오디오는 토큰 등가량으로 변환되어 동일한 미터로 과금됩니다.
계산된 비용 예시
마지막 행에서 Gemini 3.1 Pro을 사용하는 것을 제외하면, Kunavo의 Gemini 2.5 Flash 요금을 적용한 실제 수치입니다:
| 워크로드 | 토큰 (입력 / 출력) | 모델 | 비용 |
|---|---|---|---|
| 챗봇 라운드 | 1.000 / 300 | Flash | $0.0003 |
| RAG 응답 | 8.000 / 500 | Flash | $0.0011 |
| 배치 분류 (문서당) | 500 / 20 | Flash | $0.00006 |
| 긴 컨텍스트 분석 | 20.000 / 2.000 | Pro | $0.0224 |
이 요금으로 Flash에서 문서 100,000개의 분류 배치는 약 $6, 챗봇 100만 라운드는 약 $315입니다. 바로 실행할 수 있는 계산식은 다음과 같습니다:
# Tarifas do Kunavo para o Gemini 2.5 Flash (USD por 1M de tokens)
IN_RATE, OUT_RATE = 0.09, 0.75
def custo(tokens_entrada: int, tokens_saida: int) -> float:
return tokens_entrada / 1_000_000 * IN_RATE + tokens_saida / 1_000_000 * OUT_RATE
print(custo(1_000, 300)) # uma rodada de chatbot -> $0.000315
print(custo(8_000, 500)) # uma resposta de RAG -> $0.001095
print(custo(500, 20) * 100_000) # lote de 100k documentos -> ~$6.00Kunavo 가격 및 Stripe를 통한 청구
구독이나 Google Cloud 프로젝트가 필요하지 않습니다. 지갑에 잔액을 추가하면(Stripe 또는 현지 결제 수단), 각 호출에서 위의 토큰당 요금에 따라 잔액이 차감됩니다. 종량제는 최소 $10 충전부터 시작하며, 잔액은 만료되지 않고 더 많이 충전하면 보너스 크레딧을 받을 수 있습니다. 하나의 지갑으로 Gemini와 Claude, GPT, 이미지, 동영상, 오디오를 포함한 모든 모델을 이용할 수 있으므로 공급자별로 별도 청구서를 대조할 필요가 없습니다.
어떤 Gemini 모델을 선택해야 하나요?
- gemini-2-5-flash — 채팅, 추출, 분류, 요약 및 대부분의 RAG에 사용하는 기본 모델입니다. 빠르고 성능 대비 비용이 가장 저렴한 선택지입니다.
- gemini-3-1-pro — Flash의 정확도가 충분하지 않을 때 사용하세요. 다단계 추론, 코드, 비전 및 매우 긴 컨텍스트에 적합합니다.
좋은 패턴은 난이도에 따라 라우팅하는 것입니다. 일반적인 경우에는 Flash를 사용하고, 검사가 실패할 때만 Pro로 전환하세요. 코드에서 라우팅하는 패턴은 AI 비용 최적화 가이드를 참조하세요.
Gemini 청구액 줄이는 방법
- 등급을 낮추세요. 쉬운 작업의 80%는 Flash로 보내고, 어려운 20%에만 Pro를 사용하세요.
- 출력을 제한하세요.
max_tokens및 중지 시퀀스를 설정하세요. 출력이 미터에서 비용이 높은 부분입니다. - 입력을 간소화하세요. 전체 지식 기반을 컨텍스트에 밀어 넣는 대신 더 적지만 더 나은 RAG 청크를 검색하세요.
- 배치 처리하세요. 독립적인 호출을 묶어 지연 시간을 낮게 유지하고 재시도 폭주를 방지하세요.
자주 묻는 질문
Gemini API는 무료인가요?
Google AI Studio에는 속도 제한이 있는 무료 등급이 있어 프로토타이핑에 적합합니다. 프로덕션에서는 토큰 단위로 결제합니다. Kunavo는 최소 $10 충전부터 종량제로 이용할 수 있습니다. 아래 요금으로 토큰당 결제하며, 잔액은 만료되지 않고 Google Cloud 결제 계정도 필요하지 않습니다.
Gemini 2.5 Flash의 가격은 얼마인가요?
Kunavo에서 Gemini 2.5 Flash는 입력 토큰 1백만 개당 $0.09, 출력 토큰 1백만 개당 $0.75입니다. Google 정가인 $0.30 / $2.50보다 약 70% 저렴합니다. 일반적인 챗봇 한 라운드(입력 1천 토큰, 출력 300토큰)는 약 $0.0003입니다.
Gemini가 Claude 또는 GPT보다 저렴한가요?
Gemini 2.5 Flash는 현재 이용 가능한 고성능 모델 중 가장 저렴한 편입니다. 대량 워크로드에서 Claude Haiku와 대부분의 GPT 등급보다 저렴합니다. 전체 표는 가격 페이지에서 비교하세요.
Gemini API 비용을 어떻게 줄일 수 있나요?
Flash를 사용하고, 출력을 제한하고, 검색 결과 컨텍스트를 간소화하고, 배치 처리하세요. 자세한 내용은 비용 최적화 가이드를 참조하세요. Gemini 호출을 시작하려면 Gemini API 키를 받는 방법을 확인하세요.