Gemini는 최첨단 AI에서 가격 대비 성능이 가장 뛰어난 모델 중 하나이며, Kunavo는 단일 OpenAI 호환 API 뒤에서 Google 카탈로그 가격보다 약 70% 저렴하게 제공합니다. 이 Gemini API 가격 가이드는 모델별 현재 요금, 직접 다시 계산할 수 있는 비용 예시, 프로덕션에서 Gemini를 가장 저렴하게 호출하는 방법을 제공합니다.
Gemini 가격 한눈에 보기
요금은 Kunavo가 청구하는 토큰 100만 개당 USD입니다. ‘Google 가격’ 열은 직접 비교할 수 있도록 동일 모델에 대해 Google이 공개한 요금입니다.
| 모델 | 입력 / 1M | 출력 / 1M | Google 가격(입력 / 출력) | 절감액 |
|---|---|---|---|---|
gemini-2-5-flash | $0.09 | $0.75 | $0.30 / $2.50 | ~70 % |
gemini-3-1-pro | $0.70 | $4.20 | $2.00 / $12.00 | ~65 % |
Flash는 대규모 처리의 주력 모델이고, Pro는 더 어려운 추론, 비전 및 긴 컨텍스트에 사용합니다. 실시간 요금은 항상 가격 페이지와 각 모델 페이지(gemini-2-5-flash, gemini-3-1-pro)에 표시됩니다.
Gemini의 토큰 요금 방식
입력 토큰(시스템 프롬프트, 검색된 컨텍스트, 사용자 메시지 등 보내는 모든 것)과 출력 토큰(모델이 생성하는 것)에 대해 지불합니다. 출력이 더 비싼 부분이므로 Gemini 청구액에서 가장 큰 절감 수단은 모델이 작성하도록 허용하는 텍스트의 양입니다. 이미지와 오디오는 토큰 등가량으로 변환되어 동일한 카운터로 청구됩니다.
상세 비용 예시
마지막 행만 Gemini 3.1 Pro을 사용하는 것을 제외하면, 실제 Kunavo Gemini 2.5 Flash 요율 기준입니다:
| 워크로드 | 토큰(입력 / 출력) | 모델 | 비용 |
|---|---|---|---|
| 챗봇 1턴 | 1 000 / 300 | Flash | $0.0003 |
| RAG 답변 | 8 000 / 500 | Flash | $0.0011 |
| 배치 분류(문서당) | 500 / 20 | Flash | $0.00006 |
| 긴 컨텍스트 분석 | 20 000 / 2 000 | Pro | $0.0224 |
이 요율로 Flash에서 문서 100,000건을 분류하는 배치는 약 $6, 챗봇 1백만 턴은 약 $315입니다. 실행 가능한 계산식:
# Tarifs Kunavo pour Gemini 2.5 Flash (USD par 1M de tokens)
IN_RATE, OUT_RATE = 0.09, 0.75
def cout(in_tokens: int, out_tokens: int) -> float:
return in_tokens / 1_000_000 * IN_RATE + out_tokens / 1_000_000 * OUT_RATE
print(cout(1_000, 300)) # un tour de chatbot -> $0.000315
print(cout(8_000, 500)) # une réponse RAG -> $0.001095
print(cout(500, 20) * 100_000) # lot de 100k documents -> ~$6.00Kunavo 가격 및 Stripe를 통한 결제
구독도 Google Cloud 프로젝트도 필요하지 않습니다. 잔액을 충전하면(카드, Apple Pay, Google Pay, Link) 위의 토큰 단가에 따라 호출 비용이 차감됩니다. 최소 $10부터 충전하는 종량제 방식이며, 잔액은 만료되지 않고 더 많이 충전하면 보너스 크레딧이 지급됩니다. 가격은 USD로 표시되며 결제 시 Stripe가 EUR로 환산합니다(이 환율에는 구매자가 부담하는 2~4%의 환전 수수료가 포함되며, USD로 결제하면 이 수수료를 피할 수 있습니다). B2B 거래에서는 EU 역내 거래용 VAT 번호가 있으면 부가가치세 대리납부가 적용됩니다. 하나의 잔액으로 Gemini와 그 밖의 모든 모델(Claude, GPT, 이미지, 동영상, 오디오)을 사용할 수 있어 공급자별 청구서를 따로 대조할 필요가 없습니다.
어떤 Gemini 모델을 선택해야 하나요?
- gemini-2-5-flash — 채팅, 추출, 분류, 요약 및 대부분의 RAG에 대한 기본 선택입니다. 빠르고, 성능이 뛰어난 옵션 중 가장 저렴합니다.
- gemini-3-1-pro — Flash의 정확도가 충분하지 않을 때 사용합니다. 다단계 추론, 코드, 비전 및 매우 긴 컨텍스트에 적합합니다.
좋은 패턴은 난이도에 따른 라우팅입니다. 기본값은 Flash로 두고 검증에 실패할 때만 Pro로 올립니다. 코드 구현은 AI 비용 최적화 가이드에 있습니다.
Gemini 청구액 줄이기
- 더 낮은 등급을 사용하세요. 전체 작업의 80%를 차지하는 단순한 작업은 Flash로 보내고, 어려운 20%는 Pro에 맡기세요.
- 출력을 제한하세요.
max_tokens와 중지 시퀀스를 설정하세요 — 출력이 카운터에서 더 비싼 부분입니다. - 입력을 줄이세요. 전체 지식 베이스를 컨텍스트에 쌓는 대신 더 적고 관련성 높은 RAG 청크를 검색하세요.
- 묶어서 처리하세요. 독립적인 호출을 배치로 묶어 지연 시간을 낮추고 재시도 폭주를 피하세요.
같은 키로 Google의 동영상 모델도 호출할 수 있습니다. 클립당 가격은 Veo 3 가격에 자세히 설명되어 있습니다.
자주 묻는 질문
Gemini API는 무료인가요?
Google AI Studio는 프로토타이핑을 위해 처리량이 제한된 무료 등급을 제공합니다. 프로덕션에서는 토큰 단위로 결제합니다. Kunavo는 최소 $10 충전부터 종량제로 이용할 수 있으며, 아래 요율에 따라 토큰 단위로 청구됩니다. 잔액은 만료되지 않고 Google Cloud 결제 계정도 필요하지 않습니다.
Gemini 2.5 Flash의 비용은 얼마인가요?
Kunavo에서 Gemini 2.5 Flash는 입력 1M 토큰당 $0.09, 출력 1M 토큰당 $0.75입니다. Google의 카탈로그 가격($0.30 / $2.50)보다 약 70% 저렴합니다. 일반적인 챗봇 1턴(입력 1K, 출력 300)은 약 $0.0003입니다.
Gemini가 Claude나 GPT보다 저렴한가요?
Gemini 2.5 Flash는 시장에서 가장 저렴한 고성능 모델 중 하나로, Claude Haiku와 대부분의 고사용량 GPT 등급보다 저렴합니다. 전체 표는 가격 페이지에서, Claude 요율은 Claude API 가격 가이드에서 비교하세요.
Gemini API 비용을 줄이려면 어떻게 해야 하나요?
Flash로 낮추기, 출력을 제한하기, 더 가벼운 검색 컨텍스트 사용하기, 배치 처리하기가 핵심입니다. 자세한 내용은 비용 최적화 가이드에 있습니다. Gemini 호출을 시작하려면 Gemini API 키를 받는 방법을 확인하세요.