Gemini는 최첨단 AI 중 가격 대비 성능이 가장 뛰어난 선택지 중 하나이며, Kunavo는 하나의 OpenAI 호환 API 뒤에서 Google 정가보다 약 %70 저렴하게 제공합니다. 이 가이드에서는 모델별 최신 요금, 직접 검증할 수 있는 비용 계산 예시, 프로덕션에서 Gemini를 호출하는 가장 저렴한 방법을 설명합니다.
한눈에 보는 Gemini 가격
요금은 Kunavo에서 청구되는 기준으로 100만 토큰당 USD로 표시됩니다. “Google 정가” 열은 Google이 게시한 동일 모델의 요금이며, 차이를 확인할 수 있도록 표시됩니다.
| 모델 | 입력 / 100만 | 출력 / 100만 | Google 목록 (입력 / 출력) | 절감액 |
|---|---|---|---|---|
gemini-2-5-flash | $0.09 | $0.75 | $0.30 / $2.50 | ~%70 |
gemini-3-1-pro | $0.70 | $4.20 | $2.00 / $12.00 | ~%65 |
Flash는 대규모 처리에 적합하고, Pro는 더 어려운 추론, 시각 및 긴 컨텍스트 작업을 위한 모델입니다. 최신 요금은 항상 가격 페이지와 각 모델 페이지(gemini-2-5-flash, gemini-3-1-pro)에서 확인할 수 있습니다.
Gemini 토큰 가격은 어떻게 작동하나요?
입력 토큰(시스템 프롬프트, 검색된 컨텍스트, 사용자 메시지 등 보내는 모든 항목)과 출력 토큰(모델이 생성하는 항목)에 대해 비용을 지불합니다. 출력은 더 비싼 쪽이므로 Gemini 청구액을 좌우하는 가장 큰 단일 요소는 모델이 생성하도록 허용하는 텍스트의 양입니다. 이미지와 오디오는 토큰 등가량으로 변환되어 동일한 카운터로 청구됩니다.
비용 계산 예시
마지막 행을 제외한 실제 수치는 Kunavo의 Gemini 2.5 Flash 요금을 사용했으며, 마지막 행은 Gemini 3.1 Pro을 사용합니다:
| 워크로드 | 토큰 (입력 / 출력) | 모델 | 비용 |
|---|---|---|---|
| 대화 턴 | 1.000 / 300 | Flash | $0.0003 |
| RAG 응답 | 8.000 / 500 | Flash | $0.0011 |
| 배치 분류 (문서당) | 500 / 20 | Flash | $0.00006 |
| 긴 컨텍스트 분석 | 20.000 / 2.000 | Pro | $0.0224 |
이 요금 기준으로 Flash에서 문서 100,000개를 분류하는 배치는 약 $6, 대화 100만 턴은 약 $315입니다. 실행 가능한 계산식:
# Kunavo Gemini 2.5 Flash oranları (1M token başına USD)
IN_RATE, OUT_RATE = 0.09, 0.75
def cost(in_tokens: int, out_tokens: int) -> float:
return in_tokens / 1_000_000 * IN_RATE + out_tokens / 1_000_000 * OUT_RATE
print(cost(1_000, 300)) # bir sohbet turu -> $0.000315
print(cost(8_000, 500)) # bir RAG yanıtı -> $0.001095
print(cost(500, 20) * 100_000) # 100k belge yığını -> ~$6.00Kunavo 가격 및 Stripe 청구
구독도, Google Cloud 프로젝트도 필요하지 않습니다. 잔액을 충전하면(Stripe 또는 현지 결제 방법) 호출 비용이 위의 토큰당 요금에 따라 잔액에서 차감됩니다. $10 최소 충전으로 종량제 방식으로 사용할 수 있으며 잔액은 만료되지 않고, 더 많이 충전하면 보너스 크레딧을 받을 수 있습니다. 하나의 잔액으로 Gemini와 Claude, GPT, 이미지, 동영상, 오디오를 비롯한 모든 모델을 사용할 수 있으므로 제공업체별로 별도의 청구서를 조정할 필요가 없습니다.
어떤 Gemini 모델을 선택해야 하나요?
- gemini-2-5-flash — 대화, 추출, 분류, 요약 및 대부분의 RAG 작업을 위한 기본 모델입니다. 빠르고 가장 저렴하면서도 충분한 성능을 제공합니다.
- gemini-3-1-pro — Flash가 충분히 정확하지 않을 때 선택하세요. 다단계 추론, 코드, 시각 작업 및 매우 긴 컨텍스트에 적합합니다.
좋은 패턴은 난이도에 따라 라우팅하는 것입니다. 일반적인 경우에는 Flash를 사용하고, 검사에 실패하면 Pro로 업그레이드하세요. 코드의 라우팅 패턴은 AI 비용 최적화 가이드를 참조하세요.
Gemini 비용 절감하기
- 등급을 낮추세요. 쉬운 80%는 Flash로 보내고, 어려운 20%에 Pro를 사용하세요.
- 출력을 제한하세요.
max_tokens및 중지 시퀀스를 설정하세요. 출력은 카운터에서 비용이 더 높은 부분입니다. - 입력을 줄이세요. 전체 지식 기반을 컨텍스트에 넣는 대신 더 적지만 더 나은 RAG 청크를 검색하세요.
- 배치 처리하세요. 지연 시간을 낮게 유지하고 재시도 폭풍을 피하려면 독립적인 호출을 묶으세요.
FAQ
Gemini API는 무료인가요?
Google AI Studio는 프로토타이핑을 위한 속도 제한 무료 등급을 제공합니다. 프로덕션에서는 토큰당 요금을 지불합니다. Kunavo는 최소 $10 충전부터 종량제로 이용할 수 있습니다 — 아래 요금에 따라 토큰당 지불하며, 잔액은 만료되지 않고 Google Cloud 결제 계정도 필요하지 않습니다.
Gemini 2.5 Flash의 가격은 얼마인가요?
Kunavo에서 Gemini 2.5 Flash의 가격은 입력 100만 토큰당 $0.09, 출력 100만 토큰당 $0.75입니다 — Google의 $0.30 / $2.50 정가보다 약 70% 저렴합니다. 일반적인 챗봇 한 번의 대화(입력 1K, 출력 300)는 약 $0.0003입니다.
Gemini가 Claude나 GPT보다 저렴한가요?
Gemini 2.5 Flash는 어디서든 가장 저렴하면서 충분한 성능을 제공하는 모델 중 하나입니다 — 대규모 작업에서 Claude Haiku와 대부분의 GPT 등급보다 저렴합니다. 전체 표는 가격 페이지에서 비교하세요.
Gemini API 비용을 줄이려면 어떻게 해야 하나요?
Flash로 낮추고, 출력을 제한하며, 검색된 컨텍스트를 줄이고, 배치 처리하세요. 자세한 내용은 비용 최적화 가이드를 참고하세요. Gemini 호출을 시작하려면 Gemini API 키 발급 방법 가이드를 확인하세요.