Geminiは最先端AIの中でも特に優れた費用対効果を提供し、Kunavoでは単一のOpenAI互換APIの背後で、Googleの定価より約70%安く利用できます。このGemini API料金ガイドでは、モデル別の現在の料金、自分で再計算できるコスト例、本番環境でGeminiを最も安く呼び出す方法を説明します。
Geminiの料金を一覧で確認
料金はKunavoが請求する、100万トークンあたりの米ドル額です。「Google料金」列は同じモデルについてGoogleが公開している料金で、直接比較できます。
| モデル | 入力 / 100万 | 出力 / 100万 | Google料金(入力/出力) | 節約額 |
|---|---|---|---|---|
gemini-2-5-flash | $0.09 | $0.75 | $0.30 / $2.50 | ~70 % |
gemini-3-1-pro | $0.70 | $4.20 | $2.00 / $12.00 | ~65 % |
Flashは大規模処理向けの主力で、Proはより難しい推論、ビジョン、長いコンテキスト向けです。リアルタイムの料金は常に料金ページと各モデルページ(gemini-2-5-flash、gemini-3-1-pro)に掲載されています。
Geminiのトークン課金の仕組み
入力トークン(送信するすべての内容—システムプロンプト、取得したコンテキスト、ユーザーメッセージ)と、出力トークン(モデルが生成する内容)に対して支払います。出力のほうが高額です。そのため、Geminiの請求額に最も大きく影響するのは、モデルにどれだけのテキストを書かせるかです。画像と音声はトークン相当量に変換され、同じカウンターで課金されます。
コストの詳細例
最後の行を除き、KunavoのGemini 2.5 Flash料金に基づく実際の数値です。最後の行ではGemini 3.1 Proを使用します。
| ワークロード | トークン(入力/出力) | モデル | コスト |
|---|---|---|---|
| チャットボットの1ターン | 1 000 / 300 | Flash | $0.0003 |
| RAGの回答 | 8 000 / 500 | Flash | $0.0011 |
| バッチ分類(1文書あたり) | 500 / 20 | Flash | $0.00006 |
| 長いコンテキストの分析 | 20 000 / 2 000 | Pro | $0.0224 |
この料金では、Flashで100,000文書を分類するバッチは約$6、チャットボットの1,000,000ターンは約$315です。計算式は実行可能な形で次のとおりです。
# Tarifs Kunavo pour Gemini 2.5 Flash (USD par 1M de tokens)
IN_RATE, OUT_RATE = 0.09, 0.75
def cout(in_tokens: int, out_tokens: int) -> float:
return in_tokens / 1_000_000 * IN_RATE + out_tokens / 1_000_000 * OUT_RATE
print(cout(1_000, 300)) # un tour de chatbot -> $0.000315
print(cout(8_000, 500)) # une réponse RAG -> $0.001095
print(cout(500, 20) * 100_000) # lot de 100k documents -> ~$6.00Kunavoの料金とStripe経由の請求
サブスクリプションもGoogle Cloudプロジェクトも不要です。残高をチャージし(銀行カード、Apple Pay、Google Pay、Link)、呼び出しは上記のトークン単価で残高から差し引かれます。最低$10のチャージから従量課金で利用でき、残高に有効期限はありません。より大きなチャージにはボーナスクレジットが付与されます。価格はUSD建てで、チェックアウト時にStripeがEURへ換算します(このレートにはお客様負担の2〜4%の換算手数料が含まれます。USDで支払えば回避できます)。B2Bでは、EU域内VAT番号によるリバースチャージが適用されます。1つの残高でGeminiとその他すべてのモデル(Claude、GPT、画像、動画、音声)を利用でき、プロバイダーごとに請求書を照合する必要はありません。
どのGeminiモデルを選ぶべきですか?
- gemini-2-5-flash—チャット、抽出、分類、要約、そしてほとんどのRAGにおけるデフォルトの選択肢です。高速で、利用可能な高性能モデルの中で最も安価です。
- gemini-3-1-pro—Flashでは十分な精度が得られない場合に使用します。多段階推論、コード、ビジョン、非常に長いコンテキストに適しています。
優れたパターンは、難易度に応じたルーティングです。デフォルトはFlashとし、検証に失敗した場合だけProへ引き上げます。コードでの実装方法はAIコスト最適化ガイドにあります。
Geminiの請求額を削減する方法
- 下位モデルへ切り替える。全タスクの80%を占める単純なタスクをFlashに送り、難しい残りの20%をProに割り当てます。
- 出力に上限を設ける。
max_tokensと停止シーケンスを設定します。出力はカウンター上で高額な側です。 - 入力を軽量化する。ナレッジベース全体をコンテキストに詰め込むのではなく、より少数で関連性の高いRAGチャンクを取得します。
- まとめて処理する。独立した呼び出しをバッチ化してレイテンシーを低く保ち、リトライの集中を避けます。
同じキーでGoogleの動画モデルも呼び出せます。クリップごとの料金はVeo 3の料金に詳しく記載されています。
よくある質問
Gemini APIは無料ですか?
Google AI Studioには、プロトタイプ向けのレート制限付き無料枠があります。本番ではtoken単位で支払います。Kunavoは最低$10のチャージから始まる従量制で、以下の料金でtoken分だけ支払い、残高は失効せず、Google Cloudの請求先アカウントも不要です。
Gemini 2.5 Flashはいくらですか?
KunavoではGemini 2.5 Flashは入力1M tokenあたり$0.09、出力1M tokenあたり$0.75です。Googleの定価($0.30 / $2.50)より約70%安価です。一般的なチャットボットの1往復(入力1K、出力300)は約$0.0003です。
GeminiはClaudeやGPTより安いですか?
Gemini 2.5 Flashは市場で最も安価な高性能モデルの一つで、Claude Haikuや、ほとんどの高ボリューム向けGPTティアより安価です。完全な比較表は料金ページで、Claudeの料金はClaude API料金ガイドでご確認ください。
Gemini APIのコストを削減するには?
Flashへダウングレードし、出力を上限設定し、取得するコンテキストを軽量化し、バッチ処理を行います。詳細はコスト最適化ガイドにあります。Geminiの呼び出しを始めるには、Gemini APIキーの取得方法をご覧ください。