Geminiは最先端AIの中でも特に費用対効果に優れており、Kunavoでは単一のOpenAI互換APIを通じて、Googleの定価より約%70安く提供しています。このガイドでは、モデル別の最新料金、ご自身で検証できるコスト計算例、本番環境でGeminiを最も安く呼び出す方法を説明します。
Gemini料金の概要
料金はKunavoで請求されるとおり、100万トークンあたり、米ドルで表示しています。「Google定価」列には同じモデルについてGoogleが公表している料金を表示し、差額が分かるようにしています。
| モデル | 入力 / 100万 | 出力 / 100万 | Google定価(入力 / 出力) | 割引額 |
|---|---|---|---|---|
gemini-2-5-flash | $0.09 | $0.75 | $0.30 / $2.50 | ~%70 |
gemini-3-1-pro | $0.70 | $4.20 | $2.00 / $12.00 | ~%65 |
Flashは大規模ワークロード向けの主力で、Proはより難しい推論、視覚処理、長いコンテキストのタスク向けです。現在の料金は常に料金ページと各モデルページ(gemini-2-5-flash、gemini-3-1-pro)に表示されます。
Geminiのトークン料金の仕組み
入力トークン(送信するすべてのもの — システムプロンプト、取得したコンテキスト、ユーザーメッセージ)と、出力トークン(モデルが生成するもの)に対して支払います。出力の方が高価なので、Geminiの請求額に最も大きく影響するのは、モデルにどれだけの文章を書かせるかです。画像と音声はトークン相当量に変換され、同じメーターで課金されます。
コスト計算例
最後の行を除き、KunavoのGemini 2.5 Flash料金に基づく実際の数値です。最後の行ではGemini 3.1 Proを使用します。
| ワークロード | トークン(入力 / 出力) | モデル | コスト |
|---|---|---|---|
| チャットの1ターン | 1.000 / 300 | Flash | $0.0003 |
| RAG回答 | 8.000 / 500 | Flash | $0.0011 |
| バッチ分類(文書あたり) | 500 / 20 | Flash | $0.00006 |
| 長いコンテキストの分析 | 20.000 / 2.000 | Pro | $0.0224 |
この料金では、Flashで100,000件の文書を分類するバッチは約$6、チャットの1ターン100万回は約$315です。計算式はすぐ実行できます。
# Kunavo Gemini 2.5 Flash oranları (1M token başına USD)
IN_RATE, OUT_RATE = 0.09, 0.75
def cost(in_tokens: int, out_tokens: int) -> float:
return in_tokens / 1_000_000 * IN_RATE + out_tokens / 1_000_000 * OUT_RATE
print(cost(1_000, 300)) # bir sohbet turu -> $0.000315
print(cost(8_000, 500)) # bir RAG yanıtı -> $0.001095
print(cost(500, 20) * 100_000) # 100k belge yığını -> ~$6.00Kunavoの料金とStripe請求
サブスクリプションもGoogle Cloudプロジェクトも不要です。残高をチャージすると(Stripeまたは現地の決済方法)、呼び出しごとに上記のトークン単価で残高から差し引かれます。最低$10のチャージから従量課金で利用でき、残高に有効期限はなく、より大きなチャージにはボーナスクレジットが付与されます。1つの残高でGeminiと、Claude、GPT、画像、動画、音声を含むすべてのモデルを利用できるため、プロバイダーごとに別の請求書を照合する必要はありません。
どのGeminiモデルを選ぶべきですか?
- gemini-2-5-flash — チャット、抽出、分類、要約、大半のRAGのデフォルト。高速で、十分な性能を持つ最も安価な選択肢です。
- gemini-3-1-pro — Flashでは十分な精度が得られない場合に使用します。多段階推論、コード、視覚処理、非常に長いコンテキストに適しています。
優れたパターンは、難易度に応じてルーティングすることです。一般的なケースにはFlashを使い、チェックに失敗した場合だけProに引き上げます。コードでのルーティングパターンについては、AIコスト最適化ガイドをご覧ください。
Geminiの請求額を削減する
- ティアを下げる。処理全体のうち簡単な80%をFlashに回し、難しい20%のためにProを確保してください。
- 出力を制限する。
max_tokensと停止シーケンスを設定します。メーター上では出力の方が高価です。 - 入力を絞り込む。知識ベース全体をコンテキストに詰め込むのではなく、より少数で質の高いRAGチャンクを取得します。
- バッチ処理する。レイテンシーを低く保ち、リトライの集中を避けるため、独立した呼び出しをまとめます。
よくある質問
Gemini APIは無料ですか?
Google AI Studioには、プロトタイプ作成向けにレート制限付きの無料枠があります。本番環境ではトークン単位で支払います。Kunavoは最低$10のチャージから従量課金で利用でき、以下の料金でトークン単位に支払います。残高に有効期限はなく、Google Cloudの請求アカウントも必要ありません。
Gemini 2.5 Flashの料金はいくらですか?
Kunavoでは、Gemini 2.5 Flashの料金は入力100万トークンあたり$0.09、出力100万トークンあたり$0.75です。Googleの定価$0.30 / $2.50より約70%安価です。一般的なチャットの1ターン(入力1K、出力300)なら、約$0.0003です。
GeminiはClaudeやGPTより安いですか?
Gemini 2.5 Flashは、どこで入手できるものと比べても、十分な性能を持つモデルの中で最も安価なものの1つです。大量の処理では、Claude Haikuや大半のGPTティアより安価です。料金ページで完全な表を比較してください。
Gemini APIのコストを下げるにはどうすればよいですか?
Flashに下げ、出力を制限し、取得したコンテキストを絞り込み、バッチ処理してください。詳しくはコスト最適化ガイドをご覧ください。Geminiの呼び出しを始めるには、Gemini APIキーの取得方法をご覧ください。