Retour aux guides
Prix·18 juin 2026·Mis à jour le 12 septembre 2026·8 min de lecture

Tarification de l’API Gemini 2026 — récapitulatif complet des tarifs de Gemini

Gemini offre l’un des meilleurs rapports qualité-prix parmi les IA de pointe, et Kunavo le propose de 30 à 70 % moins cher que les prix officiels de Google selon le modèle. Nous réunissons ici les tarifs actuels par modèle, des exemples de coûts vérifiables et la méthode la moins chère pour l’appeler en production.

Gemini fait partie des IA de pointe offrant le meilleur rapport qualité-prix, et Kunavo le propose derrière une seule API compatible OpenAI, environ 70 % moins cher que les tarifs Google. Ce guide présente les tarifs actuels par modèle, des exemples de calcul vérifiables directement et la méthode la moins coûteuse pour appeler Gemini en production.

Tarifs Gemini en un coup d’œil

Les tarifs sont exprimés en USD par million de tokens selon la facturation Kunavo. La colonne « Tarif Google » indique le tarif publié par Google pour le même modèle, afin de rendre la différence immédiatement visible.

ModèleEntrée / 1MSortie / 1MTarif Google (entrée / sortie)Économie
gemini-2-5-flash$0.09$0.75$0.30 / $2.50~70%
gemini-3-1-pro$0.70$4.20$2.00 / $12.00~65%

Flash est le modèle principal pour les traitements en volume ; Pro convient mieux au raisonnement difficile, à la vision et aux contextes très longs. Vérifiez toujours les tarifs actuels sur la page des tarifs et les pages de chaque modèle (gemini-2-5-flash, gemini-3-1-pro).

Comment fonctionnent les tarifs des tokens Gemini ?

Vous payez les tokens d’entrée (tout ce que vous envoyez — prompt système, contexte récupéré, message utilisateur) et les tokens de sortie (ce que le modèle génère). La sortie étant plus chère, le principal levier de votre facture Gemini est la longueur que vous autorisez au modèle. Les images et l’audio sont convertis en équivalents tokens et facturés sur le même compteur.

Exemples de calcul des coûts

Valeurs réelles calculées avec les tarifs Gemini 2.5 Flash de Kunavo ; seule la dernière ligne utiliseGemini 3.1 Pro :

TâcheTokens (entrée / sortie)ModèleCoût
Un tour de chatbot1,000 / 300Flash$0.0003
Réponse RAG8,000 / 500Flash$0.0011
Classification par lots (par document)500 / 20Flash$0.00006
Analyse de long contexte20,000 / 2,000Pro$0.0224

Avec ces tarifs, un lot classant 100 000 documents avec Flash coûte environ $6, et 1 million de tours de chatbot environ $315. Formule que vous pouvez exécuter directement :

gemini_cost.py
# Kunavo Gemini 2.5 Flash 요율 (1M 토큰당 USD)
IN_RATE, OUT_RATE = 0.09, 0.75

def cost(in_tokens: int, out_tokens: int) -> float:
    return in_tokens / 1_000_000 * IN_RATE + out_tokens / 1_000_000 * OUT_RATE

print(cost(1_000, 300))            # 챗봇 한 턴        -> $0.000315
print(cost(8_000, 500))            # RAG 답변 한 건    -> $0.001095
print(cost(500, 20) * 100_000)     # 10만 건 배치      -> ~$6.00

Tarifs Kunavo et paiements Stripe

Il n’y a ni abonnement ni projet Google Cloud. Rechargez votre solde (avec Stripe ou un moyen de paiement local), puis chaque appel déduit du solde le tarif par token indiqué ci-dessus. Rechargez à partir de $10 et payez uniquement ce que vous utilisez ; le solde n’expire pas et les recharges plus importantes reçoivent davantage de crédits bonus. Un seul solde donne accès à Gemini, Claude, GPT, ainsi qu’aux modèles d’image, de vidéo et d’audio ; vous n’avez donc pas à rapprocher des factures distinctes pour chaque fournisseur.

Quel modèle Gemini choisir ?

  • gemini-2-5-flash — Utilisez-le par défaut pour le chat, l’extraction, la classification, le résumé et la plupart des RAG. C’est l’option hautes performances la plus rapide et la moins chère.
  • gemini-3-1-pro — Choisissez-le lorsque Flash manque de précision : raisonnement en plusieurs étapes, code, vision et contextes très longs.

Une bonne pratique consiste à router selon la difficulté : traiter les cas courants avec Flash et ne passer à Pro qu’en cas d’échec de la validation. Pour le modèle de routage en code, consultez le guide d’optimisation des coûts de l’IA.

Réduire la facture Gemini

  1. Abaissez le niveau. Envoyez les 80 % de tâches faciles à Flash et gardez Pro pour les 20 % difficiles.
  2. Limitez la sortie. Définissez max_tokens et une séquence d’arrêt — la sortie est la partie la plus chère du compteur.
  3. Réduisez l’entrée. N’enfoncez pas toute la base de connaissances dans le contexte ; récupérez moins de chunks RAG, mais de meilleure qualité.
  4. Traitez par lots. Regroupez les appels indépendants pour réduire la latence et éviter les tempêtes de nouvelles tentatives.

Questions fréquentes

L’API Gemini est-elle gratuite ?

Google AI Studio propose un niveau gratuit pour le prototypage (avec des limites de requêtes). En production, la facturation se fait par token. Kunavo fonctionne avec une recharge minimale de $10 et un paiement à l’usage selon les tarifs ci-dessous ; le solde n’expire pas et aucun compte de facturation Google Cloud n’est nécessaire.

Combien coûte Gemini 2.5 Flash ?

Chez Kunavo, Gemini 2.5 Flash coûte $0.09 par million de tokens en entrée et $0.75 par million de tokens en sortie, soit environ 70 % de moins que les tarifs Google $0.30 / $2.50. Un tour de chatbot courant (1K en entrée, 300 en sortie) coûte environ $0.0003.

Gemini est-il moins cher que Claude ou GPT ?

Gemini 2.5 Flash fait partie des modèles hautes performances les moins chers, et coûte moins cher que Claude Haiku et la plupart des modèles GPT pour les traitements en volume. Comparez les tarifs et moyens de paiement de Claude dans Tarifs et paiements de l’API Claude, et consultez le tableau complet sur la page des tarifs.

Comment réduire le coût de l’API Gemini ?

Utilisez Flash, limitez la sortie, réduisez le contexte de recherche et traitez les requêtes par lots. Vous trouverez plus de détails dans le guide d’optimisation des coûts. Pour commencer à appeler Gemini, consultez Comment obtenir une clé API Gemini.