Retour aux guides
Tarification·18 juin 2026·Mis à jour le 24 septembre 2026·8 min de lecture

Tarification de l’API Gemini 2026 — prix par modèle et réduction des coûts

Tableau clair de la tarification Gemini : tarifs par modèle, exemples de coûts réels et méthode la moins chère pour appeler Gemini en production au coût minimal par token. Tous les chiffres correspondent aux tarifs facturés par Kunavo.

Gemini offre l’un des meilleurs rapports qualité-prix parmi les modèles d’IA de pointe, et Kunavo le propose derrière une API unique compatible avec OpenAI, à environ 70 % de moins que le tarif catalogue de Google. Ce guide présente les tarifs actuels par modèle, des exemples de calcul de coûts que vous pouvez vérifier vous-même et la manière la moins chère d’appeler Gemini en production.

Les tarifs Gemini en un coup d’œil

Les tarifs sont exprimés en USD par million de tokens, tels qu’ils sont facturés sur Kunavo. La colonne « Google catalogue » indique le tarif publié par Google pour le même modèle, afin que vous puissiez voir la différence.

ModèleEntrée / millionSortie / millionCatalogue Google (entrée / sortie)Économie
gemini-2-5-flash$0.09$0.75$0.30 / $2.50~%70
gemini-3-1-pro$0.70$4.20$2.00 / $12.00~%65

Flash est conçu pour les charges à fort volume ; Pro convient au raisonnement plus difficile, aux tâches visuelles et aux contextes très longs. Les tarifs en direct apparaissent toujours sur la page des prix et sur chaque page de modèle (gemini-2-5-flash, gemini-3-1-pro).

Comment fonctionne la tarification des tokens Gemini

Vous payez les tokens d’entrée (tout ce que vous envoyez — prompt système, contexte récupéré, message utilisateur) et les tokens de sortie (ce que le modèle produit). La sortie est la partie la plus chère ; le principal levier de votre facture Gemini est donc la quantité de texte que vous autorisez le modèle à générer. Les images et l’audio sont convertis en équivalents de tokens et facturés par le même compteur.

Exemples de calcul de coûts

Chiffres réels selon les tarifs Kunavo de Gemini 2.5 Flash, sauf la dernière ligne, qui utilise Gemini 3.1 Pro :

Charge de travailTokens (entrée / sortie)ModèleCoût
Tour de conversation1.000 / 300Flash$0.0003
Réponse RAG8.000 / 500Flash$0.0011
Classification par lots (par document)500 / 20Flash$0.00006
Analyse de contexte long20.000 / 2.000Pro$0.0224

Avec ces tarifs sur Flash, un lot de classification de 100 000 documents coûte environ $6, et un million de tours de conversation environ $315. Calcul que vous pouvez exécuter :

gemini_cost.py
# Kunavo Gemini 2.5 Flash oranları (1M token başına USD)
IN_RATE, OUT_RATE = 0.09, 0.75

def cost(in_tokens: int, out_tokens: int) -> float:
    return in_tokens / 1_000_000 * IN_RATE + out_tokens / 1_000_000 * OUT_RATE

print(cost(1_000, 300))            # bir sohbet turu     -> $0.000315
print(cost(8_000, 500))            # bir RAG yanıtı       -> $0.001095
print(cost(500, 20) * 100_000)     # 100k belge yığını    -> ~$6.00

Tarification Kunavo et facturation Stripe

Aucun abonnement, aucun projet Google Cloud. Vous rechargez un solde (par Stripe ou un moyen de paiement local), puis les appels sont déduits de ce solde selon les tarifs par token ci-dessus. Le paiement à l’usage avec un rechargement minimum de 10 $ n’expire jamais, et les rechargements plus importants apportent des crédits bonus. Un seul solde couvre Gemini et tous les autres modèles — Claude, GPT, image, vidéo et audio — vous évitant de rapprocher une facture distincte pour chaque fournisseur.

Quel modèle Gemini dois-je choisir ?

  • gemini-2-5-flash — le choix par défaut pour les conversations, l’extraction, la classification, les résumés et la plupart des cas RAG. L’option performante la plus rapide et la moins chère.
  • gemini-3-1-pro — choisissez-le lorsque Flash n’est pas assez précis : raisonnement en plusieurs étapes, code, images et contexte très long.

Une bonne approche consiste à orienter les requêtes selon leur difficulté : Flash pour les cas courants, puis Pro lorsqu’un contrôle échoue. Pour le pattern d’orientation dans le code, consultez le guide d’optimisation des coûts de l’IA.

Réduire votre facture Gemini

  1. Descendez d’un niveau. Envoyez les 80 % de tâches simples à Flash et réservez Pro aux 20 % difficiles.
  2. Limitez la sortie. Définissez max_tokens et les séquences d’arrêt — la sortie est la partie la plus chère du compteur.
  3. Réduisez l’entrée. Récupérez moins de passages RAG, mais de meilleure qualité, au lieu de remplir le contexte avec toute la base de connaissances.
  4. Regroupez les lots. Regroupez les appels indépendants pour maintenir une faible latence et éviter les tempêtes de nouvelles tentatives.

FAQ

L’API Gemini est-elle gratuite ?

Google AI Studio propose un niveau gratuit limité en débit, adapté au prototypage. Pour la production, vous payez par token. Kunavo fonctionne selon un modèle à l’usage avec un rechargement minimum de 10 $ — vous payez par token aux tarifs ci-dessous, le solde n’expire jamais et aucun compte de facturation Google Cloud n’est nécessaire.

Combien coûte Gemini 2.5 Flash ?

Sur Kunavo, Gemini 2.5 Flash coûte $0.09 par million de tokens d’entrée et $0.75 par million de tokens de sortie — environ 70 % de moins que le tarif catalogue de Google de $0.30 / $2.50. Un tour de conversation typique (1 000 tokens d’entrée, 300 de sortie) coûte environ 0,0003 $.

Gemini est-il moins cher que Claude ou GPT ?

Gemini 2.5 Flash fait partie des modèles performants les moins chers disponibles — il coûte moins cher que Claude Haiku et que la plupart des niveaux GPT pour les charges à fort volume. Comparez le tableau complet sur la page des prix.

Comment réduire le coût de l’API Gemini ?

Passez à Flash, limitez la sortie, réduisez le contexte récupéré et regroupez les requêtes. Les détails figurent dans le guide d’optimisation des coûts. Pour commencer à appeler Gemini, consultez le guide obtenir une clé API Gemini.