Retour aux guides
Tarifs·18 juin 2026·Mis à jour le 12 septembre 2026·8 min de lecture

Tarifs de l’API Gemini 2026 — coûts par modèle, exemples et accès compatible OpenAI moins cher

Gemini offre l’un des meilleurs rapports qualité-prix de l’IA de pointe. Découvrez les tarifs actuels par modèle — environ 70 % inférieurs aux tarifs catalogue de Google — avec des exemples de coûts et la manière la moins chère d’appeler Gemini en production.

Gemini offre l’un des meilleurs rapports qualité-prix parmi les modèles d’IA de pointe, et Kunavo le propose à environ 70 % de moins que le tarif catalogue de Google, derrière une seule API compatible avec OpenAI. Ce guide présente les tarifs actuels par modèle, des exemples de coûts que vous pouvez vérifier vous-même et la manière la moins chère d’appeler Gemini en production.

Tarifs de l’API Gemini en un coup d’œil

Les tarifs sont calculés par 1 M de tokens, en USD, tels qu’ils sont facturés par Kunavo. La colonne « Liste Google » indique le tarif publié par Google pour le même modèle, afin que vous puissiez voir la différence.

ModèleEntrée / 1 MSortie / 1 MListe Google (entrée / sortie)Votre économie
gemini-2-5-flash$0.09$0.75$0.30 / $2.50~70%
gemini-3-1-pro$0.70$4.20$2.00 / $12.00~65%

Flash est le modèle de référence pour les volumes élevés ; Pro est destiné au raisonnement plus complexe, à la vision et aux tâches nécessitant un contexte long. Les tarifs en temps réel sont toujours affichés sur la page des tarifs et sur la page de chaque modèle (gemini-2-5-flash, gemini-3-1-pro).

Comment fonctionne la tarification de Gemini par token

Vous payez les tokens d’entrée (tout ce que vous envoyez — prompt système, contexte récupéré, message utilisateur) et les tokens de sortie (ce que le modèle génère). La sortie est la partie la plus coûteuse ; le principal levier sur votre facture Gemini est donc la quantité de texte que vous laissez le modèle rédiger. Les images et l’audio sont convertis en équivalents de tokens et facturés sur le même compteur.

Exemples de coûts calculés

Chiffres réels aux tarifs de Gemini 2.5 Flash chez Kunavo, sauf la dernière ligne qui utilise Gemini 3.1 Pro :

Charge de travailTokens (entrée / sortie)ModèleCoût
Tour de chatbot1.000 / 300Flash$0.0003
Réponse RAG8.000 / 500Flash$0.0011
Classification par lots (par document)500 / 20Flash$0.00006
Analyse de contexte long20.000 / 2.000Pro$0.0224

À ces tarifs, un lot de classification de 100 000 documents avec Flash coûte environ $6, et un million de tours de chatbot environ $315. Le calcul, prêt à être exécuté :

gemini_custo.py
# Tarifas do Kunavo para o Gemini 2.5 Flash (USD por 1M de tokens)
IN_RATE, OUT_RATE = 0.09, 0.75

def custo(tokens_entrada: int, tokens_saida: int) -> float:
    return tokens_entrada / 1_000_000 * IN_RATE + tokens_saida / 1_000_000 * OUT_RATE

print(custo(1_000, 300))            # uma rodada de chatbot   -> $0.000315
print(custo(8_000, 500))            # uma resposta de RAG     -> $0.001095
print(custo(500, 20) * 100_000)     # lote de 100k documentos -> ~$6.00

Tarifs Kunavo et facturation via Stripe

Il n’y a ni abonnement ni projet Google Cloud. Vous ajoutez un solde à un portefeuille (Stripe ou méthodes de paiement locales), et les appels le débitent aux tarifs par token indiqués ci-dessus. Le paiement à l’usage commence par un dépôt minimum de 10 $, le solde n’expire jamais et les dépôts plus importants donnent droit à un crédit bonus. Un seul portefeuille couvre Gemini et tous les autres modèles — Claude, GPT, image, vidéo et audio — vous n’avez donc pas à rapprocher une facture distincte par fournisseur.

Quel modèle Gemini dois-je choisir ?

  • gemini-2-5-flash — le choix par défaut pour le chat, l’extraction, la classification, la synthèse et la plupart des cas d’utilisation RAG. Rapide et l’option performante la moins chère.
  • gemini-3-1-pro — utilisez-le lorsque Flash manque de précision : raisonnement en plusieurs étapes, code, vision et contexte très long.

Une bonne approche consiste à router les requêtes selon leur difficulté : Flash pour les cas courants, et Pro uniquement lorsqu’un contrôle échoue. Consultez le guide d’optimisation des coûts de l’IA pour découvrir le modèle de routage à utiliser dans votre code.

Comment réduire votre facture Gemini

  1. Passez à un niveau inférieur. Envoyez les 80 % de tâches faciles à Flash ; réservez Pro aux 20 % de tâches difficiles.
  2. Limitez la sortie. Définissez max_tokens et des séquences d’arrêt — la sortie est la partie coûteuse du compteur.
  3. Allégez l’entrée. Récupérez moins d’extraits RAG, mais de meilleure qualité, au lieu d’insérer toute votre base de connaissances dans le contexte.
  4. Traitez par lots. Regroupez les appels indépendants afin de maintenir une faible latence et d’éviter les tempêtes de nouvelles tentatives.

Questions fréquentes

L’API Gemini est-elle gratuite ?

Google AI Studio propose un niveau gratuit avec des limites de débit, idéal pour les prototypes. En production, vous payez par token. Kunavo fonctionne à l’usage à partir d’un dépôt minimum de 10 $ — vous payez par token aux tarifs ci-dessous, le solde n’expire jamais et aucun compte de facturation Google Cloud n’est nécessaire.

Combien coûte Gemini 2.5 Flash ?

Chez Kunavo, Gemini 2.5 Flash coûte $0.09 par 1 M de tokens d’entrée et $0.75 par 1 M de tokens de sortie — environ 70 % de moins que le tarif catalogue de Google, de $0.30 / $2.50. Un tour de chatbot typique (1 K en entrée, 300 en sortie) coûte environ 0,0003 $.

Gemini est-il moins cher que Claude ou GPT ?

Gemini 2.5 Flash est l’un des modèles performants les moins chers du marché — moins cher que Claude Haiku et que la plupart des gammes GPT pour les charges à fort volume. Comparez le tableau complet sur la page des tarifs.

Comment réduire le coût de l’API Gemini ?

Utilisez Flash, limitez la sortie, réduisez le contexte récupéré et regroupez les requêtes par lots. Consultez les détails dans le guide d’optimisation des coûts. Pour commencer à appeler Gemini, consultez comment obtenir une clé API Gemini.