Gemini offre l’un des meilleurs rapports qualité-prix parmi les modèles d’IA de pointe, et Kunavo le propose à environ 70 % de moins que le tarif catalogue de Google, derrière une seule API compatible avec OpenAI. Ce guide présente les tarifs actuels par modèle, des exemples de coûts que vous pouvez vérifier vous-même et la manière la moins chère d’appeler Gemini en production.
Tarifs de l’API Gemini en un coup d’œil
Les tarifs sont calculés par 1 M de tokens, en USD, tels qu’ils sont facturés par Kunavo. La colonne « Liste Google » indique le tarif publié par Google pour le même modèle, afin que vous puissiez voir la différence.
| Modèle | Entrée / 1 M | Sortie / 1 M | Liste Google (entrée / sortie) | Votre économie |
|---|---|---|---|---|
gemini-2-5-flash | $0.09 | $0.75 | $0.30 / $2.50 | ~70% |
gemini-3-1-pro | $0.70 | $4.20 | $2.00 / $12.00 | ~65% |
Flash est le modèle de référence pour les volumes élevés ; Pro est destiné au raisonnement plus complexe, à la vision et aux tâches nécessitant un contexte long. Les tarifs en temps réel sont toujours affichés sur la page des tarifs et sur la page de chaque modèle (gemini-2-5-flash, gemini-3-1-pro).
Comment fonctionne la tarification de Gemini par token
Vous payez les tokens d’entrée (tout ce que vous envoyez — prompt système, contexte récupéré, message utilisateur) et les tokens de sortie (ce que le modèle génère). La sortie est la partie la plus coûteuse ; le principal levier sur votre facture Gemini est donc la quantité de texte que vous laissez le modèle rédiger. Les images et l’audio sont convertis en équivalents de tokens et facturés sur le même compteur.
Exemples de coûts calculés
Chiffres réels aux tarifs de Gemini 2.5 Flash chez Kunavo, sauf la dernière ligne qui utilise Gemini 3.1 Pro :
| Charge de travail | Tokens (entrée / sortie) | Modèle | Coût |
|---|---|---|---|
| Tour de chatbot | 1.000 / 300 | Flash | $0.0003 |
| Réponse RAG | 8.000 / 500 | Flash | $0.0011 |
| Classification par lots (par document) | 500 / 20 | Flash | $0.00006 |
| Analyse de contexte long | 20.000 / 2.000 | Pro | $0.0224 |
À ces tarifs, un lot de classification de 100 000 documents avec Flash coûte environ $6, et un million de tours de chatbot environ $315. Le calcul, prêt à être exécuté :
# Tarifas do Kunavo para o Gemini 2.5 Flash (USD por 1M de tokens)
IN_RATE, OUT_RATE = 0.09, 0.75
def custo(tokens_entrada: int, tokens_saida: int) -> float:
return tokens_entrada / 1_000_000 * IN_RATE + tokens_saida / 1_000_000 * OUT_RATE
print(custo(1_000, 300)) # uma rodada de chatbot -> $0.000315
print(custo(8_000, 500)) # uma resposta de RAG -> $0.001095
print(custo(500, 20) * 100_000) # lote de 100k documentos -> ~$6.00Tarifs Kunavo et facturation via Stripe
Il n’y a ni abonnement ni projet Google Cloud. Vous ajoutez un solde à un portefeuille (Stripe ou méthodes de paiement locales), et les appels le débitent aux tarifs par token indiqués ci-dessus. Le paiement à l’usage commence par un dépôt minimum de 10 $, le solde n’expire jamais et les dépôts plus importants donnent droit à un crédit bonus. Un seul portefeuille couvre Gemini et tous les autres modèles — Claude, GPT, image, vidéo et audio — vous n’avez donc pas à rapprocher une facture distincte par fournisseur.
Quel modèle Gemini dois-je choisir ?
- gemini-2-5-flash — le choix par défaut pour le chat, l’extraction, la classification, la synthèse et la plupart des cas d’utilisation RAG. Rapide et l’option performante la moins chère.
- gemini-3-1-pro — utilisez-le lorsque Flash manque de précision : raisonnement en plusieurs étapes, code, vision et contexte très long.
Une bonne approche consiste à router les requêtes selon leur difficulté : Flash pour les cas courants, et Pro uniquement lorsqu’un contrôle échoue. Consultez le guide d’optimisation des coûts de l’IA pour découvrir le modèle de routage à utiliser dans votre code.
Comment réduire votre facture Gemini
- Passez à un niveau inférieur. Envoyez les 80 % de tâches faciles à Flash ; réservez Pro aux 20 % de tâches difficiles.
- Limitez la sortie. Définissez
max_tokenset des séquences d’arrêt — la sortie est la partie coûteuse du compteur. - Allégez l’entrée. Récupérez moins d’extraits RAG, mais de meilleure qualité, au lieu d’insérer toute votre base de connaissances dans le contexte.
- Traitez par lots. Regroupez les appels indépendants afin de maintenir une faible latence et d’éviter les tempêtes de nouvelles tentatives.
Questions fréquentes
L’API Gemini est-elle gratuite ?
Google AI Studio propose un niveau gratuit avec des limites de débit, idéal pour les prototypes. En production, vous payez par token. Kunavo fonctionne à l’usage à partir d’un dépôt minimum de 10 $ — vous payez par token aux tarifs ci-dessous, le solde n’expire jamais et aucun compte de facturation Google Cloud n’est nécessaire.
Combien coûte Gemini 2.5 Flash ?
Chez Kunavo, Gemini 2.5 Flash coûte $0.09 par 1 M de tokens d’entrée et $0.75 par 1 M de tokens de sortie — environ 70 % de moins que le tarif catalogue de Google, de $0.30 / $2.50. Un tour de chatbot typique (1 K en entrée, 300 en sortie) coûte environ 0,0003 $.
Gemini est-il moins cher que Claude ou GPT ?
Gemini 2.5 Flash est l’un des modèles performants les moins chers du marché — moins cher que Claude Haiku et que la plupart des gammes GPT pour les charges à fort volume. Comparez le tableau complet sur la page des tarifs.
Comment réduire le coût de l’API Gemini ?
Utilisez Flash, limitez la sortie, réduisez le contexte récupéré et regroupez les requêtes par lots. Consultez les détails dans le guide d’optimisation des coûts. Pour commencer à appeler Gemini, consultez comment obtenir une clé API Gemini.