Gemini offre l’un des meilleurs rapports qualité-prix de l’IA haut de gamme, et Kunavo le propose à environ 70 % de moins que le tarif catalogue de Google, derrière une seule API compatible OpenAI. Ce guide des tarifs de l’API Gemini présente les tarifs actuels par modèle, fournit des exemples de coûts vérifiables et indique la manière la moins chère d’appeler Gemini en production.
Les tarifs Gemini en un coup d’œil
Les tarifs s’appliquent par million de tokens, en USD, selon la facturation de Kunavo. La colonne « Google catalogue » indique le tarif publié par Google pour le même modèle afin que vous puissiez voir la différence.
| Modèle | Entrée / 1 M | Sortie / 1 M | Google catalogue (entrée / sortie) | Vous économisez |
|---|---|---|---|---|
gemini-2-5-flash | $0.09 | $0.75 | $0.30 / $2.50 | ~70% |
gemini-3-1-pro | $0.70 | $4.20 | $2.00 / $12.00 | ~65% |
Flash est le modèle de travail pour les gros volumes ; Pro est destiné au raisonnement plus complexe, à la vision et aux tâches avec un long contexte. Les tarifs actuels figurent toujours sur la page des tarifs et sur la page de chaque modèle (gemini-2-5-flash, gemini-3-1-pro).
Fonctionnement de la tarification par tokens de Gemini
Vous payez les tokens d’entrée (tout ce que vous envoyez — prompt système, contexte récupéré, message utilisateur) et les tokens de sortie (ce que le modèle génère). La sortie est la partie la plus chère ; le principal levier sur une facture Gemini est donc la quantité de texte que vous laissez écrire au modèle. Les images et l’audio sont convertis en équivalents tokens et facturés sur le même compteur.
Exemples de coûts détaillés
Chiffres réels fondés sur le tarif Gemini 2.5 Flash de Kunavo, sauf la dernière ligne, qui utilise Gemini 3.1 Pro :
| Charge de travail | Tokens (entrée / sortie) | Modèle | Coûts |
|---|---|---|---|
| Tour de chatbot | 1.000 / 300 | Flash | $0.0003 |
| Réponse RAG | 8.000 / 500 | Flash | $0.0011 |
| Classification par lots (par document) | 500 / 20 | Flash | $0.00006 |
| Analyse avec long contexte | 20.000 / 2.000 | Pro | $0.0224 |
À ces tarifs, un lot de classification de 100 000 documents sur Flash coûte environ 6 $, et un million de tours de chatbot environ 315 $. Le calcul, exécutable :
# Kunavo-Tarife für Gemini 2.5 Flash (USD pro 1M Tokens)
IN_RATE, OUT_RATE = 0.09, 0.75
def kosten(in_tokens: int, out_tokens: int) -> float:
return in_tokens / 1_000_000 * IN_RATE + out_tokens / 1_000_000 * OUT_RATE
print(kosten(1_000, 300)) # ein Chatbot-Turn -> $0.000315
print(kosten(8_000, 500)) # eine RAG-Antwort -> $0.001095
print(kosten(500, 20) * 100_000) # Batch mit 100k Docs -> ~$6.00Tarifs Kunavo et facturation Stripe
Il n’y a ni abonnement ni projet Google Cloud. Vous rechargez un crédit (Stripe ou moyens de paiement locaux), puis les appels sont déduits selon les tarifs par token ci-dessus. Paiement à l’usage à partir d’un rechargement minimal de 10 $ ; le crédit n’expire jamais et les rechargements plus importants donnent droit à un crédit bonus. Un même crédit couvre Gemini et tous les autres modèles — Claude, GPT, image, vidéo et audio — afin que vous n’ayez pas à rapprocher une facture distincte par fournisseur.
Quel modèle Gemini choisir ?
- gemini-2-5-flash — le choix par défaut pour le chat, l’extraction, la classification, la synthèse et la majeure partie du RAG. Rapide et option performante la moins chère.
- gemini-3-1-pro — choisissez-le lorsque Flash n’est pas assez précis : raisonnement en plusieurs étapes, code, vision et très long contexte.
Un bon schéma consiste à router selon la difficulté : Flash dans les cas ordinaires, puis passer à Pro uniquement après un contrôle échoué. Le guide d’optimisation des coûts de l’IA montre cette approche dans le code.
Réduire votre facture Gemini
- Passez à un modèle inférieur. Envoyez les 80 % simples à Flash et réservez Pro aux 20 % difficiles.
- Limitez la sortie. Définissez
max_tokenset des séquences d’arrêt — la sortie est la partie coûteuse du compteur. - Réduisez l’entrée. Récupérez moins de chunks RAG, mais de meilleure qualité, au lieu de placer toute la base de connaissances dans le contexte.
- Utilisez le traitement par lots. Regroupez les appels indépendants afin de maintenir une faible latence et d’éviter les tempêtes de nouvelles tentatives.
La même clé permet aussi d’appeler les modèles vidéo de Google — les coûts par clip figurent dans Coûts de Veo 3, et la comparaison avec OpenAI dans Coûts de l’API OpenAI.
Questions fréquentes
L’API Gemini est-elle gratuite ?
Google AI Studio propose un niveau gratuit limité par le débit pour le prototypage. En production, vous payez par token. Kunavo fonctionne à l’usage à partir d’un rechargement minimal de 10 $ — vous payez par token aux tarifs indiqués ci-dessous, le crédit n’expire jamais et aucun compte de facturation Google Cloud n’est nécessaire.
Combien coûte Gemini 2.5 Flash ?
Chez Kunavo, Gemini 2.5 Flash coûte $0.09 par million de tokens d’entrée et $0.75 par million de tokens de sortie — environ 70 % de moins que le tarif catalogue de Google de $0.30 / $2.50. Un tour de chatbot typique (1 k d’entrée, 300 de sortie) coûte environ 0,0003 $.
Gemini est-il moins cher que Claude ou GPT ?
Gemini 2.5 Flash fait partie des modèles performants les moins chers — moins cher que Claude Haiku et que la plupart des niveaux GPT pour les gros volumes. Consultez le tableau complet sur la page des tarifs.
Comment réduire les coûts de l’API Gemini ?
Passez à Flash, limitez la sortie, réduisez le contexte récupéré et utilisez le traitement par lots. Les détails figurent dans le guide d’optimisation des coûts. Pour commencer à appeler Gemini, consultez la procédure de création d’une clé API Gemini.