Gemini fait partie des options offrant le meilleur rapport qualité-prix parmi les modèles d’IA de pointe, et Kunavo le propose à environ 70 % sous le prix catalogue officiel de Google derrière une API unique compatible avec OpenAI. Ce guide contient les tarifs actuels par modèle, des exemples de coûts que vous pouvez vérifier vous-même et la manière la moins chère d’appeler Gemini en production.
Tarifs de l’API Gemini en un coup d’œil
Les tarifs sont calculés par 1 M de tokens, en USD, tels qu’ils sont facturés par Kunavo. La colonne « Prix catalogue Google » indique le tarif officiel publié par Google pour le même modèle, afin que vous puissiez voir la différence.
| Modèle | Entrée / 1 M | Sortie / 1 M | Liste Google (entrée / sortie) | Vous économisez |
|---|---|---|---|---|
gemini-2-5-flash | $0.09 | $0.75 | $0.30 / $2.50 | ~70% |
gemini-3-1-pro | $0.70 | $4.20 | $2.00 / $12.00 | ~65% |
Flash est le modèle de référence pour les volumes élevés ; Pro est destiné au raisonnement plus complexe, à la vision et aux tâches nécessitant un contexte long. Les tarifs en temps réel sont toujours affichés sur la page des tarifs et sur la page de chaque modèle (gemini-2-5-flash, gemini-3-1-pro).
Comment fonctionne la tarification de Gemini par token
Vous payez les tokens d’entrée (tout ce que vous envoyez — prompt système, contexte issu de la recherche, messages utilisateur) et les tokens de sortie (ce que le modèle génère). La sortie est la partie la plus coûteuse ; le principal levier sur votre facture Gemini est donc la quantité de texte que vous laissez le modèle rédiger. Les images et l’audio sont convertis en équivalents de tokens et facturés sur le même compteur.
Exemples de calcul des coûts
Chiffres réels aux tarifs de Gemini 2.5 Flash chez Kunavo, sauf la dernière ligne qui utilise Gemini 3.1 Pro :
| Charge de travail | Tokens (entrée / sortie) | Modèle | Coût |
|---|---|---|---|
| Tour de chatbot | 1.000 / 300 | Flash | $0.0003 |
| Réponse RAG | 8.000 / 500 | Flash | $0.0011 |
| Classification par lots (par document) | 500 / 20 | Flash | $0.00006 |
| Analyse de contexte long | 20.000 / 2.000 | Pro | $0.0224 |
À ces tarifs, un lot de classification de 100 000 documents avec Flash coûte environ $6, et un million de tours de chatbot environ $315. Le calcul, prêt à être exécuté :
# Tarif Kunavo untuk Gemini 2.5 Flash (USD per 1J token)
IN_RATE, OUT_RATE = 0.09, 0.75
def biaya(token_masuk: int, token_keluar: int) -> float:
return token_masuk / 1_000_000 * IN_RATE + token_keluar / 1_000_000 * OUT_RATE
print(biaya(1_000, 300)) # satu putaran chatbot -> $0.000315
print(biaya(8_000, 500)) # satu jawaban RAG -> $0.001095
print(biaya(500, 20) * 100_000) # batch 100rb dokumen -> ~$6.00Tarifs Kunavo et facturation via Stripe
Il n’y a ni abonnement ni projet Google Cloud. Vous ajoutez un solde à un portefeuille (Stripe ou méthodes de paiement locales), et chaque appel débite ce solde aux tarifs par token indiqués ci-dessus. Le paiement à l’usage commence par un rechargement minimum de 10 $, le solde n’expire jamais et les rechargements plus importants donnent droit à un crédit bonus. Un seul portefeuille couvre Gemini et tous les autres modèles — Claude, GPT, images, vidéo et audio — vous n’avez donc pas à rapprocher des factures distinctes par fournisseur.
Quel modèle Gemini dois-je choisir ?
- gemini-2-5-flash — le choix par défaut pour le chat, l’extraction, la classification, la synthèse et la plupart des cas d’utilisation RAG. Rapide et l’option performante la moins chère.
- gemini-3-1-pro — utilisez-le lorsque Flash manque de précision : raisonnement en plusieurs étapes, code, vision et contexte très long.
Une bonne approche consiste à router les requêtes selon leur difficulté : Flash pour les cas courants, et Pro uniquement lorsqu’un contrôle échoue. Consultez le guide d’optimisation des coûts de l’IA pour découvrir le modèle de routage à utiliser dans votre code.
Comment réduire votre facture Gemini
- Passez à un niveau inférieur. Envoyez les 80 % de tâches faciles à Flash ; réservez Pro aux 20 % de tâches difficiles.
- Limitez la sortie. Définissez
max_tokenset des séquences d’arrêt — la sortie est la partie coûteuse du compteur. - Allégez l’entrée. Récupérez moins d’extraits RAG, mais de meilleure qualité, au lieu d’insérer toute votre base de connaissances dans le contexte.
- Traitez par lots. Regroupez les appels indépendants afin de maintenir une faible latence et d’éviter les tempêtes de nouvelles tentatives.
Questions fréquentes
L’API Gemini est-elle gratuite ?
Google AI Studio propose un niveau gratuit limité en débit, adapté au prototypage. Pour la production, vous payez par token. Kunavo fonctionne selon un modèle à l’usage à partir d’un rechargement minimum de 10 $ — vous payez par token aux tarifs ci-dessous, le solde n’expire jamais et aucun compte de facturation Google Cloud n’est nécessaire.
Combien coûte Gemini 2.5 Flash ?
Sur Kunavo, Gemini 2.5 Flash coûte $0.09 par million de tokens d’entrée et $0.75 par million de tokens de sortie — environ 70 % sous le prix catalogue officiel de Google de $0.30 / $2.50. Un tour de chatbot typique (1 000 tokens d’entrée, 300 de sortie) coûte environ 0,0003 $.
Gemini est-il moins cher que Claude ou GPT ?
Gemini 2.5 Flash fait partie des modèles performants les moins chers disponibles — il coûte moins cher que Claude Haiku et que la plupart des niveaux GPT pour les charges à fort volume. Comparez le tableau complet sur la page des prix.
Comment réduire le coût de l’API Gemini ?
Utilisez Flash, limitez la sortie, réduisez le contexte récupéré et regroupez les requêtes. Les détails figurent dans le guide d’optimisation des coûts. Pour commencer à appeler Gemini, consultez le guide obtenir une clé API Gemini.