Gemini offre l’un des meilleurs rapports qualité-prix parmi les modèles d’IA de pointe, et Kunavo le propose derrière une API unique compatible avec OpenAI, à environ 70 % de moins que le tarif catalogue de Google. Ce guide présente les tarifs actuels par modèle, des exemples de calcul de coûts que vous pouvez vérifier vous-même et la manière la moins chère d’appeler Gemini en production.
Les tarifs Gemini en un coup d’œil
Les tarifs sont exprimés en USD par million de tokens, tels qu’ils sont facturés sur Kunavo. La colonne « Google catalogue » indique le tarif publié par Google pour le même modèle, afin que vous puissiez voir la différence.
| Modèle | Entrée / million | Sortie / million | Catalogue Google (entrée / sortie) | Économie |
|---|---|---|---|---|
gemini-2-5-flash | $0.09 | $0.75 | $0.30 / $2.50 | ~%70 |
gemini-3-1-pro | $0.70 | $4.20 | $2.00 / $12.00 | ~%65 |
Flash est conçu pour les charges à fort volume ; Pro convient au raisonnement plus difficile, aux tâches visuelles et aux contextes très longs. Les tarifs en direct apparaissent toujours sur la page des prix et sur chaque page de modèle (gemini-2-5-flash, gemini-3-1-pro).
Comment fonctionne la tarification des tokens Gemini
Vous payez les tokens d’entrée (tout ce que vous envoyez — prompt système, contexte récupéré, message utilisateur) et les tokens de sortie (ce que le modèle produit). La sortie est la partie la plus chère ; le principal levier de votre facture Gemini est donc la quantité de texte que vous autorisez le modèle à générer. Les images et l’audio sont convertis en équivalents de tokens et facturés par le même compteur.
Exemples de calcul de coûts
Chiffres réels selon les tarifs Kunavo de Gemini 2.5 Flash, sauf la dernière ligne, qui utilise Gemini 3.1 Pro :
| Charge de travail | Tokens (entrée / sortie) | Modèle | Coût |
|---|---|---|---|
| Tour de conversation | 1.000 / 300 | Flash | $0.0003 |
| Réponse RAG | 8.000 / 500 | Flash | $0.0011 |
| Classification par lots (par document) | 500 / 20 | Flash | $0.00006 |
| Analyse de contexte long | 20.000 / 2.000 | Pro | $0.0224 |
Avec ces tarifs sur Flash, un lot de classification de 100 000 documents coûte environ $6, et un million de tours de conversation environ $315. Calcul que vous pouvez exécuter :
# Kunavo Gemini 2.5 Flash oranları (1M token başına USD)
IN_RATE, OUT_RATE = 0.09, 0.75
def cost(in_tokens: int, out_tokens: int) -> float:
return in_tokens / 1_000_000 * IN_RATE + out_tokens / 1_000_000 * OUT_RATE
print(cost(1_000, 300)) # bir sohbet turu -> $0.000315
print(cost(8_000, 500)) # bir RAG yanıtı -> $0.001095
print(cost(500, 20) * 100_000) # 100k belge yığını -> ~$6.00Tarification Kunavo et facturation Stripe
Aucun abonnement, aucun projet Google Cloud. Vous rechargez un solde (par Stripe ou un moyen de paiement local), puis les appels sont déduits de ce solde selon les tarifs par token ci-dessus. Le paiement à l’usage avec un rechargement minimum de 10 $ n’expire jamais, et les rechargements plus importants apportent des crédits bonus. Un seul solde couvre Gemini et tous les autres modèles — Claude, GPT, image, vidéo et audio — vous évitant de rapprocher une facture distincte pour chaque fournisseur.
Quel modèle Gemini dois-je choisir ?
- gemini-2-5-flash — le choix par défaut pour les conversations, l’extraction, la classification, les résumés et la plupart des cas RAG. L’option performante la plus rapide et la moins chère.
- gemini-3-1-pro — choisissez-le lorsque Flash n’est pas assez précis : raisonnement en plusieurs étapes, code, images et contexte très long.
Une bonne approche consiste à orienter les requêtes selon leur difficulté : Flash pour les cas courants, puis Pro lorsqu’un contrôle échoue. Pour le pattern d’orientation dans le code, consultez le guide d’optimisation des coûts de l’IA.
Réduire votre facture Gemini
- Descendez d’un niveau. Envoyez les 80 % de tâches simples à Flash et réservez Pro aux 20 % difficiles.
- Limitez la sortie. Définissez
max_tokenset les séquences d’arrêt — la sortie est la partie la plus chère du compteur. - Réduisez l’entrée. Récupérez moins de passages RAG, mais de meilleure qualité, au lieu de remplir le contexte avec toute la base de connaissances.
- Regroupez les lots. Regroupez les appels indépendants pour maintenir une faible latence et éviter les tempêtes de nouvelles tentatives.
FAQ
L’API Gemini est-elle gratuite ?
Google AI Studio propose un niveau gratuit limité en débit, adapté au prototypage. Pour la production, vous payez par token. Kunavo fonctionne selon un modèle à l’usage avec un rechargement minimum de 10 $ — vous payez par token aux tarifs ci-dessous, le solde n’expire jamais et aucun compte de facturation Google Cloud n’est nécessaire.
Combien coûte Gemini 2.5 Flash ?
Sur Kunavo, Gemini 2.5 Flash coûte $0.09 par million de tokens d’entrée et $0.75 par million de tokens de sortie — environ 70 % de moins que le tarif catalogue de Google de $0.30 / $2.50. Un tour de conversation typique (1 000 tokens d’entrée, 300 de sortie) coûte environ 0,0003 $.
Gemini est-il moins cher que Claude ou GPT ?
Gemini 2.5 Flash fait partie des modèles performants les moins chers disponibles — il coûte moins cher que Claude Haiku et que la plupart des niveaux GPT pour les charges à fort volume. Comparez le tableau complet sur la page des prix.
Comment réduire le coût de l’API Gemini ?
Passez à Flash, limitez la sortie, réduisez le contexte récupéré et regroupez les requêtes. Les détails figurent dans le guide d’optimisation des coûts. Pour commencer à appeler Gemini, consultez le guide obtenir une clé API Gemini.