Gemini fait partie des meilleures offres de l’IA de pointe, et Kunavo le propose à un tarif environ 70 % inférieur au tarif officiel de Google via une seule API compatible avec OpenAI. Ce guide fournit les tarifs actuels par modèle, des exemples de coûts que vous pouvez vérifier vous-même et la manière la moins chère d’appeler Gemini en production.
Tarifs de l’API Gemini en un coup d’œil
Tarifs par million de tokens, en USD, tels qu’ils sont calculés sur Kunavo. La colonne « Tarif catalogue Google » indique le prix publié par Google pour le même modèle, afin de rendre l’écart visible.
| Modèle | Entrée / million | Sortie / million | Tarif catalogue Google (entrée / sortie) | Votre économie |
|---|---|---|---|---|
gemini-2-5-flash | $0.09 | $0.75 | $0.30 / $2.50 | ~70% |
gemini-3-1-pro | $0.70 | $4.20 | $2.00 / $12.00 | ~65% |
Flash est le « cheval de bataille » des gros volumes ; Pro est destiné au raisonnement plus difficile, à la vision et aux tâches avec un long contexte. Les tarifs directs sont toujours affichés sur la page des tarifs et sur la page de chaque modèle (gemini-2-5-flash, gemini-3-1-pro).
Comment fonctionne la tarification de Gemini au token
Vous payez les tokens d’entrée (tout ce que vous envoyez — prompt système, contexte récupéré, messages utilisateur) et les tokens de sortie (ce que le modèle génère). La sortie est la partie la plus chère ; le principal levier sur votre facture Gemini est donc la quantité de texte que vous laissez écrire au modèle. Les images et l’audio sont convertis en tokens équivalents et facturés selon le même compteur.
Exemples de coûts pré-calculés
Chiffres réels selon les tarifs Kunavo de Gemini 2.5 Flash ; la dernière ligne utilise Gemini 3.1 Pro :
| Charge de travail | Tokens (entrée / sortie) | Modèle | Coût |
|---|---|---|---|
| Tour de chatbot | 1.000 / 300 | Flash | $0.0003 |
| Réponse RAG | 8.000 / 500 | Flash | $0.0011 |
| Classification par lots (par document) | 500 / 20 | Flash | $0.00006 |
| Analyse d’un long contexte | 20.000 / 2.000 | Pro | $0.0224 |
À ces tarifs, classifier un lot de 100 000 documents avec Flash coûte environ $6, et un million d’échanges avec un chatbot environ $315. Le calcul, prêt à être exécuté :
# Mức giá Kunavo cho Gemini 2.5 Flash (USD trên mỗi 1 triệu token)
IN_RATE, OUT_RATE = 0.09, 0.75
def chi_phi(token_vao: int, token_ra: int) -> float:
return token_vao / 1_000_000 * IN_RATE + token_ra / 1_000_000 * OUT_RATE
print(chi_phi(1_000, 300)) # một lượt chatbot -> $0.000315
print(chi_phi(8_000, 500)) # một câu trả lời RAG -> $0.001095
print(chi_phi(500, 20) * 100_000) # lô 100k tài liệu -> ~$6.00Tarifs Kunavo et paiements via Stripe
Il n’y a ni abonnement ni projet Google Cloud. Vous rechargez votre portefeuille (Stripe ou des moyens de paiement locaux), puis chaque appel en est débité selon les tarifs au token ci-dessus. Payez à l’usage à partir d’un rechargement minimum de 10 $ ; votre solde n’expire jamais et les rechargements plus importants donnent droit à des crédits bonus. Un seul portefeuille couvre Gemini et tous les autres modèles — Claude, GPT, image, vidéo et audio — vous n’avez donc pas à rapprocher une facture distincte pour chaque fournisseur.
Quel modèle Gemini dois-je choisir ?
- gemini-2-5-flash — le choix par défaut pour le chat, l’extraction, la classification, les résumés et la plupart des cas RAG. Rapide et suffisamment puissant, c’est l’option la moins chère.
- gemini-3-1-pro — utilisez-le lorsque Flash n’est pas assez précis : raisonnement en plusieurs étapes, programmation, vision et contextes très longs.
Un bon principe consiste à router selon la difficulté : Flash pour les cas courants, et Pro uniquement lorsqu’une étape de contrôle échoue. Consultez le guide d’optimisation des coûts de l’IA pour voir le modèle de routage dans le code.
Réduire votre facture Gemini
- Passez à un niveau inférieur. Envoyez 80 % des tâches faciles vers Flash ; réservez Pro aux 20 % les plus difficiles.
- Limitez la sortie. Définissez
max_tokenset une séquence d’arrêt — la sortie est la partie la plus coûteuse du compteur. - Rationalisez les entrées. Récupérez moins de passages RAG, mais de meilleure qualité, au lieu de faire entrer toute la base de connaissances dans le contexte.
- Regroupez les lots. Regroupez les appels indépendants pour maintenir une faible latence et éviter les tempêtes de nouvelles tentatives.
Questions fréquentes
L’API Gemini est-elle gratuite ?
Google AI Studio propose un niveau gratuit avec une limite de débit, adapté au prototypage. En production, vous payez au token. Kunavo fonctionne à l’usage à partir d’un rechargement minimum de 10 $ — vous payez par token selon les tarifs ci-dessous, votre solde n’expire jamais et aucun compte de facturation Google Cloud n’est nécessaire.
Combien coûte Gemini 2.5 Flash ?
Sur Kunavo, Gemini 2.5 Flash coûte $0.09 par million de tokens d’entrée et $0.75 par million de tokens de sortie — environ 70 % de moins que le tarif officiel de Google, $0.30 / $2.50. Un échange classique avec un chatbot (1 000 tokens en entrée, 300 en sortie) coûte environ 0,0003 $.
Gemini est-il moins cher que Claude ou GPT ?
Gemini 2.5 Flash est l’un des modèles suffisamment puissants les moins chers du marché — moins cher que Claude Haiku et que la plupart des niveaux GPT pour les volumes importants. Comparez le tableau complet sur la page des tarifs.
Comment réduire le coût de l’API Gemini ?
Passez à Flash, limitez la sortie, réduisez le contexte récupéré et regroupez les requêtes. Les détails figurent dans le guide d’optimisation des coûts. Pour commencer à appeler Gemini, consultez comment obtenir une clé API Gemini.