Gemini offre l'un des meilleurs rapports qualité-prix de l'IA de pointe, et Kunavo le sert environ 70 % sous le prix catalogue de Google derrière une seule API compatible OpenAI. Ce guide des prix de l'API Gemini donne les tarifs actuels par modèle, des exemples de coût que vous pouvez recalculer vous-même, et la façon la moins chère d'appeler Gemini en production.
Les prix de Gemini en un coup d'œil
Les tarifs sont en USD par million de tokens, tels que facturés par Kunavo. La colonne « prix Google » est le tarif publié par Google pour le même modèle, pour comparer directement.
| Modèle | Input / 1M | Output / 1M | Prix Google (input / output) | Économie |
|---|---|---|---|---|
gemini-2-5-flash | $0.09 | $0.75 | $0.30 / $2.50 | ~70 % |
gemini-2-5-pro | $0.375 | $3.00 | $1.25 / $10.00 | ~70 % |
Flash est le cheval de trait pour les gros volumes ; Pro est pour le raisonnement plus difficile, la vision et le long contexte. Les tarifs en direct sont toujours sur la page des prix et sur chaque page modèle (gemini-2-5-flash, gemini-2-5-pro).
Comment fonctionne la tarification au token de Gemini
Vous payez les tokens d'input (tout ce que vous envoyez — prompt système, contexte récupéré, message utilisateur) et les tokens d'output (ce que le modèle génère). L'output est le côté cher : le plus gros levier sur une facture Gemini est donc la quantité de texte que vous laissez le modèle écrire. Les images et l'audio sont convertis en équivalents tokens et facturés sur le même compteur.
Exemples de coût détaillés
Des chiffres réels au tarif Gemini 2.5 Flash de Kunavo, sauf la dernière ligne qui utilise Gemini 2.5 Pro :
| Charge de travail | Tokens (input / output) | Modèle | Coût |
|---|---|---|---|
| Tour de chatbot | 1 000 / 300 | Flash | $0.0003 |
| Réponse RAG | 8 000 / 500 | Flash | $0.0011 |
| Classification par lots (par document) | 500 / 20 | Flash | $0.00006 |
| Analyse long contexte | 20 000 / 2 000 | Pro | $0.0135 |
À ces tarifs, un lot de classification de 100 000 documents sur Flash coûte environ $6, et un million de tours de chatbot environ $315. Le calcul, exécutable :
# Tarifs Kunavo pour Gemini 2.5 Flash (USD par 1M de tokens)
IN_RATE, OUT_RATE = 0.09, 0.75
def cout(in_tokens: int, out_tokens: int) -> float:
return in_tokens / 1_000_000 * IN_RATE + out_tokens / 1_000_000 * OUT_RATE
print(cout(1_000, 300)) # un tour de chatbot -> $0.000315
print(cout(8_000, 500)) # une réponse RAG -> $0.001095
print(cout(500, 20) * 100_000) # lot de 100k documents -> ~$6.00Tarification Kunavo et facturation via Stripe
Pas d'abonnement, pas de projet Google Cloud. Vous rechargez un solde (CB, prélèvement SEPA, Apple Pay, Google Pay), et les appels sont décomptés aux tarifs au token ci-dessus. Pay-as-you-go à partir d'une recharge minimum de $5, le solde n'expire jamais, et les recharges plus importantes donnent du crédit bonus. Les prix sont en USD, convertis en EUR par Stripe au checkout ; en B2B, l'autoliquidation s'applique avec un numéro de TVA intracommunautaire. Un seul solde couvre Gemini et tous les autres modèles — Claude, GPT, image, vidéo, audio — sans factures à réconcilier par fournisseur.
Quel modèle Gemini choisir ?
- gemini-2-5-flash — le choix par défaut pour le chat, l'extraction, la classification, le résumé et l'essentiel du RAG. Rapide, et l'option capable la moins chère.
- gemini-2-5-pro — quand Flash n'est pas assez précis : raisonnement multi-étapes, code, vision et très long contexte.
Un bon pattern est le routage par difficulté : Flash par défaut, et montée vers Pro seulement quand une vérification échoue. L'approche en code est dans le guide d'optimisation des coûts IA.
Comment réduire votre facture Gemini
- Descendez de gamme. Envoyez les 80 % de tâches simples vers Flash ; réservez Pro aux 20 % difficiles.
- Plafonnez l'output. Fixez
max_tokenset des séquences d'arrêt — l'output est le côté cher du compteur. - Allégez l'input. Récupérez des chunks RAG moins nombreux et plus pertinents au lieu d'entasser toute la base de connaissances dans le contexte.
- Regroupez. Mettez en lots les appels indépendants pour garder la latence basse et éviter les tempêtes de retries.
FAQ
L'API Gemini est-elle gratuite ?
Google AI Studio offre un niveau gratuit limité en débit pour le prototypage ; en production, on paie au token. Kunavo est en pay-as-you-go dès $5 de recharge — vous payez les tarifs ci-dessus, le solde n'expire jamais et aucun compte de facturation Google Cloud n'est requis.
Combien coûte Gemini 2.5 Flash ?
$0.09 par 1M de tokens d'input et $0.75 par 1M de tokens d'output sur Kunavo — environ 70 % sous le prix catalogue Google de $0.30 / $2.50. Un tour de chatbot typique coûte environ $0.0003.
Gemini est-il moins cher que Claude ou GPT ?
Gemini 2.5 Flash est l'un des modèles capables les moins chers du marché — sous Claude Haiku et la plupart des niveaux GPT à volume élevé. Comparez le tableau complet sur la page des prix, et les tarifs Claude dans le guide des prix de l'API Claude.
Comment réduire le coût de l'API Gemini ?
Descente vers Flash, plafonnement de l'output, contexte récupéré plus léger, et traitement par lots. Les détails sont dans le guide d'optimisation des coûts. Pour commencer à appeler Gemini, voyez comment obtenir une clé API Gemini.