Back to guides
Prix·July 10, 2026·8 min read

Prix de l'API Gemini 2026 — tarifs par modèle, exemples et accès moins cher

Gemini offre l'un des meilleurs rapports qualité-prix de l'IA de pointe. Voici les tarifs actuels par modèle — environ 70 % sous le prix catalogue de Google — avec des exemples de coût et la façon la moins chère d'appeler Gemini en production.

Gemini offre l'un des meilleurs rapports qualité-prix de l'IA de pointe, et Kunavo le sert environ 70 % sous le prix catalogue de Google derrière une seule API compatible OpenAI. Ce guide des prix de l'API Gemini donne les tarifs actuels par modèle, des exemples de coût que vous pouvez recalculer vous-même, et la façon la moins chère d'appeler Gemini en production.

Les prix de Gemini en un coup d'œil

Les tarifs sont en USD par million de tokens, tels que facturés par Kunavo. La colonne « prix Google » est le tarif publié par Google pour le même modèle, pour comparer directement.

ModèleInput / 1MOutput / 1MPrix Google (input / output)Économie
gemini-2-5-flash$0.09$0.75$0.30 / $2.50~70 %
gemini-2-5-pro$0.375$3.00$1.25 / $10.00~70 %

Flash est le cheval de trait pour les gros volumes ; Pro est pour le raisonnement plus difficile, la vision et le long contexte. Les tarifs en direct sont toujours sur la page des prix et sur chaque page modèle (gemini-2-5-flash, gemini-2-5-pro).

Comment fonctionne la tarification au token de Gemini

Vous payez les tokens d'input (tout ce que vous envoyez — prompt système, contexte récupéré, message utilisateur) et les tokens d'output (ce que le modèle génère). L'output est le côté cher : le plus gros levier sur une facture Gemini est donc la quantité de texte que vous laissez le modèle écrire. Les images et l'audio sont convertis en équivalents tokens et facturés sur le même compteur.

Exemples de coût détaillés

Des chiffres réels au tarif Gemini 2.5 Flash de Kunavo, sauf la dernière ligne qui utilise Gemini 2.5 Pro :

Charge de travailTokens (input / output)ModèleCoût
Tour de chatbot1 000 / 300Flash$0.0003
Réponse RAG8 000 / 500Flash$0.0011
Classification par lots (par document)500 / 20Flash$0.00006
Analyse long contexte20 000 / 2 000Pro$0.0135

À ces tarifs, un lot de classification de 100 000 documents sur Flash coûte environ $6, et un million de tours de chatbot environ $315. Le calcul, exécutable :

gemini_cout.py
# Tarifs Kunavo pour Gemini 2.5 Flash (USD par 1M de tokens)
IN_RATE, OUT_RATE = 0.09, 0.75

def cout(in_tokens: int, out_tokens: int) -> float:
    return in_tokens / 1_000_000 * IN_RATE + out_tokens / 1_000_000 * OUT_RATE

print(cout(1_000, 300))            # un tour de chatbot     -> $0.000315
print(cout(8_000, 500))            # une réponse RAG        -> $0.001095
print(cout(500, 20) * 100_000)     # lot de 100k documents  -> ~$6.00

Tarification Kunavo et facturation via Stripe

Pas d'abonnement, pas de projet Google Cloud. Vous rechargez un solde (CB, prélèvement SEPA, Apple Pay, Google Pay), et les appels sont décomptés aux tarifs au token ci-dessus. Pay-as-you-go à partir d'une recharge minimum de $5, le solde n'expire jamais, et les recharges plus importantes donnent du crédit bonus. Les prix sont en USD, convertis en EUR par Stripe au checkout ; en B2B, l'autoliquidation s'applique avec un numéro de TVA intracommunautaire. Un seul solde couvre Gemini et tous les autres modèles — Claude, GPT, image, vidéo, audio — sans factures à réconcilier par fournisseur.

Quel modèle Gemini choisir ?

  • gemini-2-5-flash — le choix par défaut pour le chat, l'extraction, la classification, le résumé et l'essentiel du RAG. Rapide, et l'option capable la moins chère.
  • gemini-2-5-pro — quand Flash n'est pas assez précis : raisonnement multi-étapes, code, vision et très long contexte.

Un bon pattern est le routage par difficulté : Flash par défaut, et montée vers Pro seulement quand une vérification échoue. L'approche en code est dans le guide d'optimisation des coûts IA.

Comment réduire votre facture Gemini

  1. Descendez de gamme. Envoyez les 80 % de tâches simples vers Flash ; réservez Pro aux 20 % difficiles.
  2. Plafonnez l'output. Fixez max_tokens et des séquences d'arrêt — l'output est le côté cher du compteur.
  3. Allégez l'input. Récupérez des chunks RAG moins nombreux et plus pertinents au lieu d'entasser toute la base de connaissances dans le contexte.
  4. Regroupez. Mettez en lots les appels indépendants pour garder la latence basse et éviter les tempêtes de retries.

FAQ

L'API Gemini est-elle gratuite ?

Google AI Studio offre un niveau gratuit limité en débit pour le prototypage ; en production, on paie au token. Kunavo est en pay-as-you-go dès $5 de recharge — vous payez les tarifs ci-dessus, le solde n'expire jamais et aucun compte de facturation Google Cloud n'est requis.

Combien coûte Gemini 2.5 Flash ?

$0.09 par 1M de tokens d'input et $0.75 par 1M de tokens d'output sur Kunavo — environ 70 % sous le prix catalogue Google de $0.30 / $2.50. Un tour de chatbot typique coûte environ $0.0003.

Gemini est-il moins cher que Claude ou GPT ?

Gemini 2.5 Flash est l'un des modèles capables les moins chers du marché — sous Claude Haiku et la plupart des niveaux GPT à volume élevé. Comparez le tableau complet sur la page des prix, et les tarifs Claude dans le guide des prix de l'API Claude.

Comment réduire le coût de l'API Gemini ?

Descente vers Flash, plafonnement de l'output, contexte récupéré plus léger, et traitement par lots. Les détails sont dans le guide d'optimisation des coûts. Pour commencer à appeler Gemini, voyez comment obtenir une clé API Gemini.