Zurück zu den Leitfäden
Preise·10. Juli 2026·Aktualisiert am 3. Oktober 2026·8 Min. Lesezeit

Gemini-API-Preise 2026 — Tarife nach Modell, Beispiele und günstigerer Zugriff

Gemini bietet eines der besten Preis-Leistungs-Verhältnisse bei führender KI. Hier sind die aktuellen Preise pro Modell — je nach Modell 30 bis 70 % unter Googles Listenpreis — mit Kostenbeispielen und der günstigsten Möglichkeit, Gemini in der Produktion aufzurufen.

Gemini bietet eines der besten Preis-Leistungs-Verhältnisse unter den fortschrittlichsten KI-Modellen, und Kunavo stellt es etwa 70 % unter Googles Listenpreis über eine einzige OpenAI-kompatible API bereit. Dieser Leitfaden zu den Preisen der Gemini API enthält die aktuellen Preise je Modell, Kostenbeispiele zum eigenen Nachrechnen und die günstigste Möglichkeit, Gemini in der Produktion aufzurufen.

Gemini-Preise auf einen Blick

Die Preise sind USD pro Million Tokens, wie sie von Kunavo berechnet werden. Die Spalte „Google-Preis“ zeigt den von Google veröffentlichten Preis für dasselbe Modell zum direkten Vergleich.

ModellEingabe / 1 Mio.Ausgabe / 1 Mio.Google-Preis (Eingabe / Ausgabe)Ersparnis
gemini-2-5-flash$0.09$0.75$0.30 / $2.50~70 %
gemini-3-1-pro$0.70$4.20$2.00 / $12.00~65 %

Flash ist das Arbeitspferd für große Mengen; Pro ist für anspruchsvolleres Reasoning, Vision und lange Kontexte gedacht. Die aktuellen Preise finden Sie immer auf der Preisseite und auf jeder Modellseite (gemini-2-5-flash, gemini-3-1-pro).

Wie die Gemini-Tokenpreise funktionieren

Sie zahlen für Eingabetokens (alles, was Sie senden — System-Prompt, abgerufener Kontext, Nutzernachricht) und Ausgabetokens (alles, was das Modell erzeugt). Die Ausgabe ist der teure Teil: Der größte Hebel bei einer Gemini-Rechnung ist daher die Textmenge, die Sie das Modell schreiben lassen. Bilder und Audio werden in Tokenäquivalente umgewandelt und über denselben Zähler abgerechnet.

Detaillierte Kostenbeispiele

Reale Zahlen zum Kunavo-Preis für Gemini 2.5 Flash, außer in der letzten Zeile, die Gemini 3.1 Pro verwendet:

WorkloadTokens (Eingabe / Ausgabe)ModellKosten
Chatbot-Turn1 000 / 300Flash$0.0003
RAG-Antwort8 000 / 500Flash$0.0011
Batch-Klassifizierung (pro Dokument)500 / 20Flash$0.00006
Analyse eines langen Kontexts20 000 / 2 000Pro$0.0224

Zu diesen Preisen kostet ein Klassifizierungsbatch mit 100.000 Dokumenten auf Flash etwa $6 und eine Million Chatbot-Turns etwa $315. Die ausführbare Berechnung lautet:

gemini_cout.py
# Tarifs Kunavo pour Gemini 2.5 Flash (USD par 1M de tokens)
IN_RATE, OUT_RATE = 0.09, 0.75

def cout(in_tokens: int, out_tokens: int) -> float:
    return in_tokens / 1_000_000 * IN_RATE + out_tokens / 1_000_000 * OUT_RATE

print(cout(1_000, 300))            # un tour de chatbot     -> $0.000315
print(cout(8_000, 500))            # une réponse RAG        -> $0.001095
print(cout(500, 20) * 100_000)     # lot de 100k documents  -> ~$6.00

Kunavo-Preise und Abrechnung über Stripe

Kein Abonnement, kein Google-Cloud-Projekt. Sie laden Guthaben auf (Kreditkarte, Apple Pay, Google Pay, Link), und die Aufrufe werden zu den oben genannten Tokenpreisen abgerechnet. Pay-as-you-go ab einer Mindestaufladung von $10; das Guthaben verfällt nie, und größere Aufladungen gewähren Bonusguthaben. Die Preise sind in USD angegeben und werden beim Checkout von Stripe in EUR umgerechnet (der Wechselkurs enthält eine von Ihnen zu tragende Umrechnungsgebühr von 2 bis 4 %; eine Zahlung in USD vermeidet diese Gebühr). Im B2B-Bereich gilt bei Angabe einer innergemeinschaftlichen Umsatzsteuer-Identifikationsnummer das Reverse-Charge-Verfahren. Ein einziges Guthaben deckt Gemini und alle anderen Modelle ab – Claude, GPT, Bild, Video und Audio – ohne dass Rechnungen verschiedener Anbieter abgeglichen werden müssen.

Welches Gemini-Modell sollte ich wählen?

  • gemini-2-5-flash — die Standardwahl für Chat, Extraktion, Klassifizierung, Zusammenfassung und den Großteil von RAG. Schnell und die günstigste leistungsfähige Option.
  • gemini-3-1-pro — wenn Flash nicht präzise genug ist: mehrstufiges Reasoning, Code, Vision und sehr lange Kontexte.

Ein gutes Muster ist das Routing nach Schwierigkeit: Flash standardmäßig und nur dann auf Pro hochstufen, wenn eine Prüfung fehlschlägt. Die Umsetzung im Code steht im Leitfaden zur Optimierung der KI-Kosten.

So senken Sie Ihre Gemini-Rechnung

  1. Wechseln Sie zu einer niedrigeren Stufe. Leiten Sie 80 % der einfachen Aufgaben an Flash weiter und reservieren Sie Pro für die 20 % schwierigen Aufgaben.
  2. Begrenzen Sie die Ausgabe. Legen Sie max_tokens und Stoppsequenzen fest — die Ausgabe ist der teure Teil des Zählers.
  3. Reduzieren Sie die Eingabe. Rufen Sie weniger und relevantere RAG-Chunks ab, statt die gesamte Wissensbasis in den Kontext zu laden.
  4. Bündeln Sie Aufrufe. Fassen Sie unabhängige Aufrufe in Batches zusammen, um die Latenz niedrig zu halten und Retry-Stürme zu vermeiden.

Mit demselben Schlüssel können Sie auch Googles Videomodelle aufrufen — der Preis pro Clip ist unter Preise für Veo 3 aufgeführt.

Häufig gestellte Fragen

Ist die Gemini API kostenlos?

Google AI Studio bietet für das Prototyping eine kostenlose, durch das Kontingent begrenzte Stufe. In der Produktion zahlen Sie pro Token. Kunavo arbeitet nach dem Pay-as-you-go-Modell ab einer Mindestaufladung von $10 — Sie zahlen die unten angegebenen Tokenpreise, das Guthaben verfällt nie und ein Google-Cloud-Abrechnungskonto ist nicht erforderlich.

Wie viel kostet Gemini 2.5 Flash?

Bei Kunavo kostet Gemini 2.5 Flash $0.09 pro 1 Mio. Eingabetokens und $0.75 pro 1 Mio. Ausgabetokens — etwa 70 % unter Googles Listenpreis ($0.30 / $2.50). Ein typischer Chatbot-Turn (1K Eingabe, 300 Ausgabe) kostet ungefähr $0.0003.

Ist Gemini günstiger als Claude oder GPT?

Gemini 2.5 Flash gehört zu den günstigsten leistungsfähigen Modellen auf dem Markt — günstiger als Claude Haiku und die meisten GPT-Stufen bei hohem Volumen. Vergleichen Sie die vollständige Tabelle auf der Preisseite und die Claude-Preise im Leitfaden zu den Preisen der Claude API.

Wie kann ich die Kosten der Gemini API senken?

Wechsel zu Flash, Begrenzung der Ausgabe, ein kleinerer abgerufener Kontext und Batch-Verarbeitung. Details finden Sie im Leitfaden zur Kostenoptimierung. Wie Sie mit Aufrufen von Gemini beginnen, erfahren Sie unter Gemini-API-Schlüssel erhalten.