Gemini gehört bei Frontier-KI zu den besten Optionen für Preis und Leistung, und Kunavo bietet es hinter einer einzigen OpenAI-kompatiblen API für etwa 70 % unter Googles Listenpreis an. Dieser Leitfaden enthält aktuelle Preise nach Modell, Beispielrechnungen, die du selbst überprüfen kannst, und den günstigsten Weg, Gemini in der Produktion aufzurufen.
Gemini-Preise auf einen Blick
Die Tarife werden so angegeben, wie sie bei Kunavo berechnet werden: pro 1 Mio. Token und in USD. Die Spalte „Google-Listenpreis“ zeigt den von Google veröffentlichten Tarif für dasselbe Modell, damit du den Unterschied sehen kannst.
| Modell | Eingabe / 1 Mio. | Ausgabe / 1 Mio. | Google-Listenpreis (Eingabe / Ausgabe) | Ersparnis |
|---|---|---|---|---|
gemini-2-5-flash | $0.09 | $0.75 | $0.30 / $2.50 | ~%70 |
gemini-3-1-pro | $0.70 | $4.20 | $2.00 / $12.00 | ~%65 |
Flash ist das Arbeitspferd für hohe Volumen; Pro ist für anspruchsvolleres Schlussfolgern, visuelle Aufgaben und lange Kontexte gedacht. Die aktuellen Tarife werden immer auf der Preisseite und auf der Seite jedes Modells angezeigt (gemini-2-5-flash, gemini-3-1-pro).
So funktioniert die Gemini-Tokenpreisgestaltung
Du zahlst für Eingabe-Token (alles, was du sendest — System-Prompt, abgerufener Kontext, Nutzernachrichten) und Ausgabe-Token (das vom Modell Erzeugte). Die Ausgabe ist der teurere Teil. Der größte einzelne Hebel für deine Gemini-Rechnung ist daher, wie viel Text du das Modell schreiben lässt. Bilder und Audio werden in Token-Äquivalente umgerechnet und über denselben Zähler abgerechnet.
Beispielkostenberechnungen
Konkrete Zahlen mit Kunavos Tarif für Gemini 2.5 Flash; die letzte Zeile verwendet Gemini 3.1 Pro:
| Arbeitslast | Token (Eingabe / Ausgabe) | Modell | Kosten |
|---|---|---|---|
| Chat-Runde | 1.000 / 300 | Flash | $0.0003 |
| RAG-Antwort | 8.000 / 500 | Flash | $0.0011 |
| Batch-Klassifizierung (pro Dokument) | 500 / 20 | Flash | $0.00006 |
| Analyse langer Kontexte | 20.000 / 2.000 | Pro | $0.0224 |
Bei diesen Tarifen kostet ein Klassifizierungs-Batch mit 100.000 Dokumenten auf Flash etwa $6, eine Million Chat-Runden etwa $315. Ausführbare Mathematik:
# Kunavo Gemini 2.5 Flash oranları (1M token başına USD)
IN_RATE, OUT_RATE = 0.09, 0.75
def cost(in_tokens: int, out_tokens: int) -> float:
return in_tokens / 1_000_000 * IN_RATE + out_tokens / 1_000_000 * OUT_RATE
print(cost(1_000, 300)) # bir sohbet turu -> $0.000315
print(cost(8_000, 500)) # bir RAG yanıtı -> $0.001095
print(cost(500, 20) * 100_000) # 100k belge yığını -> ~$6.00Kunavo-Preise und Stripe-Abrechnung
Keine Abonnements, kein Google-Cloud-Projekt. Du lädst Guthaben auf (über Stripe oder lokale Zahlungsmethoden), und die Aufrufe werden anhand der oben genannten Tokenpreise von diesem Guthaben abgezogen. Pay-as-you-go ab einer Mindestaufladung von $10; das Guthaben verfällt nie, und größere Aufladungen bringen Bonusguthaben. Ein einziges Guthaben deckt Gemini und alle anderen Modelle ab — Claude, GPT, Bild, Video und Audio — sodass du keine separate Rechnung pro Anbieter abgleichen musst.
Welches Gemini-Modell sollte ich wählen?
- gemini-2-5-flash — Standard für Chat, Extraktion, Klassifizierung, Zusammenfassungen und den Großteil von RAG. Schnell und die günstigste leistungsfähige Option.
- gemini-3-1-pro — verwende es, wenn Flash nicht genau genug ist: mehrstufiges Schlussfolgern, Programmierung, visuelle Aufgaben und sehr lange Kontexte.
Ein gutes Muster ist Routing nach Schwierigkeit: Flash für häufige Fälle und ein Upgrade auf Pro, wenn eine Prüfung fehlschlägt. Das Routing-Muster im Code findest du im Leitfaden zur Optimierung von KI-Kosten.
Deine Gemini-Rechnung senken
- Auf eine niedrigere Stufe wechseln. Leite die einfachen 80 % an Flash weiter und reserviere Pro für die schwierigen 20 %.
- Ausgabe begrenzen. Setze
max_tokensund Stop-Sequenzen — die Ausgabe ist der teure Teil des Zählers. - Eingabe kürzen. Rufe weniger, aber bessere RAG-Abschnitte ab, statt die gesamte Wissensbasis in den Kontext zu laden.
- Batches bilden. Bündele unabhängige Aufrufe, um die Latenz niedrig zu halten und Retry-Stürme zu vermeiden.
FAQ
Ist die Gemini API kostenlos?
Google AI Studio bietet für Prototyping eine kostenlose, ratenbegrenzte Stufe. Für die Produktion zahlst du pro Token. Kunavo arbeitet nach dem Pay-as-you-go-Modell mit einer Mindestaufladung von $10 — du zahlst pro Token gemäß den untenstehenden Tarifen, das Guthaben verfällt nie, und ein Google-Cloud-Abrechnungskonto ist nicht erforderlich.
Wie viel kostet Gemini 2.5 Flash?
Bei Kunavo kostet Gemini 2.5 Flash $0.09 pro 1 Mio. Eingabe-Token und $0.75 pro 1 Mio. Ausgabe-Token — etwa 70 % unter Googles Listenpreis von $0.30 / $2.50. Eine typische Chat-Runde (1K Eingabe, 300 Ausgabe) kostet etwa $0.0003.
Ist Gemini günstiger als Claude oder GPT?
Gemini 2.5 Flash gehört zu den günstigsten leistungsfähigen Modellen überhaupt — bei hohen Volumen liegt es unter Claude Haiku und den meisten GPT-Stufen. Vergleiche die vollständige Tabelle auf der Preisseite.
Wie senke ich die Kosten der Gemini API?
Wechsle zu Flash, begrenze die Ausgabe, kürze den abgerufenen Kontext und bilde Batches. Einzelheiten findest du im Leitfaden zur Kostenoptimierung. Um mit Aufrufen an Gemini zu beginnen, siehe den Leitfaden Gemini-API-Schlüssel erhalten.