Gemini gehört zu den preiswertesten Frontier-KIs, und Kunavo bietet es hinter einer einzigen OpenAI-kompatiblen API etwa 70 % günstiger als Googles Listenpreis an. Dieser Leitfaden zeigt die aktuellen Preise je Modell, direkt überprüfbare Beispiele zur Kostenberechnung und die günstigste Nutzung von Gemini in der Produktion.
Gemini-Preise auf einen Blick
Die Preise werden von Kunavo pro 1 Mio. Token in USD berechnet. Die Spalte „Google-Listenpreis“ zeigt zum Vergleich die von Google veröffentlichten Preise für dasselbe Modell.
| Modell | Eingabe / 1 Mio. | Ausgabe / 1 Mio. | Google-Listenpreis (Eingabe / Ausgabe) | Ersparnis |
|---|---|---|---|---|
gemini-2-5-flash | $0.09 | $0.75 | $0.30 / $2.50 | ~70% |
gemini-3-1-pro | $0.70 | $4.20 | $2.00 / $12.00 | ~65% |
Flash ist das Standardmodell für die Verarbeitung großer Mengen, während Pro für anspruchsvolleres Schlussfolgern, Vision und Aufgaben mit langem Kontext geeignet ist. Die aktuellen Preise finden Sie immer auf der Preisseite und den jeweiligen Modellseiten (gemini-2-5-flash, gemini-3-1-pro).
Wie funktionieren die Gemini-Tokenpreise?
Sie zahlen für Eingabetoken (alles, was Sie senden — System-Prompt, abgerufener Kontext, Nutzernachrichten) und Ausgabetoken (das, was das Modell erzeugt). Da die Ausgabe teurer ist, besteht der größte Hebel für Ihre Gemini-Kosten darin, wie viel das Modell schreiben darf. Bilder und Audio werden in Tokenäquivalente umgerechnet und über denselben Zähler abgerechnet.
Beispiele zur Kostenberechnung
Echte Werte, berechnet mit den Preisen von Kunavo für Gemini 2.5 Flash; nur die letzte Zeile verwendet Gemini 3.1 Pro:
| Aufgabe | Token (Eingabe / Ausgabe) | Modell | Kosten |
|---|---|---|---|
| Eine Chatbot-Runde | 1,000 / 300 | Flash | $0.0003 |
| RAG-Antwort | 8,000 / 500 | Flash | $0.0011 |
| Batch-Klassifizierung (pro Dokument) | 500 / 20 | Flash | $0.00006 |
| Analyse mit langem Kontext | 20,000 / 2,000 | Pro | $0.0224 |
Bei diesen Preisen kostet ein Batch zur Klassifizierung von 100.000 Dokumenten mit Flash etwa $6, und 1 Million Chatbot-Runden kosten etwa $315. Die direkt ausführbare Formel lautet:
# Kunavo Gemini 2.5 Flash 요율 (1M 토큰당 USD)
IN_RATE, OUT_RATE = 0.09, 0.75
def cost(in_tokens: int, out_tokens: int) -> float:
return in_tokens / 1_000_000 * IN_RATE + out_tokens / 1_000_000 * OUT_RATE
print(cost(1_000, 300)) # 챗봇 한 턴 -> $0.000315
print(cost(8_000, 500)) # RAG 답변 한 건 -> $0.001095
print(cost(500, 20) * 100_000) # 10만 건 배치 -> ~$6.00Kunavo-Preise und Stripe-Zahlungen
Es gibt weder Abonnements noch Google-Cloud-Projekte. Laden Sie Guthaben auf (über Stripe oder lokale Zahlungsmethoden), und bei jedem Aufruf wird Ihr Guthaben zu den oben genannten Tokenpreisen belastet. Laden Sie mindestens $10 auf, zahlen Sie nur für die Nutzung, das Guthaben verfällt nicht, und größere Aufladungen erhalten Bonusguthaben. Mit einem einzigen Guthaben verwenden Sie Gemini ebenso wie Claude, GPT sowie Bild-, Video- und Audiomodelle. Sie müssen daher keine separaten Anbieterrechnungen abgleichen.
Welches Gemini-Modell sollte ich wählen?
- gemini-2-5-flash — Verwenden Sie es standardmäßig für Chat, Extraktion, Klassifizierung, Zusammenfassungen und die meisten RAG-Aufgaben. Es ist die schnelle und günstigste leistungsstarke Option.
- gemini-3-1-pro — Wählen Sie dieses Modell, wenn Flash nicht genau genug ist: für mehrstufiges Schlussfolgern, Code, Vision und sehr langen Kontext.
Ein gutes Muster ist die routingbasierte Auswahl nach Schwierigkeitsgrad: Verarbeiten Sie Standardfälle mit Flash und stufen Sie nur bei fehlgeschlagener Validierung auf Pro hoch. Ein per Code implementiertes Routingmuster finden Sie im Leitfaden zur Optimierung von KI-Kosten.
Gemini-Kosten senken
- Stufen Sie herunter. Senden Sie die einfachen 80 % an Flash und sparen Sie Pro für die schwierigen 20 % auf.
- Begrenzen Sie die Ausgabe. Legen Sie
max_tokensund Abbruchsequenzen fest — die Ausgabe ist der teurere Teil des Zählers. - Reduzieren Sie die Eingabe. Füllen Sie den Kontext nicht mit der gesamten Wissensbasis, sondern rufen Sie weniger und bessere RAG-Chunks ab.
- Verarbeiten Sie im Batch. Bündeln Sie unabhängige Aufrufe, um die Latenz zu senken und eine Flut von Wiederholungsversuchen zu vermeiden.
Häufig gestellte Fragen
Ist die Gemini API kostenlos?
Google AI Studio bietet eine kostenlose Stufe für Prototyping (mit Anfragebeschränkungen). In der Produktion wird pro Token abgerechnet. Bei Kunavo zahlen Sie ab einer Mindesteinzahlung von $10 nach Verbrauch zu den unten angegebenen Tokenpreisen; das Guthaben verfällt nicht, und ein Google-Cloud-Abrechnungskonto ist nicht erforderlich.
Wie viel kostet Gemini 2.5 Flash?
Bei Kunavo kostet Gemini 2.5 Flash pro 1 Mio. Eingabe-Tokens $0.09 und pro 1 Mio. Ausgabe-Tokens $0.75; damit ist es etwa 70 % günstiger als Googles Listenpreis von $0.30 / $2.50. Eine typische Chatbot-Runde (1.000 Eingabe- und 300 Ausgabe-Tokens) kostet etwa $0,0003.
Ist Gemini günstiger als Claude oder GPT?
Gemini 2.5 Flash gehört überall zu den günstigsten leistungsstarken Modellen und liegt bei umfangreichen Aufgaben unter Claude Haiku und den meisten GPT-Klassen. Preise und Zahlungsmethoden für Claude finden Sie unter Claude-API-Preise und Zahlung; die vollständige Tabelle zum Vergleich auf der Preisseite.
Wie kann ich die Kosten der Gemini API senken?
Wechseln Sie zu Flash, begrenzen Sie die Ausgabe, reduzieren Sie den Suchkontext und verwenden Sie Batch-Verarbeitung. Details finden Sie im Leitfaden zur Kostenoptimierung. Für den Start mit Gemini-Aufrufen lesen Sie So erhalten Sie einen Gemini-API-Schlüssel.