Zurück zu den Leitfäden
Preis·18. Juni 2026·Aktualisiert am 12. September 2026·8 Min. Lesezeit

Gemini-API-Preise 2026 – Kosten pro Modell, Beispiele und günstigerer kompatibler OpenAI-Zugriff

Gemini gehört zu den preiswertesten führenden KI-Modellen. Hier finden Sie die aktuellen Preise pro Modell – etwa 70 % unter Googles Listenpreisen –, Kostenbeispiele und die günstigste Möglichkeit, Gemini in der Produktion aufzurufen.

Gemini gehört zu den preiswertesten führenden KI-Modellen, und Kunavo bietet es über eine einzige OpenAI-kompatible API zu einem Preis an, der etwa 70% unter Googles offiziellem Listenpreis liegt. Dieser Leitfaden enthält aktuelle Preise für jedes Modell, nachvollziehbare Kostenbeispiele und die günstigste Möglichkeit, Gemini in der Produktion aufzurufen.

Gemini-API-Preise auf einen Blick

Preise pro 1 Million Token in USD, genau wie bei Kunavo berechnet. Die Spalte „Google-Listenpreis“ zeigt den von Google veröffentlichten Preis für dasselbe Modell, damit du den Unterschied siehst.

ModellEingabe / 1 MillionAusgabe / 1 MillionGoogle-Listenpreis (Eingabe / Ausgabe)Du sparst
gemini-2-5-flash$0.09$0.75$0.30 / $2.50~70%
gemini-3-1-pro$0.70$4.20$2.00 / $12.00~65%

Flash ist das „Arbeitspferd“ für große Mengen; Pro ist für anspruchsvolleres Schlussfolgern, visuelle Aufgaben und lange Kontexte gedacht. Die aktuellen Preise werden immer auf der Preisseite und auf der Seite jedes Modells angezeigt (gemini-2-5-flash, gemini-3-1-pro).

So funktioniert die tokenbasierte Gemini-Preisberechnung

Du zahlst für Eingabe-Token (alles, was du sendest — System-Prompt, abgerufener Kontext, Nutzernachrichten) und Ausgabe-Token (das, was das Modell erzeugt). Die Ausgabe ist der teurere Teil. Der größte Hebel für deine Gemini-Rechnung ist daher, wie viel Text du das Modell schreiben lässt. Bilder und Audio werden in Token-Äquivalente umgerechnet und über denselben Zähler abgerechnet.

Beispielrechnungen

Konkrete Zahlen auf Grundlage der Kunavo-Preise für Gemini 2.5 Flash; in der letzten Zeile wird Gemini 3.1 Pro verwendet:

ArbeitslastToken (Eingabe / Ausgabe)ModellKosten
Chatbot-Runde1.000 / 300Flash$0.0003
RAG-Antwort8.000 / 500Flash$0.0011
Batch-Klassifizierung (pro Dokument)500 / 20Flash$0.00006
Analyse eines langen Kontexts20.000 / 2.000Pro$0.0224

Bei diesen Preisen kostet ein Klassifizierungs-Batch mit 100.000 Dokumenten auf Flash etwa $6, und eine Million Chatbot-Runden kosten etwa $315. Die ausführbare Rechnung:

gemini_chi_phi.py
# Mức giá Kunavo cho Gemini 2.5 Flash (USD trên mỗi 1 triệu token)
IN_RATE, OUT_RATE = 0.09, 0.75

def chi_phi(token_vao: int, token_ra: int) -> float:
    return token_vao / 1_000_000 * IN_RATE + token_ra / 1_000_000 * OUT_RATE

print(chi_phi(1_000, 300))            # một lượt chatbot        -> $0.000315
print(chi_phi(8_000, 500))            # một câu trả lời RAG     -> $0.001095
print(chi_phi(500, 20) * 100_000)     # lô 100k tài liệu        -> ~$6.00

Kunavo-Preise und Abrechnung über Stripe

Keine Abonnements und kein Google-Cloud-Projekt. Du lädst Guthaben auf dein Wallet (über Stripe oder lokale Zahlungsmethoden), und jeder Aufruf wird anhand der oben genannten Tokenpreise davon abgezogen. Pay-as-you-go ab einer Mindestaufladung von $10; das Guthaben verfällt nie, und größere Aufladungen erhalten Bonusguthaben. Ein einziges Wallet deckt Gemini und alle anderen Modelle ab — Claude, GPT, Bild, Video und Audio — sodass du keine separate Rechnung für jeden Anbieter abgleichen musst.

Welches Gemini-Modell sollte ich wählen?

  • gemini-2-5-flash — Standard für Chat, Extraktion, Klassifizierung, Zusammenfassungen und den Großteil von RAG. Schnell und die günstigste ausreichend leistungsfähige Option.
  • gemini-3-1-pro — verwende es, wenn Flash nicht genau genug ist: mehrstufiges Schlussfolgern, Programmierung, visuelle Aufgaben und sehr lange Kontexte.

Ein gutes Muster ist Routing nach Schwierigkeit: Flash für häufige Fälle und erst dann ein Upgrade auf Pro, wenn eine Prüfung fehlschlägt. Im Leitfaden zur Optimierung von KI-Kosten findest du das Routing-Muster im Code.

So senkst du deine Gemini-Rechnung

  1. Auf eine niedrigere Modellstufe wechseln. Leite 80 % der einfachen Aufgaben an Flash weiter und reserviere Pro für die schwierigen 20 %.
  2. Ausgabe begrenzen. Setze max_tokens und eine Stop-Sequenz — die Ausgabe ist der teure Teil des Zählers.
  3. Eingabe verschlanken. Rufe weniger, aber hochwertigere RAG-Abschnitte ab, statt die gesamte Wissensbasis in den Kontext zu packen.
  4. Batches bilden. Bündele unabhängige Aufrufe, um die Latenz niedrig zu halten und Retry-Stürme zu vermeiden.

Häufig gestellte Fragen

Ist die Gemini API kostenlos?

Google AI Studio bietet eine kostenlose Stufe mit begrenzter Rate, die sich für Prototypen eignet. In der Produktion zahlen Sie nach Tokens. Kunavo rechnet nutzungsbasiert ab, ab einer Mindestaufladung von 10 $ — Sie zahlen für Tokens zu den untenstehenden Preisen, Ihr Guthaben verfällt nie, und Sie benötigen kein Google-Cloud-Abrechnungskonto.

Wie viel kostet Gemini 2.5 Flash?

Bei Kunavo kostet Gemini 2.5 Flash $0.09 pro 1 Million Eingabetoken und $0.75 pro 1 Million Ausgabetoken — etwa 70% weniger als Googles offizieller Listenpreis von $0.30 / $2.50. Eine typische Chatbot-Anfrage (1K Eingabe, 300 Ausgabe) kostet etwa 0,0003 $.

Ist Gemini günstiger als Claude oder GPT?

Gemini 2.5 Flash gehört zu den günstigsten leistungsfähigen Modellen überhaupt — günstiger als Claude Haiku und die meisten GPT-Stufen bei großen Mengen. Den vollständigen Tabellenvergleich finden Sie auf der Preisseite.

Wie kann ich die Kosten der Gemini API senken?

Wechseln Sie zu Flash, begrenzen Sie die Ausgabe, verschlanken Sie den abgerufenen Kontext und bündeln Sie Anfragen. Einzelheiten finden Sie im Leitfaden zur Kostenoptimierung. Um mit Gemini zu beginnen, lesen Sie So erhalten Sie einen Gemini-API-Schlüssel.