Zurück zu den Leitfäden
Preise·18. Juni 2026·Aktualisiert am 12. September 2026·8 Min. Lesezeit

Gemini-API-Preise 2026 — Kosten pro Modell, Beispiele und günstigerer OpenAI-kompatibler Zugriff

Gemini gehört zu den Spitzenmodellen im KI-Bereich mit dem besten Preis-Leistungs-Verhältnis. Hier finden Sie die aktuellen Tarife pro Modell — etwa 70 % unter Googles Listenpreis — mit Kostenbeispielen und dem günstigsten Weg, Gemini im Produktiveinsatz aufzurufen.

Gemini gehört zu den preiswertesten führenden KI-Modellen, und Kunavo stellt es etwa 70% unter dem offiziellen Google-Listenpreis über eine einzige OpenAI-kompatible API bereit. Dieser Leitfaden enthält die aktuellen Tarife pro Modell, nachvollziehbare Kostenbeispiele und die günstigste Möglichkeit, Gemini in der Produktion aufzurufen.

Gemini-API-Preise im Überblick

Die Tarife werden pro 1M Token in USD berechnet, wie sie bei Kunavo abgerechnet werden. Die Spalte „Google-Listenpreis“ zeigt den von Google veröffentlichten Tarif für dasselbe Modell, damit Sie den Unterschied sehen können.

ModellEingabe / 1MAusgabe / 1MGoogle-Listenpreis (Eingabe / Ausgabe)Ihre Ersparnis
gemini-2-5-flash$0.09$0.75$0.30 / $2.50~70%
gemini-3-1-pro$0.70$4.20$2.00 / $12.00~65%

Flash ist das Arbeitspferd für hohe Volumina; Pro ist für anspruchsvolleres Reasoning, Vision und Aufgaben mit langem Kontext gedacht. Die aktuellen Tarife finden Sie immer auf der Preisseite und auf der Seite jedes Modells (gemini-2-5-flash, gemini-3-1-pro).

So funktioniert die Gemini-Tokenpreisgestaltung

Sie zahlen für Eingabetoken (alles, was Sie senden – System-Prompt, abgerufener Kontext, Benutzernachricht) und Ausgabetoken (das, was das Modell erzeugt). Die Ausgabe ist der teurere Teil. Der größte Hebel für Ihre Gemini-Rechnung ist daher, wie viel Text Sie das Modell schreiben lassen. Bilder und Audio werden in Tokenäquivalente umgewandelt und über denselben Zähler abgerechnet.

Beispiele für Kostenberechnungen

Reale Zahlen zum Tarif von Kunavo für Gemini 2.5 Flash, außer in der letzten Zeile, die Gemini 3.1 Pro verwendet:

WorkloadToken (Eingabe / Ausgabe)ModellKosten
Chatbot-Runde1.000 / 300Flash$0.0003
RAG-Antwort8.000 / 500Flash$0.0011
Batch-Klassifizierung (pro Dokument)500 / 20Flash$0.00006
Analyse mit langem Kontext20.000 / 2.000Pro$0.0224

Zu diesen Tarifen kostet ein Klassifizierungs-Batch mit 100.000 Dokumenten in Flash etwa $6 und eine Million Chatbot-Runden etwa $315. Die direkt ausführbare Berechnung:

gemini_biaya.py
# Tarif Kunavo untuk Gemini 2.5 Flash (USD per 1J token)
IN_RATE, OUT_RATE = 0.09, 0.75

def biaya(token_masuk: int, token_keluar: int) -> float:
    return token_masuk / 1_000_000 * IN_RATE + token_keluar / 1_000_000 * OUT_RATE

print(biaya(1_000, 300))            # satu putaran chatbot      -> $0.000315
print(biaya(8_000, 500))            # satu jawaban RAG          -> $0.001095
print(biaya(500, 20) * 100_000)     # batch 100rb dokumen       -> ~$6.00

Kunavo-Preise und Abrechnung über Stripe

Es gibt kein Abonnement und kein Google-Cloud-Projekt. Sie laden Guthaben in eine Wallet (Stripe oder lokale Zahlungsmethoden), und jeder Aufruf zieht den oben genannten Token-Tarif vom Guthaben ab. Pay-as-you-go beginnt mit einer Mindestaufladung von $10, das Guthaben verfällt nie, und größere Aufladungen erhalten Bonusguthaben. Eine Wallet deckt Gemini und alle anderen Modelle ab – Claude, GPT, Bild, Video und Audio –, sodass Sie keine getrennten Anbieterrechnungen abgleichen müssen.

Welches Gemini-Modell sollte ich wählen?

  • gemini-2-5-flash – Standard für Chat, Extraktion, Klassifizierung, Zusammenfassungen und den Großteil von RAG. Schnell und die günstigste leistungsfähige Option.
  • gemini-3-1-pro – verwenden Sie es, wenn Flash nicht genau genug ist: mehrstufiges Reasoning, Code, Vision und sehr langer Kontext.

Ein gutes Muster ist das Routing nach Schwierigkeitsgrad: Flash für Standardfälle und nur dann auf Pro wechseln, wenn eine Prüfung fehlschlägt. Das Handbuch zur KI-Kostenoptimierung zeigt das Routing-Muster im Code.

So senken Sie Ihre Gemini-Rechnung

  1. Wechseln Sie in eine niedrigere Stufe. Senden Sie 80 % der einfachen Aufgaben an Flash und reservieren Sie Pro für die 20 % schwierigen Aufgaben.
  2. Begrenzen Sie die Ausgabe. Setzen Sie max_tokens und eine Stop-Sequenz – die Ausgabe ist der teure Teil des Zählers.
  3. Reduzieren Sie die Eingabe. Verwenden Sie weniger, dafür bessere RAG-Ausschnitte, statt die gesamte Wissensbasis in den Kontext zu laden.
  4. Arbeiten Sie mit Batches. Bündeln Sie unabhängige Aufrufe, damit die Latenz niedrig bleibt und Retry-Stürme vermieden werden.

Häufig gestellte Fragen

Ist die Gemini API kostenlos?

Google AI Studio bietet eine kostenlose Stufe mit Ratenlimits, die sich für Prototypen eignet. In der Produktion zahlen Sie pro Token. Kunavo arbeitet nach dem Pay-as-you-go-Modell ab einer Mindesteinzahlung von $10 – Sie zahlen pro Token zu den unten aufgeführten Tarifen, das Guthaben verfällt nie, und Sie benötigen kein Google-Cloud-Abrechnungskonto.

Wie viel kostet Gemini 2.5 Flash?

Bei Kunavo kostet Gemini 2.5 Flash $0.09 pro 1M Eingabetoken und $0.75 pro 1M Ausgabetoken – etwa 70% unter dem offiziellen Google-Listenpreis von $0.30 / $2.50. Eine typische Chatbot-Runde (1K Eingabe, 300 Ausgabe) kostet etwa $0.0003.

Ist Gemini günstiger als Claude oder GPT?

Gemini 2.5 Flash ist eines der günstigsten leistungsfähigen Modelle auf dem Markt – günstiger als Claude Haiku und die meisten GPT-Stufen für Workloads mit hohem Volumen. Vergleichen Sie die vollständige Tabelle auf der Preisseite.

Wie kann ich die Kosten der Gemini-API senken?

Verwenden Sie Flash, begrenzen Sie die Ausgabe, reduzieren Sie den abgerufenen Kontext und arbeiten Sie mit Batches. Details finden Sie im Leitfaden zur Kostenoptimierung. Wie Sie mit Aufrufen an Gemini beginnen, erfahren Sie unter Gemini-API-Schlüssel abrufen.