Zurück zu den Leitfäden
Preise·18. Juni 2026·Aktualisiert am 12. September 2026·8 Min. Lesezeit

Gemini-API-Preise 2026 — Kosten pro Modell, Beispiele und günstigerer OpenAI-kompatibler Zugriff

Gemini gehört zu den besten Preis-Leistungs-Angeboten bei führender KI. Hier findest du die aktuellen Preise pro Modell — etwa 70 % unter Googles Listenpreis — mit Kostenbeispielen und der günstigsten Möglichkeit, Gemini in der Produktion aufzurufen.

Gemini gehört zu den besten Preis-Leistungs-Optionen unter den führenden KI-Modellen, und Kunavo bietet es etwa 70% unter dem Google-Listenpreis über eine einzige OpenAI-kompatible API an. Dieser Leitfaden enthält die aktuellen Tarife pro Modell, überprüfbare Kostenbeispiele und die günstigste Möglichkeit, Gemini in der Produktion aufzurufen.

Gemini-API-Preise im Überblick

Die Tarife gelten pro 1M Token in USD, wie sie bei Kunavo berechnet werden. Die Spalte „Google-Listenpreis“ zeigt den von Google veröffentlichten Tarif für dasselbe Modell, damit Sie den Unterschied sehen können.

ModellEingabe / 1MAusgabe / 1MGoogle-Listenpreis (Eingabe / Ausgabe)Ihre Ersparnis
gemini-2-5-flash$0.09$0.75$0.30 / $2.50~70%
gemini-3-1-pro$0.70$4.20$2.00 / $12.00~65%

Flash ist das Arbeitspferd für hohe Volumina; Pro ist für anspruchsvolleres Reasoning, Vision und Aufgaben mit langem Kontext gedacht. Die aktuellen Tarife finden Sie immer auf der Preisseite und auf der Seite jedes Modells (gemini-2-5-flash, gemini-3-1-pro).

So funktioniert die Gemini-Tokenpreisgestaltung

Sie zahlen für Eingabetoken (alles, was Sie senden – System-Prompt, abgerufener Kontext, Benutzernachricht) und für Ausgabetoken (das, was das Modell erzeugt). Die Ausgabe ist der teurere Teil. Der größte Hebel für Ihre Gemini-Rechnung ist daher, wie viel Text Sie das Modell schreiben lassen. Bilder und Audio werden in Tokenäquivalente umgewandelt und über denselben Zähler abgerechnet.

Berechnete Kostenbeispiele

Reale Zahlen zum Gemini-2.5-Flash-Tarif von Kunavo, außer in der letzten Zeile, die Gemini 3.1 Pro verwendet:

WorkloadToken (Eingabe / Ausgabe)ModellKosten
Chatbot-Runde1.000 / 300Flash$0.0003
RAG-Antwort8.000 / 500Flash$0.0011
Batch-Klassifizierung (pro Dokument)500 / 20Flash$0.00006
Analyse mit langem Kontext20.000 / 2.000Pro$0.0224

Zu diesen Tarifen kostet ein Klassifizierungs-Batch mit 100.000 Dokumenten in Flash etwa $6 und eine Million Chatbot-Runden etwa $315. Die direkt ausführbare Berechnung:

gemini_custo.py
# Tarifas do Kunavo para o Gemini 2.5 Flash (USD por 1M de tokens)
IN_RATE, OUT_RATE = 0.09, 0.75

def custo(tokens_entrada: int, tokens_saida: int) -> float:
    return tokens_entrada / 1_000_000 * IN_RATE + tokens_saida / 1_000_000 * OUT_RATE

print(custo(1_000, 300))            # uma rodada de chatbot   -> $0.000315
print(custo(8_000, 500))            # uma resposta de RAG     -> $0.001095
print(custo(500, 20) * 100_000)     # lote de 100k documentos -> ~$6.00

Kunavo-Preise und Abrechnung über Stripe

Es gibt weder ein Abonnement noch ein Google-Cloud-Projekt. Sie laden Guthaben in eine Wallet (Stripe oder lokale Zahlungsmethoden), und die Aufrufe ziehen die oben genannten Token-Tarife vom Guthaben ab. Pay-as-you-go beginnt mit einer Mindestaufladung von $10, das Guthaben verfällt nie, und größere Einzahlungen bringen Bonusguthaben. Eine einzige Wallet deckt Gemini und alle anderen Modelle ab – Claude, GPT, Bild, Video und Audio –, sodass Sie keine separate Rechnung pro Anbieter abgleichen müssen.

Welches Gemini-Modell sollte ich wählen?

  • gemini-2-5-flash – Standard für Chat, Extraktion, Klassifizierung, Zusammenfassungen und den Großteil von RAG. Schnell und die günstigste leistungsfähige Option.
  • gemini-3-1-pro – verwenden Sie es, wenn Flash nicht genau genug ist: mehrstufiges Reasoning, Code, Vision und sehr langer Kontext.

Ein gutes Muster ist das Routing nach Schwierigkeitsgrad: Flash für Standardfälle und nur dann auf Pro wechseln, wenn eine Prüfung fehlschlägt. Das Handbuch zur KI-Kostenoptimierung zeigt das Routing-Muster im Code.

So senken Sie Ihre Gemini-Rechnung

  1. Wechseln Sie in eine niedrigere Stufe. Senden Sie die einfachen 80 % der Aufgaben an Flash und reservieren Sie Pro für die schwierigen 20 %.
  2. Begrenzen Sie die Ausgabe. Legen Sie max_tokens und Stop-Sequenzen fest — die Ausgabe ist die teure Seite des Zählers.
  3. Verschlanken Sie die Eingabe. Rufen Sie weniger, aber bessere RAG-Ausschnitte ab, statt die gesamte Wissensdatenbank in den Kontext zu packen.
  4. Bündeln Sie Anfragen. Fassen Sie unabhängige Aufrufe zusammen, um die Latenz niedrig zu halten und Retry-Stürme zu vermeiden.

Häufig gestellte Fragen

Ist die Gemini API kostenlos?

Google AI Studio bietet eine kostenlose Stufe mit Ratenlimits, ideal für Prototypen. In der Produktion zahlen Sie pro Token. Kunavo arbeitet nach dem Pay-as-you-go-Modell ab einer Mindesteinzahlung von $10 – Sie zahlen pro Token zu den unten aufgeführten Tarifen, das Guthaben verfällt nie, und ein Google-Cloud-Abrechnungskonto ist nicht erforderlich.

Wie viel kostet Gemini 2.5 Flash?

Bei Kunavo kostet Gemini 2.5 Flash $0.09 pro 1M Eingabetoken und $0.75 pro 1M Ausgabetoken – etwa 70% unter dem Google-Listenpreis von $0.30 / $2.50. Eine typische Chatbot-Runde (1K Eingabe, 300 Ausgabe) kostet ungefähr $0.0003.

Ist Gemini günstiger als Claude oder GPT?

Gemini 2.5 Flash ist eines der günstigsten leistungsfähigen Modelle auf dem Markt – günstiger als Claude Haiku und die meisten GPT-Stufen bei Workloads mit hohem Volumen. Vergleichen Sie die vollständige Tabelle auf der Preisseite.

Wie kann ich die Kosten der Gemini-API senken?

Verwenden Sie Flash, begrenzen Sie die Ausgabe, reduzieren Sie den abgerufenen Kontext und arbeiten Sie mit Batches. Details finden Sie im Leitfaden zur Kostenoptimierung. Wie Sie mit Aufrufen an Gemini beginnen, erfahren Sie unter Gemini-API-Schlüssel abrufen.