Die meisten LLM-Aggregatoren beschränken sich auf Text. Sobald Ihr Produkt ein Bild generieren, ein Foto bearbeiten, ein Standbild in ein Video animieren, eine Werbung vertonen oder Musik komponieren muss, verwalten Sie wieder drei weitere Anbieter, drei weitere Rechnungen und drei weitere SDKs. Kunavo bietet all das über dieselbe OpenAI-kompatible API. Dieser Leitfaden behandelt, wann Sie zu welcher Modalität greifen, das Modellangebot je Modalität und wie Sie sie zu produktiven multimodalen Pipelines verketten.
Das Modalitätenmenü (und wofür jede Modalität gedacht ist)
- Textgenerierung — Claude Opus/Sonnet/Haiku und GPT. Für Schlussfolgerungen, Chat und strukturierte Ausgaben. /docs/chat
- Bildgenerierung (Text-zu-Bild) — Nano Banana Pro, GPT-Image-2, Nano Banana 2. Die Auswahl hängt vom Anwendungsfall ab (siehe den Vergleich unten)
- Bildbearbeitung (Bild-zu-Bild) — Nano Banana Edit, GPT-Image-2 Edit. Text auf Verpackungen ersetzen, Hintergründe austauschen, Stil ändern
- Videogenerierung — Veo 3 Lite/Fast/Quality, Seedance 2 und Seedance 2 Fast, Wan 2.7. Sowohl Text-zu-Video als auch Bild-zu-Video werden unterstützt
- Audio — Musik — Suno V5 / V5.5. Vollständige Songs aus einem Prompt
Durchsuchen Sie den vollständigen Katalog unter /models.
Ein Bildmodell auswählen — die 30-Sekunden-Regel
- Benötigen Sie sauberen Text im Bild (UI-Mockups, Poster, Schilder)? → Nano Banana Pro. Keine Frage
- Wörtliche, detaillierte Prompts? → GPT-Image-2. Starkes Prompt-Verständnis; bei jeder Auflösung gleicher Preis
- Hohe Volumen, bei denen die Kosten zählen? → Nano Banana 2. Bei 1K am günstigsten, Detailtreue bleibt erhalten
- Filmisch mit Tiefenwirkung? → Nano Banana Pro. Das Bokeh wirkt tatsächlich filmisch
Die vollständige Vertiefung finden Sie in unserem Vergleich der Bildmodelle — unserem laufenden Vergleich von Bildmodellen.
Ein Videomodell auswählen
Drei Familien sind verfügbar und rechnen mit unterschiedlichen Einheiten ab — Veo 3 pro Video, Seedance und Wan pro Sekunde Ausgabe. Die folgenden Preise sind die Katalogpreise:
| Modell | Kunavo-Preis | Abrechnungseinheit | Am besten geeignet für |
|---|---|---|---|
veo-3-quality | $1.60+ | pro Video | Beste Gesamtdetailtreue, natives Audio |
veo-3 | $0.36+ | pro Video | Der optimale Kompromiss für die meisten Produktionsclips |
veo-3-lite | $0.18+ | pro Video | Günstige Iterationen während der Ideenfindung |
seedance-2 | $0.114+ | pro Videosekunde | Starke Bewegung und Prompt-Treue |
seedance-2-fast | $0.093+ | pro Videosekunde | Tauscht etwas Detailtreue gegen Geschwindigkeit |
seedance-2-mini | $0.0245+ | pro Videosekunde | Am günstigsten pro Sekunde, kurze Clips mit hohem Volumen |
wan-2-7 | $0.096+ | pro Videosekunde | Filmische Text-zu-Video-Generierung, in 720p oder 1080p |
Da der Endpunkt modellunabhängig ist, besteht der Wechsel zwischen Familien lediglich aus einer Änderung des Feldes model. Den Video-Schnellstart finden Sie in unserem Video-Schnellstart für Veo 3; Details pro Modell in den Anleitungen zur Seedance API und zur Wan API.
Ein Bild generieren — die Grundlagen
# Text-to-image: same OpenAI SDK, different model slug
img = client.images.generate(
model="nano-banana-pro", # Google's flagship — best text rendering
prompt="a marketing hero for a fintech app, isometric, soft blue palette",
size="1024x1024",
)
print(img.data[0].url) # 24h temporary URL — download immediatelyErgebnis-URLs sind temporär (24 Stunden für Bilder, dauerhaft für Videos über das files.kunavo.com-CDN). Laden Sie Bilder sofort herunter und speichern Sie sie auf Ihrem eigenen CDN.
Bild-zu-Video — vorhandene Assets in Bewegung versetzen
Sie haben bereits Produktfotografie auf Ihrer Website. Veo 3 kann daraus einen 8-sekündigen Produktclip animieren:
# Image-to-video: upload a hero image, animate into an 8-second product clip
# (every Veo clip is 8 seconds; the Veo models ignore "duration").
# The OpenAI SDK has no method for the video route, so post to it with the
# same client.
video = client.post(
"/video/generations",
body={
"model": "veo-3",
"prompt": "camera slowly orbits, soft cinematic light, product hero shot",
"image_url": hero_image_url,
"aspect_ratio": "9:16", # vertical for Reels / TikTok / IG short
"resolution": "1080p",
},
cast_to=object,
options={"timeout": 600.0}, # a clip takes minutes
)
print(video["data"][0]["url"])Marketingteams, die zuvor 500–1500 $ pro Videodreh ausgegeben haben, reduzieren dies auf einen Clip von $0.18+ (Veo 3.1 Lite) bis $1.60+ (Veo 3.1 Quality) plus etwa 30 Sekunden Rechenzeit. Das funktioniert besonders gut für Hero-Animationen im E-Commerce, Screenshots im App Store / Play Store und Produktpräsentationen in sozialen Medien.
Modalitäten verketten — die eigentliche Stärke
Die interessanten Workflows kombinieren Modalitäten nacheinander. Eine Produktionslinie für Marketingclips:
# Pipeline: GPT-Image generates a marketing hero, Veo 3 animates it,
# Suno scores the BGM. One API, one bill.
# Here client is AsyncOpenAI(api_key=..., base_url="https://api.kunavo.com/v1").
async def make_marketing_clip(product: dict) -> dict:
# 1. Hero image
img = await client.images.generate(
model="gpt-image-2",
prompt=f"hero shot of {product['name']}, premium aesthetic",
size="1024x1792",
)
# 2. Animate to 8s vertical (the length of every Veo clip). The SDK has
# no method for the video and music routes, so post to them directly.
video = await client.post(
"/video/generations",
body={
"model": "veo-3",
"prompt": f"camera orbits {product['name']}, cinematic lighting",
"image_url": img.data[0].url,
"aspect_ratio": "9:16",
},
cast_to=object,
options={"timeout": 600.0},
)
# 3. BGM
bgm = await client.post(
"/audio/music",
body={
"model": "suno-v5",
"prompt": "upbeat synth, 30 seconds, brand-friendly",
},
cast_to=object,
options={"timeout": 600.0},
)
return {"video": video["data"][0]["url"], "bgm": bgm["data"][0]["url"]}Führen Sie dies für 100 SKUs parallel mit asyncio.gather() aus, und Sie verfügen über eine Produktionspipeline für einen Marketingkatalog. Gesamtkosten: etwa 1–2 $ pro SKU durchgehend. Vergleichen Sie das mit 500–2000 $ pro Asset bei einer Kreativagentur.
Praktische Überlegungen
- Gültigkeitsdauer von Ergebnis-URLs: Bilder laufen nach 24 Stunden ab (auf Ihr CDN umhosten); Videos sind auf Kunavos files.kunavo.com dauerhaft verfügbar
- Generierungszeit: Bild etwa 5–30 s, Video etwa 30 s–3 min, Musik etwa 30 s. Verwenden Sie
force-dynamicserverseitig und zeigen Sie Benutzern den Fortschritt an - Fehlgeschlagene Generierungen sind kostenlos — Kunavo berechnet niemals 4xx/5xx, iterieren Sie daher frei an Prompts
- Textrendering in Videos: Veo 3 hat Schwierigkeiten mit mehrwortigem Text in Videos. Rendern Sie Text stattdessen in der Nachbearbeitung (CapCut, Final Cut, Canvas im Browser), anstatt das Modell darum zu bitten
- Echte Gesichter / geistiges Eigentum: Alle großen Modelle verweigern die Generierung von Prominenten, politischen Personen und urheberrechtlich geschützten Figuren. Verwenden Sie eigene Figuren oder lizenziertes geistiges Eigentum
- Seitenverhältnisse: 9:16 (vertikales Kurzvideo), 16:9 (Querformat), 1:1 (Feed), 4:5 (Instagram-Hochformat). Übergeben Sie sie bei Videos über
aspect_ratio; bei Bildern verwenden Siesize="1024x1792"usw.
Häufige multimodale Anwendungsfälle (mit Ausgangsprompts)
- Hero-Animationen für E-Commerce-Produkte — Bild-zu-Video, orbitale Kamera, 8 Sekunden, 9:16
- Virtuelles Staging von Immobilien — Bildbearbeitung, um leeren Räumen Möbel hinzuzufügen
- Produktion von Marketingkarussells / Reels — Batch-Bildgenerierung im Markenstil + Veo-Animation
- Erklärclips für Bildungszwecke — Folien als Bilder generieren, mit Veo 3 animieren, mit Suno vertonen
- Podcast-Intros & Audiobranding — Suno-Musikbetten und Jingles für Ihre Sendung, aus einem Prompt generiert
- Generierung von Spiel-/App-Assets — Charakterporträts, Gegenstandssymbole und Umgebungshintergründe über Nano Banana Pro / GPT-Image-2
Wann Sie keine multimodalen Modelle verwenden sollten
- Strenge Marken-Assets — Die Modellausgabe driftet selbst bei präzisen Prompts. Verwenden Sie KI für Varianten eines von Menschen gestalteten Originals, nicht als Ersatz für das Original
- Gesichter realer Personen — Werden von allen großen Modellen abgelehnt; bei einer Umgehung besteht ein rechtliches/IP-Risiko
- Live-Video / Echtzeitgenerierung — Aktuelle Modelle benötigen 30 s–3 min pro Clip. Noch nicht für Live-Anwendungsfälle geeignet
- Anwendungsfälle mit hohen Genauigkeitsanforderungen — Medizinische Bildgebung, juristische Beweismittel, wissenschaftliche Veröffentlichungen. Multimodale Generierung ist kreativ, nicht faktisch
Multimodalität unter einer Rechnung ist der eigentliche Zweck von Kunavo. Starten Sie unter /docs/images oder /docs/video mit der Endpunktreferenz oder durchsuchen Sie /models, gefiltert nach Kategorie.
Die Preisübersichten pro Modell hinter diesen Pipelines finden Sie im Vergleich der Bildgenerierungs-APIs und im Vergleich der Videogenerierungs-APIs.
Häufig gestellte Fragen
Wie viel kostet die KI-Videogenerierung pro Clip?
Auf Kunavo kostet Veo 3.1 Quality $1.60+ pro Video, und Veo 3.1 Fast kostet $0.36+ pro Video, während Veo 3.1 Lite $0.18+ pro Video kostet und sich für günstige Iterationen eignet. Seedance und Wan rechnen stattdessen pro Sekunde Ausgabe ab: Seedance 2 zu $0.114+ pro Videosekunde, Seedance 2 Fast zu $0.093+ pro Videosekunde und Wan 2.7 zu $0.096+ pro Videosekunde. Ein Marketingteam, das zuvor 500–1.500 $ pro Videodreh ausgegeben hat, erhält einen vergleichbaren Clip zum oben genannten Preis plus etwa 30 Sekunden Rechenzeit.
Wie lange bleiben URLs für generierte Bilder und Videos gültig?
URLs für Bildergebnisse sind temporär und laufen nach etwa 24 Stunden ab. Laden Sie sie daher sofort herunter und hosten Sie sie auf Ihrem eigenen CDN. Videoergebnisse sind dauerhaft und werden von files.kunavo.com bereitgestellt.
Wie lange dauert die Generierung von Bildern, Videos und Musik?
Ungefähr 5–30 Sekunden für ein Bild, 30 Sekunden bis 3 Minuten für ein Video und etwa 30 Sekunden für Musik. Damit sind die aktuellen Modelle für Live- oder Echtzeitanwendungsfälle ungeeignet.
Werden fehlgeschlagene Bild- oder Videogenerierungen abgerechnet?
Nein. Kunavo berechnet niemals eine 4xx- oder 5xx-Antwort, sodass das Iterieren an einem Prompt bis zum Erfolg nichts über erfolgreiche Generierungen hinaus kostet.
Welches Bildmodell sollte ich wählen?
Nano Banana Pro, wenn das Bild sauberen Text enthalten muss — UI-Mockups, Poster, Schilder — und für filmische Tiefenwirkung. GPT-Image-2 für wörtliche, detaillierte Prompts; der Preis ist bei jeder Auflösung gleich. Nano Banana 2 für hohe Volumen, bei denen die Kosten zählen; bei 1K ist es am günstigsten und die Detailtreue bleibt erhalten.
Was kostet eine vollständige multimodale Pipeline pro Asset?
Die Verkettung von Bildgenerierung, Bild-zu-Video und einer Musikspur kostet auf Kunavo insgesamt ungefähr 1–2 $ pro SKU gegenüber 500–2.000 $ pro Asset bei einer Kreativagentur. Alle drei Modalitäten laufen über dieselbe OpenAI-kompatible API und werden von einem Guthaben abgerechnet.