La plupart des agrégateurs de LLM s’arrêtent au texte. Dès que votre produit doit générer une image, retoucher une photo, animer une image fixe en vidéo, produire la voix d’une publicité ou composer de la musique, vous devez gérer trois fournisseurs supplémentaires, trois factures supplémentaires et trois SDK supplémentaires. Kunavo vous fournit tout cela via la même API compatible OpenAI. Ce guide explique quand utiliser chaque modalité, le menu de modèles de chaque modalité et comment les enchaîner dans des pipelines multimodaux de production.
Le menu des modalités (et l’usage de chacune)
- Génération de texte — Claude Opus/Sonnet/Haiku et GPT. À utiliser pour le raisonnement, le chat et les sorties structurées. /docs/chat
- Génération d’images (texte vers image) — Nano Banana Pro, GPT-Image-2, Nano Banana 2. Le choix varie selon le cas d’utilisation (voir le comparatif ci-dessous)
- Édition d’images (image vers image) — Nano Banana Edit, GPT-Image-2 Edit. Remplacer le texte sur un emballage, changer les arrière-plans, modifier le style
- Génération vidéo — Veo 3 Lite/Fast/Quality, Seedance 2 et Seedance 2 Fast, Wan 2.7. Texte vers vidéo et image vers vidéo pris en charge
- Audio — Musique — Suno V5 / V5.5. Chansons complètes à partir d’un prompt
Consultez le catalogue complet sur /models.
Choisir un modèle d’image — la règle des 30 secondes
- Besoin d’un texte net dans l’image (maquettes d’interface, affiches, panneaux) ? → Nano Banana Pro. Sans concurrence
- Prompts littéraux et détaillés ? → GPT-Image-2. Excellente compréhension des prompts ; tarif fixe quelle que soit la résolution
- Gros volume où le coût compte ? → Nano Banana 2. Le moins cher en 1K, fidélité au rendez-vous
- Rendu cinématographique avec profondeur ? → Nano Banana Pro. Le bokeh est véritablement cinématographique
Plongez dans notre comparatif des modèles d’image — notre comparaison en direct des modèles d’image.
Choisir un modèle vidéo
Trois familles sont disponibles, et elles sont facturées selon des unités différentes — Veo 3 par vidéo, Seedance et Wan par seconde de sortie. Les prix ci-dessous sont les tarifs du catalogue :
| Modèle | Prix Kunavo | Unité de facturation | Idéal pour |
|---|---|---|---|
veo-3-quality | $1.60+ | par vidéo | Meilleure fidélité globale, audio natif |
veo-3 | $0.36+ | par vidéo | Le meilleur compromis pour la plupart des clips de production |
veo-3-lite | $0.18+ | par vidéo | Itérations bon marché pendant la conception |
seedance-2 | $0.114+ | par seconde de vidéo | Mouvement puissant et bonne adhérence au prompt |
seedance-2-fast | $0.093+ | par seconde de vidéo | Sacrifie une partie de la fidélité au profit de la vitesse |
seedance-2-mini | $0.0245+ | par seconde de vidéo | Le moins cher par seconde, pour des clips courts à fort volume |
wan-2-7 | $0.096+ | par seconde de vidéo | Génération cinématographique de vidéos à partir de texte, en 720p ou 1080p |
Comme le point de terminaison est indépendant du modèle, changer de famille consiste à modifier le champ model et rien d’autre. Démarrage rapide de la vidéo dans notre guide de démarrage rapide vidéo Veo 3 ; détails par modèle dans les guides API Seedance et API Wan.
Générer une image — les bases
# Text-to-image: same OpenAI SDK, different model slug
img = client.images.generate(
model="nano-banana-pro", # Google's flagship — best text rendering
prompt="a marketing hero for a fintech app, isometric, soft blue palette",
size="1024x1024",
)
print(img.data[0].url) # 24h temporary URL — download immediatelyLes URL de résultat sont temporaires (24 h pour les images, permanentes pour les vidéos via le CDN files.kunavo.com). Pour les images, téléchargez-les immédiatement et stockez-les sur votre propre CDN.
Image vers vidéo — donner du mouvement à vos ressources existantes
Vous avez déjà des photos de produits sur votre site. Veo 3 peut transformer n’importe laquelle en clip produit de 8 secondes :
# Image-to-video: upload a hero image, animate into an 8-second product clip
# (every Veo clip is 8 seconds; the Veo models ignore "duration").
# The OpenAI SDK has no method for the video route, so post to it with the
# same client.
video = client.post(
"/video/generations",
body={
"model": "veo-3",
"prompt": "camera slowly orbits, soft cinematic light, product hero shot",
"image_url": hero_image_url,
"aspect_ratio": "9:16", # vertical for Reels / TikTok / IG short
"resolution": "1080p",
},
cast_to=object,
options={"timeout": 600.0}, # a clip takes minutes
)
print(video["data"][0]["url"])Les équipes marketing qui dépensaient auparavant 500 à 1 500 $ par tournage vidéo réduisent cela à un clip de $0.18+ (Veo 3.1 Lite) à $1.60+ (Veo 3.1 Quality), plus environ 30 secondes de calcul. Particulièrement efficace pour les animations hero e-commerce, les captures d’écran de l’App Store / Play Store et les présentations de produits sur les réseaux sociaux.
Chaînage des modalités — le véritable superpouvoir
Les workflows intéressants combinent les modalités en séquence. Une chaîne de production de clips marketing :
# Pipeline: GPT-Image generates a marketing hero, Veo 3 animates it,
# Suno scores the BGM. One API, one bill.
# Here client is AsyncOpenAI(api_key=..., base_url="https://api.kunavo.com/v1").
async def make_marketing_clip(product: dict) -> dict:
# 1. Hero image
img = await client.images.generate(
model="gpt-image-2",
prompt=f"hero shot of {product['name']}, premium aesthetic",
size="1024x1792",
)
# 2. Animate to 8s vertical (the length of every Veo clip). The SDK has
# no method for the video and music routes, so post to them directly.
video = await client.post(
"/video/generations",
body={
"model": "veo-3",
"prompt": f"camera orbits {product['name']}, cinematic lighting",
"image_url": img.data[0].url,
"aspect_ratio": "9:16",
},
cast_to=object,
options={"timeout": 600.0},
)
# 3. BGM
bgm = await client.post(
"/audio/music",
body={
"model": "suno-v5",
"prompt": "upbeat synth, 30 seconds, brand-friendly",
},
cast_to=object,
options={"timeout": 600.0},
)
return {"video": video["data"][0]["url"], "bgm": bgm["data"][0]["url"]}Exécutez ceci pour 100 SKU en parallèle avec asyncio.gather() et vous disposez d’un pipeline de production de catalogue marketing. Coût total : environ 1 à 2 $ par SKU de bout en bout. À comparer aux 500 à 2 000 $ par ressource d’une agence créative.
Considérations pratiques
- Durée de vie des URL de résultat : les images expirent après 24 h (réhébergez-les sur votre CDN) ; les vidéos sont permanentes sur files.kunavo.com de Kunavo
- Temps de génération : image ~5-30 s, vidéo ~30 s-3 min, musique ~30 s. Utilisez
force-dynamiccôté serveur et affichez la progression aux utilisateurs - Les générations échouées sont gratuites — Kunavo ne facture jamais les erreurs 4xx/5xx ; itérez donc librement sur les prompts
- Rendu du texte dans les vidéos : Veo 3 a du mal avec les textes de plusieurs mots dans les vidéos. Effectuez le rendu du texte en postproduction (CapCut, Final Cut, canvas côté navigateur) plutôt que de demander au modèle de le rendre
- Visages réels / propriété intellectuelle : tous les grands modèles refusent la génération de célébrités, de personnages politiques et de personnages protégés par le droit d’auteur. Tenez-vous-en aux personnages originaux ou aux propriétés intellectuelles sous licence
- Proportions : 9:16 (format vertical court), 16:9 (paysage), 1:1 (fil), 4:5 (portrait Instagram). Transmettez-les via
aspect_ratiopour les vidéos ; pour les images, utilisezsize="1024x1792"etc.
Cas d’usage multimodaux courants (avec prompts de départ)
- Animations hero de produits e-commerce — image vers vidéo, caméra orbitale, 8 secondes, 9:16
- Aménagement virtuel immobilier — retouche d’image pour ajouter des meubles dans des pièces vides
- Production de carrousels marketing / Reels — génération d’images en lot dans le style de votre marque + animation Veo
- Clips explicatifs éducatifs — générez les diapositives sous forme d’images, animez-les avec Veo 3, notez-les avec Suno
- Génériques de podcast et identité audio — nappes musicales et jingles Suno pour votre émission, générés à partir d’un prompt
- Génération de ressources pour jeux / applications — portraits de personnages, icônes d’objets, arrière-plans d’environnements via Nano Banana Pro / GPT-Image-2
Quand NE PAS utiliser le multimodal
- Ressources de marque strictes — le résultat du modèle dérive, même avec des prompts précis. Utilisez l’IA pour créer des variantes d’un master conçu par un humain, pas pour remplacer ce master
- Visages de personnes réelles — refusés par tous les grands modèles ; risque juridique et de propriété intellectuelle si vous contournez cette restriction
- Vidéo en direct / génération en temps réel — les modèles actuels prennent 30 s à 3 min par clip. Ils ne conviennent pas encore aux cas d’usage en direct
- Précision à forts enjeux — imagerie médicale, preuves juridiques, publication scientifique. La génération multimodale est créative, pas factuelle
Le multimodal sous une seule facture, c’est précisément la raison d’être de Kunavo. Commencez par /docs/images ou /docs/video pour consulter les points de terminaison, ou parcourez /models filtré par catégorie.
Pour les tableaux de prix par modèle qui sous-tendent ces pipelines, consultez le comparatif des API de génération d’images et le comparatif des API de génération vidéo.
Questions fréquentes
Combien coûte la génération vidéo par clip ?
Sur Kunavo, Veo 3.1 Quality coûte $1.60+ par vidéo et Veo 3.1 Fast coûte $0.36+ par vidéo, tandis que Veo 3.1 Lite coûte $0.18+ par vidéo pour les itérations à faible coût. Seedance et Wan facturent plutôt par seconde de sortie : Seedance 2 à $0.114+ par seconde de vidéo, Seedance 2 Fast à $0.093+ par seconde de vidéo, et Wan 2.7 à $0.096+ par seconde de vidéo. Une équipe marketing qui dépensait auparavant 500–1 500 $ par tournage vidéo obtient un clip comparable au prix indiqué ci-dessus, plus environ 30 secondes de calcul.
Combien de temps les URL d’images et de vidéos générées restent-elles valides ?
Les URL des résultats d’image sont temporaires et expirent après environ 24 heures : téléchargez-les et hébergez-les immédiatement sur votre propre CDN. Les résultats vidéo sont permanents et servis depuis files.kunavo.com.
Combien de temps prennent la génération d’images, de vidéos et de musique ?
Environ 5–30 secondes pour une image, 30 secondes à 3 minutes pour une vidéo, et environ 30 secondes pour la musique. Cela exclut les modèles actuels des cas d’utilisation en direct ou en temps réel.
Les générations d’images ou de vidéos échouées sont-elles facturées ?
Non. Kunavo ne facture jamais une réponse 4xx ou 5xx : itérer sur un prompt jusqu’à ce qu’il fonctionne ne coûte donc rien au-delà des générations réussies.
Quel modèle d’image dois-je choisir ?
Nano Banana Pro lorsque l’image doit contenir du texte net — maquettes d’interface, affiches, panneaux — ainsi que pour une profondeur cinématographique. GPT-Image-2 pour les prompts littéraux et détaillés ; son prix reste fixe quelle que soit la résolution. Nano Banana 2 pour les gros volumes lorsque le coût compte ; c’est le moins cher en 1K et la fidélité reste bonne.
Combien coûte un pipeline multimodal complet par ressource ?
Enchaîner la génération d’image, la conversion image-vidéo et une piste musicale coûte environ 1–2 $ par SKU de bout en bout sur Kunavo, contre 500–2 000 $ par ressource auprès d’une agence créative. Les trois modalités passent par la même API compatible OpenAI et sont facturées sur un seul solde.