Retour aux guides
Vidéo·18 juin 2026·Mis à jour le 1 octobre 2026·7 min de lecture

API Sora — texte-vers-vidéo dans un flux compatible avec OpenAI

Sora est le modèle texte-vers-vidéo d’OpenAI. Sur Kunavo, le modèle disponible est Google Veo 3.1, via le même endpoint vidéo au format OpenAI — voici le flux de travail, l’accès à Sora étant prévu sur la feuille de route.

Sora est le modèle texte-vidéo d’OpenAI, et « l’API Sora » désigne la manière dont les équipes génèrent des vidéos de façon programmatique plutôt que via l’application grand public. Aujourd’hui, sur Kunavo, la génération texte-vidéo fonctionne avec Google Veo 3 via un endpoint vidéo unique au format OpenAI — l’accès à Sora figure sur la feuille de route et, comme l’endpoint est indépendant du modèle, migrer vers Sora plus tard consistera à modifier un seul mot. Ce guide présente le workflow Veo 3 afin que chaque exemple fonctionne dès maintenant.

Qu’est-ce que l’API Sora ?

Sora (Sora 2 et Sora 2 Pro) transforme un prompt textuel — ou une image fixe — en un court clip vidéo, avec audio synchronisé dans Sora 2. Le format API permet d’orchestrer la génération dans un pipeline : plans marketing, animations de produits, plans d’illustration, aperçus de storyboard. Le format est le même pour les modèles vidéo modernes : vous envoyez un prompt et des paramètres, puis recevez l’URL d’une vidéo hébergée.

La vidéo sur Kunavo aujourd’hui : Veo 3

Kunavo expose la génération vidéo via un endpoint unique au format OpenAI, /v1/video/generations. Sora n’est pas encore activé dans le catalogue ; le modèle texte-vidéo disponible est Google Veo 3, qui produit des clips cinématographiques avec audio natif. Les exemples ci-dessous utilisent veo-3 — lorsque Sora sera disponible, le seul changement sera le champ model.

Démarrage rapide du texte vers vidéo

Un POST avec votre clé Kunavo. La génération peut prendre quelques minutes ; l’appel synchrone maintient donc la connexion ouverte jusqu’à ce que le clip soit prêt :

texto_para_video.py
import requests

resp = requests.post(
    "https://api.kunavo.com/v1/video/generations",
    headers={"Authorization": f"Bearer {API_KEY}"},
    json={
        "model": "veo-3",
        "prompt": "um dolly-in cinematográfico em um origami de garça vermelha se abrindo, luz suave",
        "aspect_ratio": "16:9",
    },
    timeout=600,  # a geração pode levar minutos
)
print(resp.json()["data"][0]["url"])

duration (en secondes) définit la durée du clip pour les modèles facturés à la seconde : les modèles Seedance et le modèle Wan 2.7. Les modèles Veo l’ignorent ; chaque clip Veo dure 8 secondes et est facturé par vidéo.

Image vers vidéo

Pour animer une image fixe, transmettez image_url (une URL https ou un fichier téléversé vers /v1/files) avec le prompt. Pour contrôler le mouvement, vous pouvez transmettre une première et une dernière image avec image_urls et image_mode: "frame". Des exemples complets figurent dans la documentation vidéo.

Cycle de vie d’une tâche asynchrone

En production, ne maintenez pas une connexion ouverte pendant 10 minutes. Envoyez une tâche à /v1/videos, recevez immédiatement un identifiant de tâche, puis effectuez un polling sur GET /v1/videos/{id} jusqu’à la fin. Les URL de résultats sont permanentes.

envio_assincrono.py
# Produção: envie uma tarefa e faça polling — sem conexão de longa duração.
task = requests.post(
    "https://api.kunavo.com/v1/videos",
    headers={
        "Authorization": f"Bearer {API_KEY}",
        "Idempotency-Key": "meu-uuid-de-tarefa",   # seguro para retry em ~24h
    },
    json={"model": "veo-3", "prompt": "...", "aspect_ratio": "16:9"},
    timeout=60,
).json()
# depois faça polling em GET /v1/videos/{task["id"]} até concluir

La documentation vidéo couvre la boucle complète de polling, les clés d’idempotence et la livraison par webhook.

Tarifs

Veo 3 est facturé par vidéo (pour un clip de 8 secondes en 720p, comme indiqué ici), environ 50–70 % sous le prix catalogue de Google. Les résolutions supérieures coûtent davantage — consultez la page des prix pour le tableau complet des niveaux.

ModèleÀ partir de (720p / 8 s)Catalogue GoogleVotre économie
veo-3-lite$0.18$0.45~60%
veo-3 (Fast)$0.36$1.20~70%
veo-3-quality$1.60$3.20~50%

Conseils de prompt vidéo

  • Décrivez le plan, pas seulement le sujet. Le mouvement de caméra (travelling, panoramique, zoom avant), le rendu de l’objectif, l’éclairage et le rythme comptent davantage que les adjectifs.
  • Définissez explicitement le format — 16:9 pour le paysage, 9:16 pour le portrait et les réseaux sociaux.
  • Chaque clip Veo dure 8 secondes. Prévoyez chaque plan pour cette durée et assemblez plusieurs générations pour les séquences plus longues.
  • Utilisez une image de référence (image vers vidéo) lorsque vous devez maintenir la cohérence d’un personnage ou d’un produit spécifique.

Questions fréquentes

Peut-on utiliser l’API Sora sur Kunavo aujourd’hui ?

Sora n’est pas encore activé dans le catalogue de Kunavo. La génération texte-vidéo fonctionne aujourd’hui avec Google Veo 3, via le même endpoint /v1/video/generations au format OpenAI. Comme l’endpoint est indépendant du modèle, migrer vers Sora plus tard consistera à modifier un seul mot dans le champ model. L’accès à Sora figure sur la feuille de route.

Qu’est-ce que l’API Sora ?

Sora est le modèle texte-vidéo d’OpenAI (Sora 2 et Sora 2 Pro). L’API Sora génère de courts clips vidéo — avec audio synchronisé dans Sora 2 — à partir d’un prompt textuel ou d’une image fixe, de manière programmatique plutôt que via l’application grand public.

Combien coûte la génération vidéo sur Kunavo ?

Veo 3 est facturé par vidéo, environ 50–70 % sous le prix catalogue de Google : Veo 3 Lite à partir de $0.18, Veo 3 Fast à partir de $0.36, Veo 3 Quality à partir de $1.60 par clip de 8 secondes en 720p. Les résolutions supérieures coûtent davantage.

Kunavo prend-il en charge l’image vers vidéo ?

Oui. Transmettez image_url (une URL https ou un fichier téléversé) à /v1/video/generations pour animer une image fixe. Vous pouvez également transmettre une première et une dernière image pour des transitions contrôlées.

Combien de temps prend la génération ?

Quelques minutes. En production, utilisez l’API de tâches asynchrones /v1/videos et effectuez un polling ; consultez la documentation vidéo. Pour les tarifs de Gemini et des modèles de texte, consultez le guide des prix de l’API Gemini.