Sora es el modelo de texto a vídeo de OpenAI, y “la API de Sora” es la forma en que los equipos generan vídeo mediante programación en lugar de usar la aplicación para consumidores. En Kunavo, el texto a vídeo funciona actualmente mediante Google Veo 3 en un endpoint de vídeo con estilo OpenAI; el acceso a Sora está en la hoja de ruta y, como el endpoint es independiente del modelo, el cambio posterior a Sora consistirá en modificar una sola palabra. Esta guía muestra el flujo de trabajo con Veo 3 para que todos los ejemplos funcionen de inmediato.
¿Qué es la API de Sora?
Sora (Sora 2 y Sora 2 Pro) convierte una instrucción de texto —o una imagen estática— en un videoclip corto, con audio sincronizado en Sora 2. El formato de API permite programar la generación dentro de un pipeline: tomas de marketing, animaciones de productos, material de apoyo y vistas previas de storyboards. El formato es el mismo en los modelos de vídeo modernos: envías una instrucción y parámetros, y recibes una URL de vídeo alojado.
Vídeo en Kunavo hoy: Veo 3
Kunavo ofrece generación de vídeo mediante un único endpoint con estilo OpenAI, /v1/video/generations. Sora aún no está habilitado en el catálogo; el modelo activo de texto a vídeo es Google Veo 3, que produce clips cinematográficos con audio nativo. Los ejemplos siguientes usan veo-3; cuando llegue Sora, el único cambio será el campo model.
Inicio rápido de texto a vídeo
Una solicitud POST con su clave de Kunavo. La generación puede tardar unos minutos, por eso la llamada síncrona mantiene la conexión abierta hasta que el clip está listo:
import requests
resp = requests.post(
"https://api.kunavo.com/v1/video/generations",
headers={"Authorization": f"Bearer {API_KEY}"},
json={
"model": "veo-3",
"prompt": "a cinematic dolly-in on a red origami crane unfolding, soft light",
"aspect_ratio": "16:9",
},
timeout=600, # die Generierung kann Minuten dauern
)
print(resp.json()["data"][0]["url"])duration (en segundos) define la duración del clip en los modelos con facturación por segundo: los modelos Seedance y el modelo Wan 2.7. Los modelos Veo lo ignoran; cada clip de Veo dura 8 segundos y se factura por vídeo.
De imagen a vídeo
Para animar una imagen fija, envíe image_url (una URL https o un archivo que haya subido a /v1/files) junto con el prompt. Para controlar el movimiento, puede enviar un primer y un último fotograma con image_urls y image_mode: "frame". Encontrará ejemplos completos en la documentación de vídeo.
Ciclo de vida de una tarea asíncrona
En producción, no debería mantener abierta una conexión durante 10 minutos. Envíe una tarea a /v1/videos, reciba inmediatamente un ID de tarea y consulte después GET /v1/videos/{id} hasta que finalice. Las URL de los resultados son permanentes.
# Produktion: Task einreichen, dann pollen — keine langlebige Verbindung.
task = requests.post(
"https://api.kunavo.com/v1/videos",
headers={
"Authorization": f"Bearer {API_KEY}",
"Idempotency-Key": "my-task-uuid", # innerhalb von ~24h retry-sicher
},
json={"model": "veo-3", "prompt": "...", "aspect_ratio": "16:9"},
timeout=60,
).json()
# dann GET /v1/videos/{task["id"]} pollen, bis er fertig istLa documentación de vídeo cubre el ciclo completo de consulta, las claves de idempotencia y la entrega mediante webhooks.
Precios
Veo 3 se factura por vídeo (aquí, por un clip de 8 segundos en 720p), aproximadamente un 50–70% por debajo del precio de lista de Google. Las resoluciones superiores cuestan más; la tabla completa de niveles está en la página de precios.
| Modelo | Desde (720p / 8 s) | Precio de lista de Google | Ahorro |
|---|---|---|---|
veo-3-lite | $0.18 | $0.45 | ~60% |
veo-3 (Fast) | $0.36 | $1.20 | ~70% |
veo-3-quality | $1.60 | $3.20 | ~50% |
Consejos para crear prompts de vídeo
- Describa la escena, no solo el motivo. El movimiento de cámara (travelling, panorámica, acercamiento), el aspecto del objetivo, la iluminación y el ritmo importan más que los adjetivos.
- Especifique explícitamente la relación de aspecto:
16:9para formato horizontal y9:16para formato vertical o redes sociales. - Cada clip de Veo dura 8 segundos. Planifica cada toma para esa duración y une varias generaciones para crear secuencias más largas.
- Utilice un fotograma de referencia (de imagen a vídeo) cuando necesite que un personaje o producto concreto se mantenga coherente.
Preguntas frecuentes
¿Puedo usar hoy la API de Sora en Kunavo?
Sora aún no está activado en el catálogo de Kunavo. Actualmente, el texto a vídeo funciona mediante Google Veo 3 en el mismo endpoint /v1/video/generations con estilo OpenAI. Como el endpoint es independiente del modelo, el cambio posterior a Sora consistirá en modificar una sola palabra en el campo model. El acceso a Sora está en la hoja de ruta.
¿Qué es la API de Sora?
Sora es el modelo de texto a vídeo de OpenAI (Sora 2 y Sora 2 Pro). La API de Sora genera videoclips cortos —con audio sincronizado en Sora 2— a partir de una instrucción de texto o una imagen estática, de forma programática y no mediante la aplicación para consumidores.
¿Cuánto cuesta la generación de vídeo en Kunavo?
Veo 3 se factura por vídeo, aproximadamente un 50–70% por debajo del precio de lista de Google: Veo 3 Lite desde $0.18, Veo 3 Fast desde $0.36 y Veo 3 Quality desde $1.60 por clip de 8 segundos en 720p. Las resoluciones superiores cuestan más.
¿Kunavo admite imagen a vídeo?
Sí. Pasa image_url (una URL https o un archivo subido) a /v1/video/generations para animar una imagen estática. También puedes pasar un primer y un último fotograma para crear transiciones controladas.
¿Cuánto tarda la generación?
Minutos. En producción, utiliza la API de tareas asíncronas /v1/videos y consulta periódicamente; consulta la documentación de vídeo. Las tarifas por modelo también aparecen en la guía de precios de la API de Gemini.
¿Necesito una clave independiente para esto?
No: la misma clave de Kunavo cubre vídeo, texto e imagen. Consulta la guía Cómo crear una clave de API de Google Gemini para saber cómo crearla; la clave generada allí funciona sin cambios en /v1/video/generations.