Sora é o modelo de conversão de texto em vídeo da OpenAI, e “a API da Sora” é a forma de as equipes gerarem vídeos programaticamente em vez de usar o aplicativo para consumidores. Na Kunavo, hoje a conversão de texto em vídeo funciona com o Google Veo 3 em um endpoint de vídeo semelhante ao da OpenAI — o acesso à Sora está no roadmap e, como o endpoint é independente do modelo, a futura mudança para a Sora será uma alteração de uma palavra. Este guia mostra o fluxo de trabalho com o Veo 3 para que todos os exemplos funcionem imediatamente.
O que é a API da Sora?
A Sora (Sora 2 e Sora 2 Pro) transforma um prompt de texto — ou uma imagem estática — em um clipe curto de vídeo, com áudio sincronizado na Sora 2. O formato da API permite programar a geração em um pipeline: cenas de marketing, animações de produtos, B-roll e prévias de storyboards. O formato é igual em modelos de vídeo modernos: envie o prompt e os parâmetros e receba uma URL de vídeo hospedada.
Vídeo na Kunavo hoje: Veo 3
A Kunavo disponibiliza a geração de vídeo por meio de um único endpoint semelhante ao da OpenAI, /v1/video/generations. A Sora ainda não está ativada no catálogo; o modelo ativo de conversão de texto em vídeo é o Google Veo 3, que gera clipes cinematográficos com áudio nativo. Os exemplos abaixo usam veo-3 — quando a Sora chegar, a única alteração será o campo model.
Início rápido de texto para vídeo
Um POST com sua chave da Kunavo. A geração pode levar alguns minutos, por isso a chamada síncrona mantém a conexão aberta até o clipe ficar pronto:
import requests
resp = requests.post(
"https://api.kunavo.com/v1/video/generations",
headers={"Authorization": f"Bearer {API_KEY}"},
json={
"model": "veo-3",
"prompt": "a cinematic dolly-in on a red origami crane unfolding, soft light",
"aspect_ratio": "16:9",
},
timeout=600, # die Generierung kann Minuten dauern
)
print(resp.json()["data"][0]["url"])duration (em segundos) define a duração do clipe nos modelos cobrados por segundo: os modelos Seedance e o Wan 2.7. Os modelos Veo ignoram esse valor; cada clipe do Veo tem 8 segundos e é cobrado por vídeo.
Imagem para vídeo
Para animar uma imagem estática, envie image_url (uma URL https ou um arquivo que você carregou em /v1/files) junto com o prompt. Para controlar o movimento, você pode fornecer um primeiro e um último frame usando image_urls e image_mode: "frame". Exemplos completos estão na documentação de vídeo.
Ciclo de vida de uma tarefa assíncrona
Em produção, você não deve manter uma conexão aberta por 10 minutos. Envie uma tarefa para /v1/videos, receba imediatamente um ID de tarefa e faça polling em GET /v1/videos/{id} até que ela seja concluída. As URLs dos resultados são permanentes.
# Produktion: Task einreichen, dann pollen — keine langlebige Verbindung.
task = requests.post(
"https://api.kunavo.com/v1/videos",
headers={
"Authorization": f"Bearer {API_KEY}",
"Idempotency-Key": "my-task-uuid", # innerhalb von ~24h retry-sicher
},
json={"model": "veo-3", "prompt": "...", "aspect_ratio": "16:9"},
timeout=60,
).json()
# dann GET /v1/videos/{task["id"]} pollen, bis er fertig istA documentação de vídeo aborda todo o loop de polling, as chaves de idempotência e a entrega de webhooks.
Preços
O Veo 3 é cobrado por vídeo (aqui, por clipe de 8 segundos em 720p), cerca de 50–70% abaixo do preço de tabela do Google. Resoluções maiores custam mais — a tabela completa de níveis está na página de preços.
| Modelo | A partir de (720p / 8s) | Tabela do Google | Sua economia |
|---|---|---|---|
veo-3-lite | $0.18 | $0.45 | ~60% |
veo-3 (Fast) | $0.36 | $1.20 | ~70% |
veo-3-quality | $1.60 | $3.20 | ~50% |
Dicas de prompting para vídeo
- Descreva a cena, não apenas o assunto. Movimento de câmera (dolly, panorâmica, push-in), aparência da lente, iluminação e ritmo importam mais do que adjetivos.
- Defina explicitamente a proporção de aspecto —
16:9para paisagem,9:16para retrato/redes sociais. - Cada clipe do Veo tem 8 segundos. Planeje cada cena para essa duração e una várias gerações para sequências mais longas.
- Use um frame de referência (imagem para vídeo) quando quiser manter consistente uma personagem ou um produto específico.
Perguntas frequentes
Posso usar a API da Sora na Kunavo hoje?
A Sora ainda não está ativada no catálogo da Kunavo. Hoje, a conversão de texto em vídeo usa o Google Veo 3 no mesmo endpoint /v1/video/generations semelhante ao da OpenAI. Como o endpoint é independente do modelo, a futura mudança para a Sora será uma alteração de uma palavra no campo model. O acesso à Sora está no roadmap.
O que é a API da Sora?
Sora é o modelo de conversão de texto em vídeo da OpenAI (Sora 2 e Sora 2 Pro). A API da Sora gera clipes curtos de vídeo — com áudio sincronizado na Sora 2 — a partir de um prompt de texto ou de uma imagem estática, de forma programática, em vez de usar o aplicativo para consumidores.
Quanto custa a geração de vídeo na Kunavo?
O Veo 3 é cobrado por vídeo, cerca de 50–70% abaixo do preço de tabela do Google: Veo 3 Lite a partir de $0.18, Veo 3 Fast a partir de $0.36 e Veo 3 Quality a partir de $1.60 por clipe de 8 segundos em 720p. Resoluções maiores custam mais.
A Kunavo oferece suporte a imagem para vídeo?
Sim. Envie image_url (uma URL https ou um arquivo carregado) para /v1/video/generations para animar uma imagem estática. Para transições controladas, você também pode enviar um primeiro e um último frame.
Quanto tempo leva a geração?
Minutos. Em produção, use a API de tarefas assíncrona /v1/videos e faça polling; consulte a documentação de vídeo. As tarifas por modelo também estão no guia de preços da API do Gemini.
Preciso de uma chave própria para isso?
Não — a mesma chave da Kunavo cobre vídeo, texto e imagem. Como criá-la está no guia Como criar uma chave da API do Google Gemini; a chave criada ali funciona sem alterações em /v1/video/generations.