Voltar aos guias
Vídeo·8 de junho de 2026·Atualizado em 1 de outubro de 2026·7 min de leitura

API do Sora — text-to-video em um fluxo compatível com OpenAI

Sora é o modelo text-to-video da OpenAI. No Kunavo, o modelo text-to-video disponível é o Google Veo 3.1, no mesmo endpoint de vídeo no estilo OpenAI — veja o fluxo, com acesso ao Sora no roteiro.

Última revisão em .

Sora é o modelo de texto para vídeo da OpenAI, e “a API do Sora” é como as equipes geram vídeo programaticamente em vez de usar o app para consumidores. Hoje, no Kunavo, o texto para vídeo funciona com o Google Veo 3 por meio de um único endpoint de vídeo no formato da OpenAI — o acesso ao Sora está no roadmap e, como o endpoint é independente do modelo, migrar para o Sora depois será uma alteração de uma palavra. Este guia mostra o fluxo de trabalho com o Veo 3 para que todos os exemplos funcionem agora.

O que é a API do Sora?

Sora (Sora 2 e Sora 2 Pro) transforma um prompt de texto — ou uma imagem estática — em um clipe curto de vídeo, com áudio sincronizado no Sora 2. O formato da API permite inserir a geração em um pipeline: cenas de marketing, animações de produtos, b-roll e prévias de storyboard. O formato é o mesmo nos modelos de vídeo modernos: envie um prompt e parâmetros e receba uma URL de vídeo hospedada.

Vídeo no Kunavo hoje: Veo 3

O Kunavo disponibiliza geração de vídeo por meio de um único endpoint no formato da OpenAI, /v1/video/generations. O Sora ainda não está habilitado no catálogo; o modelo ativo de texto para vídeo é o Google Veo 3, que produz clipes cinematográficos com áudio nativo. Os exemplos abaixo usam veo-3 — quando o Sora chegar, a única mudança será o campo model.

Início rápido de texto para vídeo

Um POST com sua chave do Kunavo. A geração pode levar alguns minutos, então a chamada síncrona mantém a conexão aberta até que o clipe esteja pronto:

text_to_video.py
import requests

resp = requests.post(
    "https://api.kunavo.com/v1/video/generations",
    headers={"Authorization": f"Bearer {API_KEY}"},
    json={
        "model": "veo-3",
        "prompt": "a cinematic dolly-in on a red origami crane unfolding, soft light",
        "aspect_ratio": "16:9",
    },
    timeout=600,  # generation can take minutes
)
print(resp.json()["data"][0]["url"])

duration (em segundos) define a duração do clipe nos modelos cobrados por segundo: os modelos Seedance e o Wan 2.7. Os modelos Veo ignoram esse valor; cada clipe do Veo tem 8 segundos e é cobrado por vídeo.

Imagem para vídeo

Para animar uma imagem estática, envie image_url (uma URL https ou um arquivo carregado por você em /v1/files) junto com o prompt. Para controlar o movimento, você pode enviar um primeiro e um último quadro com image_urls e image_mode: "frame". Exemplos completos estão na documentação de vídeo.

Ciclo de vida assíncrono das tarefas

Em produção, não mantenha uma conexão aberta por 10 minutos. Envie uma tarefa para /v1/videos, receba imediatamente um ID de tarefa e faça polling em GET /v1/videos/{id} até a conclusão. As URLs dos resultados são permanentes.

async_submit.py
# Production: submit a task, then poll — no long-lived connection.
task = requests.post(
    "https://api.kunavo.com/v1/videos",
    headers={
        "Authorization": f"Bearer {API_KEY}",
        "Idempotency-Key": "my-task-uuid",   # retry-safe within ~24h
    },
    json={"model": "veo-3", "prompt": "...", "aspect_ratio": "16:9"},
    timeout=60,
).json()
# then poll GET /v1/videos/{task["id"]} until it completes

A documentação de vídeo cobre todo o loop de polling, as chaves de idempotência e a entrega por webhook.

Preços

O Veo 3 é cobrado por vídeo (por clipe de 8 segundos em 720p, como mostrado aqui), cerca de 50–70% abaixo do preço de tabela do Google. Resoluções maiores custam mais — consulte a página de preços para ver a tabela completa de níveis.

ModeloA partir de (720p / 8s)Tabela do GoogleVocê economiza
veo-3-lite$0.18$0.45~60%
veo-3 (Fast)$0.36$1.20~70%
veo-3-quality$1.60$3.20~50%

Dicas de prompting para vídeo

  • Descreva a cena, não apenas o assunto. Movimento de câmera (dolly, panorâmica, aproximação), sensação da lente, iluminação e ritmo importam mais do que adjetivos.
  • Defina explicitamente a proporção de tela — 16:9 para paisagem, 9:16 para vertical/social.
  • Cada clipe do Veo tem 8 segundos. Planeje cada cena para essa duração e una várias gerações para sequências mais longas.
  • Use um quadro de referência (imagem para vídeo) quando precisar manter consistente um personagem ou produto específico.

Perguntas frequentes

Posso usar a API do Sora no Kunavo hoje?

O Sora ainda não está habilitado no catálogo do Kunavo. Hoje, o texto para vídeo funciona com o Google Veo 3 por meio do mesmo endpoint OpenAI-style /v1/video/generations. Como o endpoint é independente do modelo, mudar para o Sora depois será uma alteração de uma palavra no campo do modelo. O acesso ao Sora está no roadmap.

O que é a API do Sora?

Sora é o modelo de texto para vídeo da OpenAI (Sora 2 e Sora 2 Pro). A API do Sora gera clipes curtos — com áudio sincronizado no Sora 2 — a partir de um prompt de texto ou de uma imagem estática, programaticamente, em vez de pelo app para consumidores.

Quanto custa a geração de vídeo no Kunavo?

O Veo 3 é cobrado por vídeo, cerca de 50–70% abaixo do preço de tabela do Google: Veo 3 Lite a partir de $0.18, Veo 3 Fast a partir de $0.36, Veo 3 Quality a partir de $1.60 por clipe de 8 segundos em 720p. Resoluções maiores custam mais.

O Kunavo oferece suporte a imagem para vídeo?

Sim. Envie image_url (uma URL https ou um arquivo carregado) para /v1/video/generations para animar uma imagem estática. Você também pode enviar um primeiro e um último quadro para transições controladas.

Quanto tempo leva a geração?

Minutos. Use a /v1/videos API de tarefas assíncronas e faça polling em produção; consulte a documentação de vídeo.