A maioria dos agregadores de LLM para no texto. No momento em que seu produto precisa gerar uma imagem, editar uma foto, animar uma imagem estática em vídeo, dar voz a um anúncio ou compor música, você volta a gerenciar mais três fornecedores, mais três cobranças e mais três SDKs. O Kunavo oferece tudo isso pela mesma API compatível com OpenAI. Este guia explica quando recorrer a cada modalidade, o menu de modelos de cada modalidade e como encadeá-las em pipelines multimodais de produção.
O menu de modalidades (e para que serve cada uma)
- Geração de texto — Claude Opus/Sonnet/Haiku e GPT. Use para raciocínio, chat e saída estruturada. /docs/chat
- Geração de imagens (texto para imagem) — Nano Banana Pro, GPT-Image-2, Nano Banana 2. A escolha varia conforme o caso de uso (veja a comparação abaixo)
- Edição de imagens (imagem para imagem) — Nano Banana Edit, GPT-Image-2 Edit. Substitua texto em embalagens, troque fundos, aplique outro estilo
- Geração de vídeo — Veo 3 Lite/Fast/Quality, Seedance 2 e Seedance 2 Fast, Wan 2.7. Texto para vídeo e imagem para vídeo são compatíveis
- Áudio — Música — Suno V5 / V5.5. Músicas completas a partir de um prompt
Consulte o catálogo completo em /models.
Escolhendo um modelo de imagem — a regra dos 30 segundos
- Precisa de texto nítido na imagem (mockups de UI, pôsteres, placas)? → Nano Banana Pro. Não há comparação
- Prompts literais e detalhados? → GPT-Image-2. Forte compreensão de prompts; preço fixo em todas as resoluções
- Alto volume quando o custo importa? → Nano Banana 2. Mais barato em 1K, com boa fidelidade
- Visual cinematográfico com profundidade? → Nano Banana Pro. O bokeh é genuinamente cinematográfico
Veja a análise completa em nossa comparação de modelos de imagem — nossa comparação atualizada de modelos de imagem.
Escolhendo um modelo de vídeo
Três famílias estão disponíveis, e elas cobram por unidades diferentes — Veo 3 por vídeo, Seedance e Wan por segundo de saída. Os preços abaixo são as tarifas do catálogo:
| Modelo | Preço do Kunavo | Unidade de cobrança | Melhor para |
|---|---|---|---|
veo-3-quality | $1.60+ | por vídeo | Melhor fidelidade geral, áudio nativo |
veo-3 | $0.36+ | por vídeo | O ponto ideal para a maioria dos clipes de produção |
veo-3-lite | $0.18+ | por vídeo | Iteração econômica durante a criação da ideia |
seedance-2 | $0.114+ | por segundo de vídeo | Movimento forte e boa aderência ao prompt |
seedance-2-fast | $0.093+ | por segundo de vídeo | Troca parte da fidelidade por velocidade |
seedance-2-mini | $0.0245+ | por segundo de vídeo | Mais barato por segundo, clipes curtos de alto volume |
wan-2-7 | $0.096+ | por segundo de vídeo | Geração cinematográfica de vídeos a partir de texto, em 720p ou 1080p |
Como o endpoint é independente do modelo, trocar de família exige alterar apenas o campo model. Guia rápido de vídeo em nosso guia rápido do Veo 3; detalhes por modelo nos guias da API do Seedance e da API do Wan.
Gerando uma imagem — o básico
# Text-to-image: same OpenAI SDK, different model slug
img = client.images.generate(
model="nano-banana-pro", # Google's flagship — best text rendering
prompt="a marketing hero for a fintech app, isometric, soft blue palette",
size="1024x1024",
)
print(img.data[0].url) # 24h temporary URL — download immediatelyAs URLs dos resultados são temporárias (24h para imagens, permanentes para vídeos por meio da CDN files.kunavo.com). Para imagens, baixe imediatamente e armazene em sua própria CDN.
Imagem para vídeo — levando seus ativos existentes ao movimento
Você já tem fotografias de produtos em seu site. O Veo 3 pode animar qualquer uma delas em um clipe de produto de 8 segundos:
# Image-to-video: upload a hero image, animate into an 8-second product clip
# (every Veo clip is 8 seconds; the Veo models ignore "duration").
# The OpenAI SDK has no method for the video route, so post to it with the
# same client.
video = client.post(
"/video/generations",
body={
"model": "veo-3",
"prompt": "camera slowly orbits, soft cinematic light, product hero shot",
"image_url": hero_image_url,
"aspect_ratio": "9:16", # vertical for Reels / TikTok / IG short
"resolution": "1080p",
},
cast_to=object,
options={"timeout": 600.0}, # a clip takes minutes
)
print(video["data"][0]["url"])Equipes de marketing que antes gastavam US$ 500–1500 por filmagem de vídeo reduzem isso a um clipe de $0.18+ (Veo 3.1 Lite) a $1.60+ (Veo 3.1 Quality), mais cerca de 30 segundos de computação. Funciona especialmente bem para animações principais de e-commerce, capturas de tela da App Store / Play Store e apresentações de produtos nas redes sociais.
Encadeando modalidades — o verdadeiro superpoder
Os fluxos de trabalho mais interessantes combinam modalidades em sequência. Uma linha de produção de clipes de marketing:
# Pipeline: GPT-Image generates a marketing hero, Veo 3 animates it,
# Suno scores the BGM. One API, one bill.
# Here client is AsyncOpenAI(api_key=..., base_url="https://api.kunavo.com/v1").
async def make_marketing_clip(product: dict) -> dict:
# 1. Hero image
img = await client.images.generate(
model="gpt-image-2",
prompt=f"hero shot of {product['name']}, premium aesthetic",
size="1024x1792",
)
# 2. Animate to 8s vertical (the length of every Veo clip). The SDK has
# no method for the video and music routes, so post to them directly.
video = await client.post(
"/video/generations",
body={
"model": "veo-3",
"prompt": f"camera orbits {product['name']}, cinematic lighting",
"image_url": img.data[0].url,
"aspect_ratio": "9:16",
},
cast_to=object,
options={"timeout": 600.0},
)
# 3. BGM
bgm = await client.post(
"/audio/music",
body={
"model": "suno-v5",
"prompt": "upbeat synth, 30 seconds, brand-friendly",
},
cast_to=object,
options={"timeout": 600.0},
)
return {"video": video["data"][0]["url"], "bgm": bgm["data"][0]["url"]}Execute isso para 100 SKUs em paralelo com asyncio.gather() e você terá um pipeline de produção de catálogo de marketing. Custo total de aproximadamente US$ 1–2 por SKU, do início ao fim. Compare com US$ 500–2000 por ativo de uma agência criativa.
Considerações práticas
- Validade das URLs dos resultados: as imagens expiram em 24h (hospede novamente em sua CDN); os vídeos são permanentes em files.kunavo.com do Kunavo
- Tempo de geração: imagem ~5–30 s, vídeo ~30 s–3 min, música ~30 s. Use
force-dynamicno servidor e mostre o progresso aos usuários - Gerações malsucedidas são gratuitas — o Kunavo nunca cobra 4xx/5xx; portanto, itere livremente nos prompts
- Renderização de texto em vídeo: o Veo 3 tem dificuldade com texto de várias palavras em vídeo. Renderize o texto na pós-produção (CapCut, Final Cut, canvas no navegador) em vez de pedir ao modelo que o renderize
- Rostos reais / propriedade intelectual: todos os principais modelos recusam a geração de celebridades, conteúdo político e personagens protegidos por direitos autorais. Use personagens originais ou propriedade intelectual licenciada
- Proporções: 9:16 (vídeo vertical curto), 16:9 (paisagem), 1:1 (feed), 4:5 (retrato do Instagram). Passe por
aspect_rationo vídeo; nas imagens, usesize="1024x1792"etc.
Casos de uso multimodais comuns (com prompts iniciais)
- Animações principais de produtos para e-commerce — imagem para vídeo, câmera orbital, 8 segundos, 9:16
- Ambientação virtual de imóveis — edição de imagem para adicionar móveis a cômodos vazios
- Produção de carrosséis de marketing / Reels — geração de imagens em lote no estilo da sua marca + animação com Veo
- Clipes explicativos educacionais — gere slides como imagens, anime-os com Veo 3 e pontue-os com Suno
- Vinhetas de podcast e identidade sonora — trilhas e vinhetas musicais do Suno para seu programa, geradas a partir de um prompt
- Geração de ativos para jogos / aplicativos — retratos de personagens, ícones de itens e fundos de ambientes via Nano Banana Pro / GPT-Image-2
Quando NÃO usar multimodalidade
- Ativos estritos da marca — a saída do modelo sofre desvios, mesmo com prompts precisos. Use IA para variações de um original criado por humanos, não para substituí-lo
- Rostos de pessoas reais — recusados por todos os principais modelos; há risco jurídico/de propriedade intelectual se você contornar isso
- Vídeo ao vivo / geração em tempo real — os modelos atuais levam de 30 s a 3 min por clipe. Ainda não são adequados para casos de uso ao vivo
- Precisão em situações críticas — imagens médicas, provas jurídicas, publicação científica. A geração multimodal é criativa, não factual
A multimodalidade em uma única cobrança é o verdadeiro propósito do Kunavo. Comece em /docs/images ou /docs/video para consultar os endpoints, ou navegue por /models filtrando por categoria.
Para as tabelas de preços por modelo usadas nesses pipelines, consulte a comparação de APIs de geração de imagens e a comparação de APIs de geração de vídeos.
Perguntas frequentes
Quanto custa gerar um vídeo de IA por clipe?
No Kunavo, Veo 3.1 Quality custa $1.60+ por vídeo e Veo 3.1 Fast custa $0.36+ por vídeo, enquanto Veo 3.1 Lite custa $0.18+ por vídeo para iterações econômicas. Seedance e Wan cobram por segundo de saída: Seedance 2 a $0.114+ por segundo de vídeo, Seedance 2 Fast a $0.093+ por segundo de vídeo e Wan 2.7 a $0.096+ por segundo de vídeo. Uma equipe de marketing que antes gastava US$ 500–1.500 por filmagem de vídeo obtém um clipe comparável pelo preço acima, mais cerca de 30 segundos de computação.
Por quanto tempo as URLs de imagens e vídeos gerados permanecem válidas?
As URLs dos resultados de imagem são temporárias e expiram após cerca de 24 horas; portanto, baixe os arquivos e hospede-os imediatamente em sua própria CDN. Os resultados de vídeo são permanentes e são servidos por files.kunavo.com.
Quanto tempo levam as gerações de imagem, vídeo e música?
Aproximadamente 5–30 segundos para uma imagem, 30 segundos a 3 minutos para um vídeo e cerca de 30 segundos para música. Isso torna os modelos atuais inadequados para casos de uso ao vivo ou em tempo real.
Gerações de imagem ou vídeo que falham são cobradas?
Não. O Kunavo nunca cobra uma resposta 4xx ou 5xx; portanto, iterar em um prompt até funcionar não custa nada além das gerações bem-sucedidas.
Qual modelo de imagem devo escolher?
Nano Banana Pro quando a imagem precisa conter texto nítido — mockups de UI, pôsteres, placas — e para profundidade cinematográfica. GPT-Image-2 para prompts literais e detalhados; o preço é fixo em todas as resoluções. Nano Banana 2 para alto volume quando o custo importa; é o mais barato em 1K e mantém boa fidelidade.
Quanto custa um pipeline multimodal completo por ativo?
Encadear geração de imagem, conversão de imagem em vídeo e uma trilha musical custa aproximadamente US$ 1–2 por SKU, do início ao fim, no Kunavo, contra US$ 500–2.000 por ativo de uma agência criativa. As três modalidades usam a mesma API compatível com OpenAI e são cobradas de um único saldo.