Volver al blog
Tutorial·25 de mayo de 2026·6 min de lectura

Crear anuncios de vídeo corto para marcas taiwanesas con Veo 3 (el mismo endpoint de Sora estará disponible próximamente) — tutorial completo de 5 minutos

Tutorial completo, desde un prompt de texto hasta vídeos verticales 9:16 para Reels / TikTok / IG. Anima fotos de productos existentes para crear vídeos. 5 aplicaciones reales para marcas taiwanesas, aspectos que debes tener en cuenta al renderizar chino tradicional y técnicas avanzadas para calidad apta para uso comercial.

Para los anuncios de vídeos cortos de Reels / TikTok / IG de marcas taiwanesas, lo más doloroso suele ser que «buscar grabación, edición y posproducción» requiere una semana. La conversión de texto a vídeo mediante IA comprime este proceso a 5 minutos y la calidad ya permite usarla en campañas comerciales reales. Este artículo enseña cómo hacerlo con casos prácticos.

En Kunavo, el modelo de conversión de texto a vídeo live disponible actualmente es Google Veo 3; Sora de OpenAI (sora-2) sigue en la hoja de ruta y aún no está disponible. La buena noticia es que ambos utilizan el mismo endpoint compatible con OpenAI, por lo que todos los ejemplos de este artículo usan veo-3; cuando Sora esté disponible, solo habrá que cambiar un campo model. Consulte la explicación completa en la guía de la API de Sora.

Complete un vídeo corto vertical 9:16 en 5 minutos

Kunavo incluye Veo 3 en un endpoint /v1/videos compatible con OpenAI; basta con cambiar una línea de base_url para utilizarlo:

text_to_video.py
import time
from openai import OpenAI

client = OpenAI(
    api_key="sk-kn-...",
    base_url="https://api.kunavo.com/v1",
)

def make_video(**params):
    """送出影片任務,等它完成,回傳影片 URL。"""
    # OpenAI SDK 沒有能直接呼叫這個端點的方法,所以用同一個 client 送 JSON
    task = client.post("/videos", body=params, cast_to=object)
    while task["status"] not in ("completed", "failed"):
        time.sleep(5)  # 生成通常要 30 秒到幾分鐘
        task = client.get(f"/videos/{task['id']}", cast_to=object)
    if task["status"] == "failed":
        raise RuntimeError(task["error"]["message"])
    return task["output"]["url"]

# 文字轉影片:8 秒、9:16 直式(Reels / TikTok / IG 短影片)
# 每支 Veo 影片固定 8 秒,Veo 模型會忽略 duration
url = make_video(
    model="veo-3",
    prompt=(
        "近距離鏡頭:手沖咖啡從濾杯滴入透明玻璃杯,"
        "蒸氣緩緩上升,深色背景,柔光打在杯緣上。"
        "結尾 logo 浮現:『晨曦咖啡 · 台北東區』"
    ),
    aspect_ratio="9:16",
    resolution="1080p",
)
print(url)  # files.kunavo.com 的永久連結

Cada vídeo de Veo 3 dura siempre 8 segundos; un vídeo vertical 1080p cuesta $0.42 (en Kunavo, Veo 3 Quality cuesta $1.60 y Veo 3 Lite $0.224). Es dos órdenes de magnitud más barato que contratar un equipo local de grabación en Taiwán.

Imagen a vídeo: dé vida directamente a las imágenes existentes de productos

Su sitio de momo / Shopee / propio ya tiene fotografías de productos. Veo 3 admite usar una imagen como primer fotograma y genera automáticamente una toma envolvente de 8 segundos o una demostración de detalles:

image_to_video.py
# 圖生影片:用既有產品圖做 8 秒展示影片(沿用上面的 make_video)
url = make_video(
    model="veo-3",
    prompt="鏡頭環繞商品旋轉,柔和光線變化",
    image_url="https://your-cdn.com/product-hero.jpg",
    aspect_ratio="9:16",
)
print(url)

Una fotografía de producto de un fotógrafo cuesta aproximadamente NT$500-1500, y añadir una toma dinámica cuesta al menos NT$3000-5000; Veo 3 cuesta $0.50, unos NT$16 al tipo de cambio, por lo que el vídeo completo cuesta solo 8 dólares taiwaneses.

5 aplicaciones habituales para marcas taiwanesas

  1. Lanzamiento de un producto nuevo de una tienda de bebidas: proceso de preparación manual, giro de la espuma de leche y vertido del sirope; basta con describirlo mediante texto para generar varias versiones de vídeos de 8 segundos y hacer pruebas A/B de la tasa de clics de Facebook Ads
  2. Comida de mercado nocturno: grasa que chisporrotea, primer plano al retirar la comida de la sartén y aderezo vertiéndose; combine escenas locales taiwanesas, como luces rojas de mercados nocturnos y letreros de calles antiguas, para crear recuerdo de marca
  3. Reels de productos de comercio electrónico: fotografía del producto → vídeo generado a partir de imagen con Veo 3 → publicación directa en la página del producto de IG / TikTok / Shopee
  4. Turismo / alojamiento: habitaciones de hotel, tomas aéreas de lugares turísticos y ambiente estacional; no hace falta enviar realmente a un fotógrafo a Alishan, la generación mediante IA ya es suficiente
  5. Introducción de vídeos de unboxing de creadores individuales: una introducción de 8 segundos de alta calidad y, después, una canción temática exclusiva generada con Suno en Kunavo como música de fondo

Algunos aspectos que debe tener en cuenta

  • Renderizado de texto en chino tradicional: el renderizado de caracteres tradicionales en vídeos de Veo 3 aún no es estable. Se recomienda añadir los subtítulos durante la posproducción (CapCut / versión taiwanesa de 剪映) y no pedir a la IA que escriba texto
  • Rostros reales: todos los modelos de primera categoría tienen restricciones sobre «celebridades reales / figuras políticas». Para uso comercial, se recomienda centrarse en productos, escenas y personajes de dibujos animados para evitar disputas por infracción
  • Música: Veo 3 genera efectos de sonido ambientales por sí mismo. Para una BGM profesional, combínelo con Suno para generar música original en Kunavo
  • Los enlaces de vídeo no caducan: Kunavo guarda cada vídeo en una CDN propia, y la URL de files.kunavo.com que devuelve es permanente; aun así, para un producto en producción le conviene guardar una copia en su propio S3 / Bunny CDN / Cloudinary

Pago: se aceptan tarjetas bancarias taiwanesas

Se admiten Visa / Mastercard / JCB / American Express; la recarga mínima es de $10 USD y Stripe convierte automáticamente el importe a nuevos dólares taiwaneses durante el pago. No hay suscripción, se factura por uso y el saldo nunca caduca. Una recarga de $10 basta para generar 20 vídeos de Veo 3 o aproximadamente 4 vídeos de Veo 3 Quality.

Avanzado: cómo producir de forma estable una calidad apta para uso comercial

  • Generación por lotes + selección: ejecute el mismo prompt 3-5 veces y elija el mejor resultado. Los vídeos de IA tienen aleatoriedad y la probabilidad de acertar a la primera es aproximadamente del 30%
  • Un prompt detallado es mejor que uno sencillo: «taza de café» es deficiente; «superficie de mesa de madera clara, contraluz, vapor, cámara lenta, estilo publicitario» es mejor
  • Use palabras negativas para eliminar problemas habituales: «avoid distorted faces, avoid mangled text, no shaky camera» (las palabras negativas deben escribirse dentro del prompt)

¿Listo para empezar? Regístrese gratis, recargue desde $10 y pague por uso. Consulte la documentación completa de la API de vídeo: /docs/video; explore todos los modelos de vídeo: /models.