Volver a las guías
Multimodal·25 de mayo de 2026·Actualizado el 30 de septiembre de 2026·10 min de lectura

Guía de IA multimodal — texto, imagen, video y audio bajo una API compatible con OpenAI

La mayoría de los agregadores solo cubren texto. Kunavo te ofrece imagen (Nano Banana, GPT-Image), video (Veo 3.1) y audio (Suno) en la misma API. Esta guía explica cuándo usar cada uno y cómo encadenarlos para flujos de trabajo multimodales listos para producción.

Última revisión: .

La mayoría de los agregadores de LLM se limitan al texto. En cuanto tu producto necesita generar una imagen, editar una foto, animar una imagen fija para convertirla en video, poner voz a un anuncio o componer música, vuelves a tener que gestionar tres proveedores más, tres facturas más y tres SDK más. Kunavo te ofrece todo a través de la misma API compatible con OpenAI. Esta guía explica cuándo recurrir a cada modalidad, el catálogo de modelos por modalidad y cómo encadenarlas en pipelines multimodales de producción.

El catálogo de modalidades (y para qué sirve cada una)

  • Generación de texto: Claude Opus/Sonnet/Haiku y GPT. Úsala para razonamiento, chat y salidas estructuradas. /docs/chat
  • Generación de imágenes (texto a imagen): Nano Banana Pro, GPT-Image-2 y Nano Banana 2. La elección varía según el caso de uso (consulta la comparativa más abajo)
  • Edición de imágenes (imagen a imagen): Nano Banana Edit y GPT-Image-2 Edit. Sustituye texto en envases, cambia fondos y aplica otros estilos
  • Generación de video: Veo 3 Lite/Fast/Quality, Seedance 2 y Seedance 2 Fast, Wan 2.7. Se admiten tanto texto a video como imagen a video
  • Audio — Música: Suno V5 / V5.5. Canciones completas a partir de un prompt

Consulta el catálogo completo en /models.

Cómo elegir un modelo de imagen: la regla de los 30 segundos

  • ¿Necesitas texto nítido en la imagen (maquetas de UI, carteles, letreros)? → Nano Banana Pro. No hay discusión
  • ¿Prompts literales y detallados? → GPT-Image-2. Gran comprensión de prompts; precio fijo en todas las resoluciones
  • ¿Alto volumen y el coste importa? → Nano Banana 2. El más barato en 1K, con una fidelidad que se mantiene
  • ¿Estilo cinematográfico con profundidad? → Nano Banana Pro. El bokeh es realmente cinematográfico

Consulta el análisis completo en nuestra comparativa de modelos de imagen, nuestra comparación en vivo de modelos de imagen.

Cómo elegir un modelo de video

Hay tres familias disponibles y cobran con unidades diferentes: Veo 3 por video, Seedance y Wan por segundo de salida. Estos son los precios del catálogo:

ModeloPrecio de KunavoUnidad de facturaciónIdeal para
veo-3-quality$1.60+por videoLa mejor fidelidad general, con audio nativo
veo-3$0.36+por videoEl punto óptimo para la mayoría de los clips de producción
veo-3-lite$0.18+por videoIteración económica durante la ideación
seedance-2$0.114+por segundo de videoMovimiento sólido y buena adherencia al prompt
seedance-2-fast$0.093+por segundo de videoSacrifica parte de la fidelidad a cambio de velocidad
seedance-2-mini$0.0245+por segundo de videoEl coste por segundo más bajo, para clips cortos de gran volumen
wan-2-7$0.096+por segundo de videoGeneración cinematográfica de vídeo a partir de texto, en 720p o 1080p

Como el endpoint no depende del modelo, cambiar de familia solo requiere modificar el campo model. Consulta la guía rápida de video en nuestra guía rápida de video de Veo 3; los detalles por modelo están en las guías de Seedance API y Wan API.

Generar una imagen: conceptos básicos

image.py
# Text-to-image: same OpenAI SDK, different model slug
img = client.images.generate(
    model="nano-banana-pro",          # Google's flagship — best text rendering
    prompt="a marketing hero for a fintech app, isometric, soft blue palette",
    size="1024x1024",
)
print(img.data[0].url)  # 24h temporary URL — download immediately

Las URL de resultados son temporales (24 h para imágenes y permanentes para videos mediante la CDN files.kunavo.com). En el caso de las imágenes, descárgalas de inmediato y guárdalas en tu propia CDN.

Imagen a video: convierte tus recursos existentes en movimiento

Ya tienes fotografías de productos en tu sitio. Veo 3 puede animar cualquiera de ellas para crear un clip de producto de 8 segundos:

image_to_video.py
# Image-to-video: upload a hero image, animate into an 8-second product clip
# (every Veo clip is 8 seconds; the Veo models ignore "duration").
# The OpenAI SDK has no method for the video route, so post to it with the
# same client.
video = client.post(
    "/video/generations",
    body={
        "model": "veo-3",
        "prompt": "camera slowly orbits, soft cinematic light, product hero shot",
        "image_url": hero_image_url,
        "aspect_ratio": "9:16",   # vertical for Reels / TikTok / IG short
        "resolution": "1080p",
    },
    cast_to=object,
    options={"timeout": 600.0},   # a clip takes minutes
)
print(video["data"][0]["url"])

Los equipos de marketing que antes gastaban entre $500 y $1500 por sesión de video pueden convertirlo en un clip desde $0.18+ (Veo 3.1 Lite) hasta $1.60+ (Veo 3.1 Quality), más unos 30 segundos de procesamiento. Funciona especialmente bien para animaciones principales de comercio electrónico, capturas de App Store / Play Store y presentaciones de productos en redes sociales.

Encadenar modalidades: la verdadera superpotencia

Los flujos de trabajo interesantes combinan modalidades en secuencia. Una línea de producción de clips de marketing:

pipeline.py
# Pipeline: GPT-Image generates a marketing hero, Veo 3 animates it,
# Suno scores the BGM. One API, one bill.
# Here client is AsyncOpenAI(api_key=..., base_url="https://api.kunavo.com/v1").
async def make_marketing_clip(product: dict) -> dict:
    # 1. Hero image
    img = await client.images.generate(
        model="gpt-image-2",
        prompt=f"hero shot of {product['name']}, premium aesthetic",
        size="1024x1792",
    )

    # 2. Animate to 8s vertical (the length of every Veo clip). The SDK has
    #    no method for the video and music routes, so post to them directly.
    video = await client.post(
        "/video/generations",
        body={
            "model": "veo-3",
            "prompt": f"camera orbits {product['name']}, cinematic lighting",
            "image_url": img.data[0].url,
            "aspect_ratio": "9:16",
        },
        cast_to=object,
        options={"timeout": 600.0},
    )

    # 3. BGM
    bgm = await client.post(
        "/audio/music",
        body={
            "model": "suno-v5",
            "prompt": "upbeat synth, 30 seconds, brand-friendly",
        },
        cast_to=object,
        options={"timeout": 600.0},
    )

    return {"video": video["data"][0]["url"], "bgm": bgm["data"][0]["url"]}

Ejecuta esto para 100 SKU en paralelo con asyncio.gather() y tendrás un pipeline de producción para un catálogo de marketing. Coste total aproximado: $1-2 por SKU de principio a fin. Compáralo con los $500-2000 por recurso de una agencia creativa.

Consideraciones prácticas

  • Duración de las URL de resultados: las imágenes caducan en 24 h (vuelve a alojarlas en tu CDN); los videos son permanentes en files.kunavo.com de Kunavo
  • Tiempo de generación: imagen ~5-30 s, video ~30 s-3 min y música ~30 s. Usa force-dynamic en el servidor y muestra el progreso a los usuarios
  • Las generaciones fallidas son gratuitas: Kunavo nunca factura 4xx/5xx, así que puedes iterar libremente sobre los prompts
  • Renderizado de texto en video: Veo 3 tiene dificultades con texto de varias palabras en video. Renderiza el texto en posproducción (CapCut, Final Cut o canvas del lado del navegador) en lugar de pedirle al modelo que lo renderice
  • Rostros reales / propiedad intelectual: todos los modelos principales rechazan la generación de celebridades, contenido político y personajes protegidos por derechos de autor. Limítate a personajes originales o propiedad intelectual con licencia
  • Relaciones de aspecto: 9:16 (corto vertical), 16:9 (horizontal), 1:1 (feed), 4:5 (retrato de Instagram). Pásalas mediante aspect_ratio en video; en imágenes, usa size="1024x1792" etc.

Casos de uso multimodales comunes (con prompts iniciales)

  • Animaciones principales de productos de comercio electrónico: imagen a video, cámara orbital, 8 segundos, 9:16
  • Home staging virtual inmobiliario: edición de imágenes para añadir muebles a habitaciones vacías
  • Producción de carruseles de marketing / Reels: generación por lotes de imágenes con el estilo de tu marca + animación con Veo
  • Clips explicativos educativos: genera diapositivas como imágenes, anímalas con Veo 3 y añade la música con Suno
  • Intros de pódcast y branding de audio: bases musicales y cortinillas de Suno para tu programa, generadas a partir de un prompt
  • Generación de recursos para juegos / aplicaciones: retratos de personajes, iconos de objetos y fondos de entornos mediante Nano Banana Pro / GPT-Image-2

Cuándo NO usar multimodalidad

  • Recursos de marca estrictos: la salida del modelo deriva, incluso con prompts precisos. Usa la IA para crear variaciones de un original diseñado por una persona, no para sustituirlo
  • Rostros de personas reales: todos los modelos principales los rechazan; eludirlo implica riesgos legales y de propiedad intelectual
  • Video en directo / generación en tiempo real: los modelos actuales tardan entre 30 s y 3 min por clip. Todavía no son adecuados para casos de uso en directo
  • Precisión de alto riesgo: imágenes médicas, pruebas legales y publicaciones científicas. La generación multimodal es creativa, no factual

La multimodalidad bajo una sola factura es precisamente para lo que existe Kunavo. Empieza en /docs/images o /docs/video para consultar los endpoints, o explora /models filtrado por categoría.

Para consultar las tablas de precios por modelo detrás de estos pipelines, revisa la comparativa de API de generación de imágenes y la comparativa de API de generación de video.

Preguntas frecuentes

¿Cuánto cuesta generar un vídeo de IA por clip?

En Kunavo, Veo 3.1 Quality cuesta $1.60+ por video y Veo 3.1 Fast cuesta $0.36+ por video, mientras que Veo 3.1 Lite cuesta $0.18+ por video para iteraciones económicas. Seedance y Wan cobran por segundo de salida: Seedance 2 a $0.114+ por segundo de video, Seedance 2 Fast a $0.093+ por segundo de video y Wan 2.7 a $0.096+ por segundo de video. Un equipo de marketing que antes gastaba $500–1,500 por sesión de vídeo obtiene un clip comparable por el precio anterior más unos 30 segundos de procesamiento.

¿Cuánto tiempo permanecen válidas las URL de imágenes y vídeos generados?

Las URL de resultados de imágenes son temporales y caducan después de unas 24 horas, así que descárgalas y vuelve a alojarlas inmediatamente en tu propia CDN. Los resultados de vídeo son permanentes y se sirven desde files.kunavo.com.

¿Cuánto tardan la generación de imágenes, vídeos y música?

Aproximadamente entre 5 y 30 segundos para una imagen, entre 30 segundos y 3 minutos para un vídeo y unos 30 segundos para música. Esto descarta los modelos actuales para casos de uso en directo o en tiempo real.

¿Se cobran las generaciones fallidas de imágenes o vídeos?

No. Kunavo nunca cobra una respuesta 4xx o 5xx, así que iterar sobre un prompt hasta que funcione no cuesta nada aparte de las generaciones correctas.

¿Qué modelo de imagen debería elegir?

Nano Banana Pro cuando la imagen debe contener texto limpio —maquetas de interfaz, carteles, letreros— y para profundidad cinematográfica. GPT-Image-2 para prompts literales y detallados; tiene un precio fijo en todas las resoluciones. Nano Banana 2 para grandes volúmenes cuando el coste importa; es el más barato en 1K y mantiene una fidelidad adecuada.

¿Cuánto cuesta un flujo multimodal completo por recurso?

Encadenar generación de imágenes, conversión de imagen a vídeo y una pista musical cuesta aproximadamente $1–2 por SKU de principio a fin en Kunavo, frente a $500–2,000 por recurso de una agencia creativa. Las tres modalidades funcionan mediante la misma API compatible con OpenAI y se facturan contra un solo saldo.