返回指南
多模態·2026年5月25日·更新於 2026年9月30日·閱讀約 10 分鐘

多模態 AI 指南——在同一個相容 OpenAI 的 API 下處理文字、影像、影片與音訊

多數聚合服務只涵蓋文字。Kunavo 讓你能在同一個 API 上使用影像(Nano Banana、GPT-Image)、影片(Veo 3.1)與音訊(Suno)。本指南說明何時使用哪個模型,以及如何將它們串接成可正式上線的多模態工作流程。

最後審核於 。

大多數 LLM 聚合平台只做到文字。當您的產品需要生成圖片、編輯照片、將靜態圖片製作成影片、為廣告配音或創作音樂時——您又得管理三家供應商、三筆帳單和三套 SDK。Kunavo 透過同一個 OpenAI 相容 API 提供全部功能。本指南涵蓋何時使用哪種模態、每種模態的模型選單,以及如何將它們串接成可投入生產的多模態流程。

模態選單(以及各自的用途)

  • 文字生成——Claude Opus/Sonnet/Haiku 和 GPT。用於推理、聊天、結構化輸出。/docs/chat
  • 圖片生成(文字轉圖片)——Nano Banana Pro、GPT-Image-2、Nano Banana 2。選擇取決於使用情境(請參閱下方比較)
  • 圖像編輯(圖像轉圖像) — Nano Banana Edit、GPT-Image-2 Edit。替換包裝上的文字、變更背景、重新套用風格
  • 影片生成 — Veo 3 Lite/Fast/Quality、Seedance 2 與 Seedance 2 Fast、Wan 2.7。支援文字轉影片與圖像轉影片
  • 音訊 — 音樂 — Suno V5 / V5.5。根據提示詞生成完整歌曲

在 /models 瀏覽完整模型目錄。

選擇圖像模型 — 30 秒法則

  • 需要圖像上的文字清晰(UI 模擬圖、海報、標誌)?→ Nano Banana Pro。毫無懸念
  • 提示詞必須精確且詳細?→ GPT-Image-2。提示詞理解能力強;所有解析度價格一致
  • 高用量且成本重要?→ Nano Banana 2。1K 解析度下最便宜,保真度也能維持
  • 需要電影感與景深?→ Nano Banana Pro。散景確實具備電影感

完整深入分析請見我們的 圖像模型實測比較 — 即時圖像模型比較。

選擇影片模型

目前有三個系列,各自採用不同計費單位 — Veo 3 按影片計費,Seedance 與 Wan 按輸出秒數計費。以下價格為目錄價格:

模型Kunavo 價格計費單位最適合
veo-3-quality$1.60+每段影片整體保真度最佳,原生音訊
veo-3$0.36+每段影片多數製作影片的最佳平衡點
veo-3-lite$0.18+每段影片構思階段的低成本迭代
seedance-2$0.114+每秒影片動態效果與提示詞遵循能力強
seedance-2-fast$0.093+每秒影片以部分保真度換取速度
seedance-2-mini$0.0245+每秒影片每秒最便宜,適合大量短影片
wan-2-7$0.096+每秒影片電影感文字轉影片,720p 或 1080p

由於端點與模型無關,切換系列只需變更 model 欄位,其他都不必改。影片快速入門請見我們的 Veo 3 影片快速入門;各模型詳細資訊請見 Seedance API 與 Wan API 指南。

生成圖像 — 基礎說明

image.py
# Text-to-image: same OpenAI SDK, different model slug
img = client.images.generate(
    model="nano-banana-pro",          # Google's flagship — best text rendering
    prompt="a marketing hero for a fintech app, isometric, soft blue palette",
    size="1024x1024",
)
print(img.data[0].url)  # 24h temporary URL — download immediately

結果 URL 會暫時有效(圖像 24 小時;影片透過 files.kunavo.com CDN 永久有效)。圖像請立即下載,並儲存到你自己的 CDN。

圖像轉影片 — 讓現有素材動起來

你已經在網站上擁有產品攝影素材。Veo 3 可以將其中任何素材製作成 8 秒產品影片:

image_to_video.py
# Image-to-video: upload a hero image, animate into an 8-second product clip
# (every Veo clip is 8 seconds; the Veo models ignore "duration").
# The OpenAI SDK has no method for the video route, so post to it with the
# same client.
video = client.post(
    "/video/generations",
    body={
        "model": "veo-3",
        "prompt": "camera slowly orbits, soft cinematic light, product hero shot",
        "image_url": hero_image_url,
        "aspect_ratio": "9:16",   # vertical for Reels / TikTok / IG short
        "resolution": "1080p",
    },
    cast_to=object,
    options={"timeout": 600.0},   # a clip takes minutes
)
print(video["data"][0]["url"])

過去每次影片拍攝需花費 $500-1500 的行銷團隊,現在可將其壓縮為從 $0.18+ (Veo 3.1 Lite) 到 $1.60+ (Veo 3.1 Quality) 的影片,再加上約 30 秒的運算時間。特別適合電商主視覺動畫、App Store / Play Store 截圖,以及社群媒體產品展示。

串接模態 — 真正的超能力

有趣的工作流程會依序混合不同模態。一條行銷影片製作流程:

pipeline.py
# Pipeline: GPT-Image generates a marketing hero, Veo 3 animates it,
# Suno scores the BGM. One API, one bill.
# Here client is AsyncOpenAI(api_key=..., base_url="https://api.kunavo.com/v1").
async def make_marketing_clip(product: dict) -> dict:
    # 1. Hero image
    img = await client.images.generate(
        model="gpt-image-2",
        prompt=f"hero shot of {product['name']}, premium aesthetic",
        size="1024x1792",
    )

    # 2. Animate to 8s vertical (the length of every Veo clip). The SDK has
    #    no method for the video and music routes, so post to them directly.
    video = await client.post(
        "/video/generations",
        body={
            "model": "veo-3",
            "prompt": f"camera orbits {product['name']}, cinematic lighting",
            "image_url": img.data[0].url,
            "aspect_ratio": "9:16",
        },
        cast_to=object,
        options={"timeout": 600.0},
    )

    # 3. BGM
    bgm = await client.post(
        "/audio/music",
        body={
            "model": "suno-v5",
            "prompt": "upbeat synth, 30 seconds, brand-friendly",
        },
        cast_to=object,
        options={"timeout": 600.0},
    )

    return {"video": video["data"][0]["url"], "bgm": bgm["data"][0]["url"]}

使用 asyncio.gather() 平行處理 100 個 SKU,就能建立行銷目錄製作管線。端到端總成本約為每個 SKU $1-2。相較之下,創意代理商每項素材收費 $500-2000。

實務考量

  • 結果 URL 有效期限:圖像 24 小時後失效(重新託管至你的 CDN);影片在 Kunavo 的 files.kunavo.com 上永久有效
  • 生成時間:圖像約 5-30 秒、影片約 30 秒-3 分鐘、音樂約 30 秒。伺服器端使用 force-dynamic,向使用者顯示進度
  • 生成失敗不收費 — Kunavo 絕不對 4xx/5xx 收費,因此可以自由迭代提示詞
  • 影片中的文字呈現:Veo 3 在影片中處理多字詞文字時表現不佳。請在後製階段呈現文字(CapCut、Final Cut、瀏覽器端 canvas),不要要求模型生成文字
  • 真實臉孔 / IP:所有主要模型都拒絕生成名人、政治人物與受著作權保護的角色。請使用原創角色或已取得授權的 IP
  • 長寬比:9:16(直式短影片)、16:9(橫式)、1:1(動態消息)、4:5(Instagram 直式)。影片透過 aspect_ratio 傳入;圖像則使用 size="1024x1792" 等欄位

常見多模態使用案例(含起始提示詞)

  • 電商產品主視覺動畫 — 圖像轉影片、環繞式攝影機、8 秒、9:16
  • 房地產虛擬佈置 — 編輯圖像,為空房間新增家具
  • 行銷輪播圖 / Reels 製作 — 以品牌風格批次生成圖像 + Veo 動畫
  • 教育解說影片 — 將投影片生成為圖像,再用 Veo 3 製作動畫,並使用 Suno 配樂
  • Podcast 開場與音訊品牌 — 為節目生成 Suno 音樂底層與音效,來源為提示詞
  • 遊戲 / 應用程式素材生成 — 透過 Nano Banana Pro / GPT-Image-2 生成角色肖像、道具圖示與環境背景

不應使用多模態的情況

  • 嚴格的品牌素材 — 即使提示詞嚴謹,模型輸出仍會漂移。請將 AI 用於人類設計主稿的變體,而不是取代主稿
  • 真實人物的臉孔 — 所有主要模型都會拒絕;若繞過限制,會有法律/IP 風險
  • 直播影片 / 即時生成 — 目前模型每段影片需要 30 秒-3 分鐘。尚不適合即時使用情境
  • 高風險準確性要求 — 醫學影像、法律證據、科學出版。多模態生成是創作工具,不是事實工具

單一帳單下的多模態功能正是 Kunavo 的用途。請從 /docs/images 或 /docs/video 開始查看端點參考,或依類別篩選 /models。

如需這些管線背後各模型的價格表,請參閱圖像生成 API 比較與影片生成 API 比較。

常見問題

AI 影片生成每個片段要多少錢?

在 Kunavo,Veo 3.1 Quality 的價格是 $1.60+ 每段影片,而 Veo 3.1 Fast 的價格是 $0.36+ 每段影片;至於廉價迭代,Veo 3.1 Lite 的價格為 $0.18+ 每段影片。Seedance 和 Wan 則按輸出秒數計費:Seedance 2 為每秒 $0.114+ 每秒影片,Seedance 2 Fast 為每秒 $0.093+ 每秒影片,而 Wan 2.7 為每秒 $0.096+ 每秒影片。過去每次影片拍攝需花費 $500–1,500 的行銷團隊,現在可以用上述價格再加上約 30 秒的運算時間,取得相當的片段。

生成的圖片和影片 URL 會維持有效多久?

圖片結果 URL 是暫時性的,約 24 小時後會過期,因此請立即下載並重新託管至您自己的 CDN。影片結果永久有效,從 files.kunavo.com 提供。

圖片、影片和音樂生成需要多久?

圖片約 5–30 秒,影片 30 秒至 3 分鐘,音樂約 30 秒。這使目前的模型不適合即時或即時互動使用情境。

失敗的圖片或影片生成會計費嗎?

不會。Kunavo 絕不會對 4xx 或 5xx 回應計費,因此反覆調整提示詞直到成功,除了成功生成的內容外不會產生任何費用。

我應該選哪個圖片模型?

當圖片必須包含清晰文字時,選 Nano Banana Pro——例如 UI mockup、海報、標誌——以及需要電影感景深時也選它。對於字面、詳細的提示詞,選 GPT-Image-2;無論解析度為何,價格都固定。大量生成且成本重要時,選 Nano Banana 2;它在 1K 下最便宜,且保真度足夠。

每個素材的完整多模態流程要多少錢?

在 Kunavo 上串接圖片生成、圖生影片和音樂背景,端到端每個 SKU 約需 $1–2;創意代理商每個素材則需 $500–2,000。三種模態都透過同一個 OpenAI 相容 API 執行,並從同一個餘額扣款。