ガイド一覧へ戻る
マルチモーダル·2026年5月25日·最終更新 2026年9月30日·読了10分

マルチモーダル AI ガイド — 1つの OpenAI 互換 API でテキスト、画像、動画、音声

ほとんどのアグリゲーターはテキストしか扱いません。Kunavo では同じ API で画像(Nano Banana、GPT-Image)、動画(Veo 3.1)、音声(Suno)を利用できます。このガイドでは、どれをいつ使うか、そして本番品質のマルチモーダルワークフローにどう連結するかを解説します。

最終確認日:。

多くのLLMアグリゲーターはテキストで止まります。製品で画像の生成、写真の編集、静止画の動画化、広告の音声化、音楽の作曲が必要になった瞬間、さらに3社のベンダー、3つの請求、3つのSDKを管理することになります。Kunavoなら、すべてを同じOpenAI互換APIで利用できます。このガイドでは、どのモダリティをいつ使うか、各モダリティのモデルメニュー、そしてそれらを本番マルチモーダルパイプラインに連結する方法を説明します。

モダリティメニュー(用途別)

  • テキスト生成 — Claude Opus/Sonnet/HaikuとGPT。推論、チャット、構造化出力に使用します。/docs/chat
  • 画像生成(text-to-image) — Nano Banana Pro、GPT-Image-2、Nano Banana 2。用途によって選択が異なります(以下の比較を参照)
  • 画像編集(image-to-image) — Nano Banana Edit、GPT-Image-2 Edit。パッケージ上のテキスト置換、背景変更、スタイル変更に使用します
  • 動画生成 — Veo 3 Lite/Fast/Quality、Seedance 2およびSeedance 2 Fast、Wan 2.7。text-to-videoとimage-to-videoの両方に対応します
  • 音声 — 音楽 — Suno V5 / V5.5。プロンプトから完全な楽曲を生成します

完全なカタログは/modelsで確認できます。

画像モデルの選び方 — 30秒ルール

  • 画像上に鮮明なテキストが必要(UIモックアップ、ポスター、看板)ですか? → Nano Banana Pro。議論の余地はありません
  • 文字どおりで詳細なプロンプトですか? → GPT-Image-2。プロンプト理解に優れ、すべての解像度で定額です
  • コストが重要な大量処理ですか? → Nano Banana 2。1Kで最安、忠実度も十分です
  • 奥行きのある映画的表現ですか? → Nano Banana Pro。ボケが本当に映画的です

詳細な比較は、画像モデル比較(ライブ画像モデル比較)をご覧ください。

動画モデルの選び方

現在利用できるのは3つのファミリーで、それぞれ異なる単位で課金されます。Veo 3は動画単位、SeedanceとWanは出力秒数単位です。以下の価格はカタログ料金です:

モデルKunavo価格課金単位最適な用途
veo-3-quality$1.60+動画1本あたり総合的に最高の忠実度、ネイティブ音声
veo-3$0.36+動画1本あたりほとんどの本番クリップに最適なバランス
veo-3-lite$0.18+動画1本あたりアイデア検討中の安価な反復作業
seedance-2$0.114+動画1秒あたり強力なモーションとプロンプト遵守
seedance-2-fast$0.093+動画1秒あたり速度のために一部の忠実度を犠牲
seedance-2-mini$0.0245+動画1秒あたり1秒あたり最安、大量の短いクリップの生成向け
wan-2-7$0.096+動画1秒あたり映画的なテキストから動画への生成、720p または 1080p

エンドポイントはモデルに依存しないため、ファミリーの切り替えはmodelフィールドを変更するだけで、他は何も変わりません。動画のクイックスタートはVeo 3動画クイックスタート、モデル別の詳細はSeedance APIおよびWan APIガイドをご覧ください。

画像の生成 — 基本

image.py
# Text-to-image: same OpenAI SDK, different model slug
img = client.images.generate(
    model="nano-banana-pro",          # Google's flagship — best text rendering
    prompt="a marketing hero for a fintech app, isometric, soft blue palette",
    size="1024x1024",
)
print(img.data[0].url)  # 24h temporary URL — download immediately

結果URLは一時的です(画像は24時間、動画はfiles.kunavo.com CDN経由で永続)。画像はすぐにダウンロードし、自分のCDNに保存してください。

Image-to-video — 既存アセットを動かす

サイト上に商品写真がすでにあります。Veo 3なら、そのどれでも8秒の商品クリップにアニメーション化できます:

image_to_video.py
# Image-to-video: upload a hero image, animate into an 8-second product clip
# (every Veo clip is 8 seconds; the Veo models ignore "duration").
# The OpenAI SDK has no method for the video route, so post to it with the
# same client.
video = client.post(
    "/video/generations",
    body={
        "model": "veo-3",
        "prompt": "camera slowly orbits, soft cinematic light, product hero shot",
        "image_url": hero_image_url,
        "aspect_ratio": "9:16",   # vertical for Reels / TikTok / IG short
        "resolution": "1080p",
    },
    cast_to=object,
    options={"timeout": 600.0},   # a clip takes minutes
)
print(video["data"][0]["url"])

以前は動画撮影1回に500~1500ドルを費やしていたマーケティングチームも、クリップの制作費を$0.18+(Veo 3.1 Lite)から$1.60+(Veo 3.1 Quality)の範囲に抑え、約30秒の計算時間を加えるだけで済みます。Eコマースのヒーローアニメーション、App Store / Play Storeのスクリーンショット、ソーシャルメディアの商品紹介に特に適しています。

モダリティの連結 — 真の強み

興味深いワークフローは、モダリティを順番に組み合わせます。マーケティングクリップの制作ライン:

pipeline.py
# Pipeline: GPT-Image generates a marketing hero, Veo 3 animates it,
# Suno scores the BGM. One API, one bill.
# Here client is AsyncOpenAI(api_key=..., base_url="https://api.kunavo.com/v1").
async def make_marketing_clip(product: dict) -> dict:
    # 1. Hero image
    img = await client.images.generate(
        model="gpt-image-2",
        prompt=f"hero shot of {product['name']}, premium aesthetic",
        size="1024x1792",
    )

    # 2. Animate to 8s vertical (the length of every Veo clip). The SDK has
    #    no method for the video and music routes, so post to them directly.
    video = await client.post(
        "/video/generations",
        body={
            "model": "veo-3",
            "prompt": f"camera orbits {product['name']}, cinematic lighting",
            "image_url": img.data[0].url,
            "aspect_ratio": "9:16",
        },
        cast_to=object,
        options={"timeout": 600.0},
    )

    # 3. BGM
    bgm = await client.post(
        "/audio/music",
        body={
            "model": "suno-v5",
            "prompt": "upbeat synth, 30 seconds, brand-friendly",
        },
        cast_to=object,
        options={"timeout": 600.0},
    )

    return {"video": video["data"][0]["url"], "bgm": bgm["data"][0]["url"]}

asyncio.gather()で100個のSKUに対して並列実行すれば、マーケティングカタログの制作パイプラインになります。エンドツーエンドの総コストはSKUあたり約1~2ドルです。クリエイティブエージェンシーのアセットあたり500~2000ドルと比較してください。

実用上の考慮事項

  • 結果URLの有効期間:画像は24時間で期限切れ(CDNに再ホスト)、動画はKunavoのfiles.kunavo.com上で永続
  • 生成時間:画像約5~30秒、動画約30秒~3分、音楽約30秒。サーバー側ではforce-dynamicを使用し、ユーザーに進捗を表示します
  • 失敗した生成は無料 — Kunavoは4xx/5xxに課金しないため、プロンプトを自由に反復できます
  • 動画内のテキスト描画:Veo 3は動画内の複数語テキストが苦手です。モデルに描画させるのではなく、ポスト処理(CapCut、Final Cut、ブラウザ側canvas)でテキストを追加してください
  • 実在の顔 / IP:主要モデルはすべて、著名人、政治的内容、著作権のあるキャラクターの生成を拒否します。オリジナルキャラクターまたはライセンス済みIPを使用してください
  • アスペクト比:9:16(縦型ショート)、16:9(横長)、1:1(フィード)、4:5(Instagramポートレート)。動画ではaspect_ratio、画像ではsize="1024x1792"などを通じて渡します。

一般的なマルチモーダルの用途(開始プロンプト付き)

  • Eコマースの商品ヒーローアニメーション — image-to-video、軌道カメラ、8秒、9:16
  • 不動産のバーチャルステージング — 画像編集で空室に家具を追加
  • マーケティングカルーセル / Reels制作 — ブランドスタイルでの画像一括生成 + Veoアニメーション
  • 教育用解説クリップ — スライドを画像として生成し、Veo 3でアニメーション化し、Sunoで音楽を付ける
  • ポッドキャストのイントロ & オーディオブランディング — プロンプトから生成したSunoの音楽ベッドとジングルを番組に使用
  • ゲーム / アプリのアセット生成 — Nano Banana Pro / GPT-Image-2でキャラクターのポートレート、アイテムアイコン、環境背景を生成

マルチモーダルを使用すべきでない場合

  • 厳密なブランドアセット — 厳密なプロンプトでもモデルの出力はずれます。マスターを置き換えるのではなく、人間がデザインしたマスターのバリエーションにAIを使ってください
  • 実在人物の顔 — 主要モデルはすべて拒否します。回避すると法的/IPリスクがあります
  • ライブ動画 / リアルタイム生成 — 現在のモデルは1クリップあたり30秒~3分かかります。ライブ用途にはまだ適していません
  • 高い正確性が求められる用途 — 医療画像、法的証拠、科学出版。マルチモーダル生成は創作であり、事実に基づくものではありません

1つの請求にまとめたマルチモーダル対応こそが、Kunavoの本来の用途です。エンドポイントのリファレンスは/docs/imagesまたは/docs/videoから、カテゴリで絞り込んだモデル一覧は/modelsから確認できます。

これらのパイプラインの基礎となるモデル別価格表は、画像生成API比較および動画生成API比較をご覧ください。

よくある質問

AI動画生成はクリップ1本あたりいくらですか?

Kunavoでは、Veo 3.1 Qualityは$1.60+動画1本あたりで、Veo 3.1 Fastは$0.36+動画1本あたりです。一方、Veo 3.1 Liteは安価な反復作業向けに$0.18+動画1本あたりです。SeedanceとWanは代わりに出力秒数単位で課金されます:Seedance 2は$0.114+動画1秒あたり、Seedance 2 Fastは$0.093+動画1秒あたり、Wan 2.7は$0.096+動画1秒あたりです。以前は1回の動画撮影に500~1,500ドルを費やしていたマーケティングチームでも、上記の料金と約30秒の計算時間で同等のクリップを作成できます。

生成された画像と動画のURLはどのくらい有効ですか?

画像の結果URLは一時的なもので、約24時間後に期限切れになります。そのため、すぐにダウンロードして自分のCDNで再ホストしてください。動画の結果は永続的で、files.kunavo.comから配信されます。

画像、動画、音楽の生成にはどのくらいかかりますか?

画像はおよそ5~30秒、動画は30秒~3分、音楽は約30秒です。そのため、現在のモデルはライブまたはリアルタイムの用途には適していません。

失敗した画像または動画の生成にも課金されますか?

いいえ。Kunavoは4xxまたは5xxレスポンスに対して課金しないため、成功した生成以外に費用をかけず、プロンプトを動作するまで反復できます。

どの画像モデルを選ぶべきですか?

画像に鮮明なテキストを含める必要がある場合(UIモックアップ、ポスター、看板)や、映画的な奥行きにはNano Banana Pro。文字どおりで詳細なプロンプトにはGPT-Image-2。すべての解像度で定額です。コストが重要な大量処理にはNano Banana 2。1Kでは最安で、忠実度も十分です。

完全なマルチモーダルパイプラインはアセット1つあたりいくらですか?

Kunavoで画像生成、画像からの動画生成、BGMを連結すると、SKUあたりエンドツーエンドでおよそ1~2ドルです。クリエイティブエージェンシーに依頼した場合のアセット1つあたり500~2,000ドルと比較できます。3つのモダリティすべてが同じOpenAI互換APIを通じて実行され、1つの残高にまとめて課金されます。