テキストから画像生成 画像から画像へ テキストから動画へ リファレンスから動画へ 画像から動画へ $0.0308 ~ / 画像
Kling 3.0 Omniは、映画のようなクオリティ、キャラクターの安定性、プロフェッショナルな画像シーケンスを備えた、一貫性のあるマルチシーン映像を生成します。
入力 価格を表示するには、必須項目を入力してください。
Text To Video · 5s
生成 モード オーディオ 長さ 解像度 タイプ 価格 — あり output second 720p リファレンスから動画へ $0.084 / s 1080p リファレンスから動画へ $0.108 / s 4K リファレンスから動画へ $0.318 / s なし output second 720p リファレンスから動画へ $0.066 / s — 1K 画像から画像へ $0.0308 テキストから画像生成 $0.0308 output second 1080p リファレンスから動画へ $0.084 / s — 2K 画像から画像へ $0.0308 テキストから画像生成 $0.0308 4K 画像から画像へ $0.0616 output second 4K リファレンスから動画へ $0.318 / s — 4K テキストから画像生成 $0.0616 4k なし 3s — 画像から動画へ $0.954 テキストから動画へ $0.954 4s — 画像から動画へ $1.272 テキストから動画へ $1.272 5s — 画像から動画へ $1.59 テキストから動画へ $1.59 6s — 画像から動画へ $1.908 テキストから動画へ $1.908 7s — 画像から動画へ $2.226 テキストから動画へ $2.226 8s — 画像から動画へ $2.544 テキストから動画へ $2.544 9s — 画像から動画へ $2.862 テキストから動画へ $2.862 10s — 画像から動画へ $3.18 テキストから動画へ $3.18 11s — 画像から動画へ $3.498 テキストから動画へ $3.498 12s — 画像から動画へ $3.816 テキストから動画へ $3.816 13s — 画像から動画へ $4.134 テキストから動画へ $4.134 14s — 画像から動画へ $4.452 テキストから動画へ $4.452 15s — 画像から動画へ $4.77 テキストから動画へ $4.77 pro あり 3s — 画像から動画へ $0.324 テキストから動画へ $0.324 4s — 画像から動画へ $0.432 テキストから動画へ $0.432 5s — 画像から動画へ $0.54 テキストから動画へ $0.54 6s — 画像から動画へ $0.648 テキストから動画へ $0.648 7s — 画像から動画へ $0.756 テキストから動画へ $0.756 8s — 画像から動画へ $0.864 テキストから動画へ $0.864 9s — 画像から動画へ $0.972 テキストから動画へ $0.972 10s — 画像から動画へ $1.08 テキストから動画へ $1.08 11s — 画像から動画へ $1.188 テキストから動画へ $1.188 12s — 画像から動画へ $1.296 テキストから動画へ $1.296 13s — 画像から動画へ $1.404 テキストから動画へ $1.404 14s — 画像から動画へ $1.512 テキストから動画へ $1.512 15s — 画像から動画へ $1.62 テキストから動画へ $1.62 なし 3s — 画像から動画へ $0.252 テキストから動画へ $0.252 4s — 画像から動画へ $0.336 テキストから動画へ $0.336 5s — 画像から動画へ $0.42 テキストから動画へ $0.42 6s — 画像から動画へ $0.504 テキストから動画へ $0.504 7s — 画像から動画へ $0.588 テキストから動画へ $0.588 8s — 画像から動画へ $0.672 テキストから動画へ $0.672 9s — 画像から動画へ $0.756 テキストから動画へ $0.756 10s — 画像から動画へ $0.84 テキストから動画へ $0.84 11s — 画像から動画へ $0.924 テキストから動画へ $0.924 12s — 画像から動画へ $1.008 テキストから動画へ $1.008 13s — 画像から動画へ $1.092 テキストから動画へ $1.092 14s — 画像から動画へ $1.176 テキストから動画へ $1.176 15s — 画像から動画へ $1.26 テキストから動画へ $1.26 std あり 3s — 画像から動画へ $0.252 テキストから動画へ $0.252 4s — 画像から動画へ $0.336 テキストから動画へ $0.336 5s — 画像から動画へ $0.42 テキストから動画へ $0.42 6s — 画像から動画へ $0.504 テキストから動画へ $0.504 7s — 画像から動画へ $0.588 テキストから動画へ $0.588 8s — 画像から動画へ $0.672 テキストから動画へ $0.672 9s — 画像から動画へ $0.756 テキストから動画へ $0.756 10s — 画像から動画へ $0.84 テキストから動画へ $0.84 11s — 画像から動画へ $0.924 テキストから動画へ $0.924 12s — 画像から動画へ $1.008 テキストから動画へ $1.008 13s — 画像から動画へ $1.092 テキストから動画へ $1.092 14s — 画像から動画へ $1.176 テキストから動画へ $1.176 15s — 画像から動画へ $1.26 テキストから動画へ $1.26 なし 3s — 画像から動画へ $0.198 テキストから動画へ $0.198 4s — 画像から動画へ $0.264 テキストから動画へ $0.264 5s — 画像から動画へ $0.33 テキストから動画へ $0.33 6s — 画像から動画へ $0.396 テキストから動画へ $0.396 7s — 画像から動画へ $0.462 テキストから動画へ $0.462 8s — 画像から動画へ $0.528 テキストから動画へ $0.528 9s — 画像から動画へ $0.594 テキストから動画へ $0.594 10s — 画像から動画へ $0.66 テキストから動画へ $0.66 11s — 画像から動画へ $0.726 テキストから動画へ $0.726 12s — 画像から動画へ $0.792 テキストから動画へ $0.792 13s — 画像から動画へ $0.858 テキストから動画へ $0.858 14s — 画像から動画へ $0.924 テキストから動画へ $0.924 15s — 画像から動画へ $0.99 テキストから動画へ $0.99 with video ref なし output second 720p リファレンスから動画へ $0.0954 / s 1080p リファレンスから動画へ $0.1266 / s 4K リファレンスから動画へ $0.4242 / s
終点
ビデオAPI 画像API
POST https://pollo.ai/api/platform/v1/generation/kling-ai/kling-v3-omni/videoコピー モード
Text To Video Image To Video Reference To Video
APIドキュメント全体を表示 Pollo APIでKling 3.0 Omniを実行する
Kling 3.0 Omniは、テキスト、画像、被写体セット、ソース動画、音声を含む複数の入力タイプから、最大4Kの動画を1回のリクエストで生成します。
Pollo API上のKling 3.0 Omniを使えば、開発者は複数のガイダンスを組み合わせた参照主導の動画生成を行い、リクエストごとにクリップ長、アスペクト比、必要に応じて一致する音声を選択できます。
Kling 3.0 Omni APIの主な機能
オムニモーダル参照入力
このモデルは最大7件の参照を同時に受け付け、画像、ソース動画、被写体セット、音声キューを組み合わせて1本の生成を制御します。
被写体の一貫性
キャラクターや物体の画像を複数枚提供できます。シーンが動いても、モデルはショット全体で被写体の同一性を維持します。
音声ガイド付きモーション
音声参照を与えると、モデルは動き・リズム・テンポを音に合わせ、クリップ内のビート、話し声、環境音キューにアクションを整合させます。
環境シミュレーション
空間シミュレーションにより、カメラや被写体が空間内を移動しても、光、奥行き、環境反応が一貫したワンショットシーンをレンダリングします。
4Kボリュメトリック出力
生成は最大4Kに対応し、高解像度でも細かな質感と奥行きの手がかりを保つため、放送用途や大型スクリーン用途に適しています。
柔軟な尺とフレーミング
クリップは3〜15秒で、横長・縦長・正方形に対応。同じモデルへの1回の統合で、SNS、製品、フルフレーム配信までカバーできます。
Kling 3.0 Omni APIのユースケース
継続キャラクターコンテンツ: 被写体セットを再利用して、マスコット、ホスト、アバターの一貫性をエピソード間で維持。毎回アイデンティティを描き直す必要がありません。
音声同期パフォーマンスクリップ: ダンサー、ミュージシャン、スピーカーの動きをアップロードしたトラックにロック。音楽ツールや口パクモーション用途で有効です。
参照動画ベースのリスタイリング: 既存クリップを参照として入力し、新しい方向性で再生成。元の動きとステージングは維持します。
シーン継続パイプライン: 画像参照と動画参照を組み合わせてショットを先へ延長し、長いシーケンスでも環境と被写体の連続性を保てます。
マルチ参照ストーリーボーディング: 複数画像と被写体を1つのプロンプトにまとめ、フル制作に入る前に複雑なシーンをプレビューできます。
高解像度放送向けエ셋: 解像度と奥行きが重要なサイネージ、配信イントロ、大型ディスプレイ向けに4Kワンショットを生成できます。
ローカライズ広告バリエーション: 1つの被写体を再利用し、音声参照を差し替えて地域別バージョンを制作。テンポを合わせつつブランド一貫性を維持します。
没入型環境デモ: 霧、水、人混みの動きで空間が満たされていく様子を表現し、不動産やイベントのプレビュー向けに周囲の自然な反応を示せます。
Kling 3.0 Omni APIの使い方
APIキーを取得: Pollo APIアカウントを作成し、開発者ダッシュボードでAPIキーを生成します。
モデルを選択: /generation/kling-ai/kling-v3-omni/ref2video のKling 3.0 Omniエンドポイントにリクエストを送信します。
入力を追加: プロンプト と1〜7件の refs(画像、被写体、動画、または音声)を指定し、duration(3〜15)、アスペクト比、解像度(720P、1080P、または4K)を設定します。
生成と取得: タスクを送信し、返されたタスク状態をポーリングして、完成動画をダウンロード。必要に応じて generateAudio で一致するサウンドトラックも生成できます。
Kling 3.0 Omni APIのプロンプト作成ベストプラクティス プロンプトはゼロから説明するものではなく、参照を演出する指示だと考えてください。各参照の役割、望むアクション、被写体の周囲でシーンがどう振る舞うべきかを明確にします。
シンプルなプロンプトの公式 被写体と参照の役割 + 具体的なアクション + シーンと環境の挙動 + カメラワーク + 音声またはテンポのキュー
注目すべきポイント
参照の役割を割り当てる: どの参照が被写体か、どれが設定か、どれが音声を駆動するかを伝え、ガイダンス同士の競合を防ぎます。
被写体を明確に保つ: 1つのキャラクターのクリーンでバリエーションのある画像を提供し、生成ショット全体で同一性を安定させます。
環境反応を記述する: モデルは平面的な背景ではなく空間をシミュレートするため、光や天候、周囲の変化を具体的に指定します。
音声と動きを一致させる: 音声参照を使うときは、何の動きと同期させるかを明示し、テンポを音に追従させます。
目的で解像度を選ぶ: 放送や大型スクリーンには4K、素早い下書きと反復には低めの設定を選びます。
1シーンに絞る: 各生成は一貫した単一の瞬間に留めることで、クリップの冒頭から末尾まで連続性を保てます。
プロンプト例
一貫したマスコットのエピソード "スカウト制服を着た赤いキツネのイラスト被写体参照を使ってください。キツネは日差しの入る図書館を歩き、背の高い棚から光る本を取り出すために立ち止まり、にっこり笑います。ゆっくりしたドリーイン、暖かくほこりを含んだ光。"
音声同期のストリートダンサー "アップロードしたドラムトラックに合わせて被写体ダンサーをアニメーション化。鋭いフットワークと腕のヒットを、夕暮れのコンクリート高架下で各ビートに着地させる。クールな青い影、ベースのうねりが高まる中で手持ちカメラが周回。"
環境シミュレーションのリビール "夜明けの石造りの中庭が、ゆっくりと這う地表の霧で満たされ、古い柱にまとわりつきながら最初の光を捉える。カメラはクレーンアップして全景を見せる。静かな環境音、落ち着いたリアルなスタイル。"
参照動画ベースのリスタイル "海岸沿いの道を走る自転車乗りの参照クリップを使い、手描き風ルックで再生成してください。ルートとペダリング動作は同じまま、風に揺れる草と飛び交うカモメを追加し、柔らかな午後の光に。"
Kling 3.0 Omni vs Veo 3.1 vs Sora 2 機能 Kling 3.0 Omni Veo 3.1 Sora 2 マルチ参照入力(画像、動画、被写体、音声) ✅ 最大7件の混合参照 ✅ 画像とプロンプトガイダンス ✅ プロンプトと参照ガイダンス 画像セットからの被写体一貫性 ✅ 複数画像の被写体セット ✅ ✅ 音声ガイド付きモーション ✅ 音声参照同期 ✅ 生成音声 ✅ 同期音声 最大解像度 最大4K 最大1080P 最大1080P クリップ長 3〜15秒 短尺の演出クリップ 短尺の演出クリップ 推奨用途 参照をブレンドした高解像度ワンショットシーン プロンプト主導のナラティブショット 物理駆動のクリエイティブシーン
なぜKling 3.0 Omni APIを選ぶのか? Kling 3.0 Omniは、エ셋から構築するプロダクトに適しており、各ショットを手探りでプロンプト化するのではなく、被写体、ソースクリップ、音声を融合して一貫した高解像度シーンを作れます。
Pollo API経由なら、1つのAPIキーでKling 3.0 Omniに加えて300以上の主要な動画・画像モデルへアクセスでき、整理されたドキュメント、タスクポーリング、Webhookも利用できます。
Pollo APIのKling 3.0 Omniエンドポイントから始めれば、参照主導で4K対応の動画機能を素早く提供でき、その後Veo、Sora、その他のKlingモデルとも統合を触らずに比較できます。
Kling 3.0 Omni API FAQ
Kling 3.0 Omniとは? Kling 3.0 OmniはKling AIの動画モデルで、テキスト、画像、被写体、動画、音声の参照を組み合わせて生成し、最大4Kの一貫したワンショットシーンを作成します。
Kling 3.0 Omni APIはどの入力を組み合わせられる? 1回のリクエストで最大7件の参照を受け付け、テキストプロンプトとあわせて画像、ソース動画、被写体画像セット、音声キューを混在して使えます。
被写体の一貫性はどう機能する? 1つのキャラクターまたは物体の小規模な画像セットを提供すると、シーンが動いても生成クリップ全体で被写体を認識可能な状態に保ちます。
対応する解像度と長さは? Kling 3.0 Omni APIは720P、1080P、4Kを出力でき、クリップ長は3〜15秒で選択可能。フレーミングは横長、縦長、正方形に対応します。
一致する音声も生成できる? はい。出力動画向けに自然な音声を生成でき、さらに音声参照で画面内モーションのタイミングやリズムをガイドすることもできます。
なぜPollo API経由でKling 3.0 Omniを実行するの? Pollo APIなら、Kling 3.0 Omniと300以上の他モデルを1つの統合で利用でき、ドキュメント、タスク追跡、Webhookが揃っています。