テキストから動画へ 画像から動画へ リファレンスから動画へ $0.12 ~ / s
Happy Horse 1.0は、正確なリップシンク、リアルな動き、そして映画のようなマルチショットによるストーリーテリングを備えた、同期のとれたオーディオとビデオを生成します。
入力 価格を表示するには、必須項目を入力してください。
Text To Video · 720p · 5s
生成 長さ 解像度 タイプ 価格 output second 720p リファレンスから動画へ $0.12 / s 1080p リファレンスから動画へ $0.21 / s 3s 720p 画像から動画へ $0.36 テキストから動画へ $0.36 1080p 画像から動画へ $0.63 テキストから動画へ $0.63 4s 720p 画像から動画へ $0.48 テキストから動画へ $0.48 1080p 画像から動画へ $0.84 テキストから動画へ $0.84 5s 720p 画像から動画へ $0.60 テキストから動画へ $0.60 1080p 画像から動画へ $1.05 テキストから動画へ $1.05 6s 720p 画像から動画へ $0.72 テキストから動画へ $0.72 1080p 画像から動画へ $1.26 テキストから動画へ $1.26 7s 720p 画像から動画へ $0.84 テキストから動画へ $0.84 1080p 画像から動画へ $1.47 テキストから動画へ $1.47 8s 720p 画像から動画へ $0.96 テキストから動画へ $0.96 1080p 画像から動画へ $1.68 テキストから動画へ $1.68 9s 720p 画像から動画へ $1.08 テキストから動画へ $1.08 1080p 画像から動画へ $1.89 テキストから動画へ $1.89 10s 720p 画像から動画へ $1.20 テキストから動画へ $1.20 1080p 画像から動画へ $2.10 テキストから動画へ $2.10 11s 720p 画像から動画へ $1.32 テキストから動画へ $1.32 1080p 画像から動画へ $2.31 テキストから動画へ $2.31 12s 720p 画像から動画へ $1.44 テキストから動画へ $1.44 1080p 画像から動画へ $2.52 テキストから動画へ $2.52 13s 720p 画像から動画へ $1.56 テキストから動画へ $1.56 1080p 画像から動画へ $2.73 テキストから動画へ $2.73 14s 720p 画像から動画へ $1.68 テキストから動画へ $1.68 1080p 画像から動画へ $2.94 テキストから動画へ $2.94 15s 720p 画像から動画へ $1.80 テキストから動画へ $1.80 1080p 画像から動画へ $3.15 テキストから動画へ $3.15
終点
POST https://pollo.ai/api/platform/v1/generation/alibaba/happyhorse-1-0/videoコピー モード
Text To Video Image To Video Reference To Video
APIドキュメント全体を表示 Pollo APIでHappy Horse 1.0を実行
Happy Horse 1.0は、音声と動画を同時に生成します。セリフは口の動きと一致し、環境音はシーンに馴染み、カメラワークはプロンプトに従うため、クリップは無音ではなく自然に声が乗った仕上がりになります。
Pollo API上のHappy Horse 1.0を使えば、開発者はテキストから動画、画像から動画の生成をアプリに追加できます。出力は720Pまたは1080P、クリップ長は3〜15秒に対応しています。
Happy Horse 1.0 APIの主な機能
音声とオーディオの同期
会話、トーン、サウンドを映像に合わせられるため、話している被写体の声が自分の口元とズレていくことなく、タイミングよく再生されます。
高精度なリップシンク
口の形を発話内容に合わせることで、キャラクターがセリフを言う、数を数える、カメラ前で反応する場面でも、話者中心のショットの説得力を保てます。
多言語対応出力
異なる言語のプロンプトから対応する音声出力を生成できるため、同じ台本のローカライズ版を、作業途中でツールを切り替えずに作れます。
プロンプト駆動のカメラ移動
寄り、パン、ゆっくりした周回などを指定すると、モデルがその動きを構成し、話す人物の静止画的な画ではなく、演出意図のあるショットになります。
長さの細かな制御
クリップ長を3〜15秒の範囲で1秒刻みで設定できるので、セリフ、字幕の拍、ループにぴったり合わせられます。
テキスト開始と画像開始
文章で書いたシーンからでも、用意した画像からでも開始できるため、アイデア先行の台本とアセット先行のブリーフを同じ生成フローで扱えます。
Happy Horse 1.0 APIのユースケース
トーキングアバター: 口の動きが合った状態で台本を読み上げるスポークスパーソンを生成し、オンボーディング導線やバーチャルプレゼンター用ツールに活用。
ローカライズ広告バリエーション: 同じ短尺広告を複数言語で制作し、それぞれ音声を同期。1つの連携で複数地域に展開できるキャンペーンに。
解説スニペット: 書かれた手順をナレーション付きクリップに変換。キャラクターが説明を話し、カメラが説明対象の詳細へ移動。
キャラクターボイスライン: 静止キャラクター画像を短いトーキングショットにアニメーション化し、物語・ゲーム・ファンコンテンツ向けアプリに“話す存在”を追加。
プロダクト訴求: プレゼンターがカメラ前で機能名と価格を伝え、口元と発話を一致。短尺のショッパブル配置やSNS配置に最適。
吹替シーン再構築: 新しい言語で台本シーンを再現し、リップシンクも更新。字幕重ねだけではないローカライズを支援。
SNS向けトーキングクリップ: 3〜15秒の縦型・正方形フォーマットにフックとなる発話を収め、無音素材より効果的な“声付き動き”をフィード向けに実現。
Happy Horse 1.0 APIの使い方
APIキーを取得: Pollo APIアカウントを作成し、開発者ダッシュボードでAPIキーを生成します。
モデルを選択: /generation/wanx/happyhorse-1.0 のHappy Horse 1.0エンドポイントにリクエストを送信します。
入力を追加: テキストから動画には prompt、画像から動画には image URLを指定し、resolution(720Pまたは1080P)とlength(3〜15)を設定します。テキストから動画では aspectRatio も指定可能です。
生成して取得: タスクを送信し、返されたタスク状態をポーリングして、処理成功後に完成動画をダウンロードします。
Happy Horse 1.0 API向けプロンプトのベストプラクティス プロンプトは「台本 + ショットリスト」として扱うのがコツです。正確なセリフを書き、話者と言語を明記し、カメラと設定を説明して、音声と動きを揃えます。
シンプルなプロンプトの型 Speaker + 引用符付きの発話とその言語 + 表情またはジェスチャー + カメラ移動 + 設定と音のキュー
注目すべきポイント
会話文を引用する: リップシンクが言い換えではなく正確なセリフを追えるよう、実際の言葉をプロンプトに入れます。
言語を明記する: ローカライズ出力が必要な場合は話し言葉の言語を指定。モデルは指定内容に合わせて発話を生成します。
カメラ移動は1つに絞る: 寄りやパンなど単一の動きにすると、クリップ全体でショットのコントロールが安定します。
話者を1人に集中させる: 話している人物をフレーム中央に置くことで、口元のディテールと声を高精度に一致させやすくなります。
長さをセリフに合わせる: 実際の発話ペースに近い尺を選び、早口すぎたり間延びしたりしないようにします。
プロンプト例
多言語スポークスパーソン "親しみやすい銀行の窓口係がカメラを見ながら、スペイン語で「Abrir tu cuenta toma dos minutos」と話しかける。温かな支店内の照明、ほのかな微笑み、ゆるやかなカメラの寄り。クリアに同期された音声に、静かなオフィスの環境音が重なる。"
画像からトーキングキャラクター "提供されたイラストのキツネをアニメーション化し、カメラの方を向いて、優しい絵本のような声で「Ready for tonight's story?」と言わせる。居心地の良いランプの灯りが照らす部屋、机の上をゆっくりとパンする映像、それに合わせた口の動き。"
市場の売り手コールアウト "屋台の料理人が串焼きを掲げて、「Fresh off the grill, five dollars each!」と声を張る。湯気が立ち上り、背後には賑わう屋台。ハンドヘルド・カメラがゆっくりと近づいていく。活気あふれる市場の音と、声にシンクロした映像。"
フィットネスコーチのカウント "明るいスタジオで、コーチがカメラに向かいながら「Three, two, one, hold」とカウントし、同時に手を下に動かすジェスチャーをする。安定したフレームにゆるやかな軌道移動、明るい室内の音響、発話された数字ごとに口の動きがシンクロする。"
Happy Horse 1.0 vs Veo 3.1 vs Kling 2.6 機能 Happy Horse 1.0 Veo 3.1 Kling 2.6 音声とオーディオの同期 ✅ 生成に内蔵 ✅ ネイティブ音声 ⚠️ リップシンクは別工程 リップシンク精度 ✅ 発話セリフに強い ✅ 高精度 ✅ アドオンで良好 多言語対応出力 ✅ ✅ ⚠️ 制限あり クリップ長 3〜15秒、1秒刻み 固定の短尺クリップ 指示可能な短尺クリップ 解像度オプション 720Pと1080P 最大1080P 最大1080P おすすめ用途 音声付きトーキングクリップとローカライズ 高品質な音声付き映像ショット キャラクター動作とスタイライズドシーン
なぜHappy Horse 1.0 APIを選ぶの? Happy Horse 1.0は、人やキャラクターにカメラ前で話させる必要があるプロダクトに適しており、高精度リップシンク、多言語音声、プロンプト駆動のカメラ移動を1回の生成で実現します。
Pollo API経由なら、1つのAPIキーでHappy Horse 1.0に加えて300以上の主要な動画・画像モデルへアクセスでき、分かりやすいドキュメント、タスク状態ポーリング、生成機能を利用できます。
Happy Horse 1.0 API FAQ
Happy Horse 1.0とは? Happy Horse 1.0は、高精度リップシンク、多言語音声、リアルな動き、プロンプト駆動のカメラ移動を備えた、音声と映像が同期したクリップを生成する動画生成モデルです。
Happy Horse 1.0 APIはテキスト入力と画像入力をサポートしていますか? はい。テキストのpromptから生成することも、画像URLをアニメーション化することもできるため、台本先行とアセット先行の両ワークフローを同じモデルで処理できます。
音声とリップシンクはどう動作しますか? 音声とサウンドは動画と同時に生成され、口の動きに合わせて整列されるため、別途同期工程を挟まなくても被写体の言葉と唇が一致します。
利用できる解像度とクリップ長は? Happy Horse 1.0は720Pまたは1080Pで出力し、3〜15秒のクリップ長をサポートしています。リクエストごとに1秒単位で指定できます。
複数言語の動画を作れますか? はい。異なる言語で書かれたプロンプトから、ローカライズ広告、吹替ツール、地域別バリエーション向けの対応音声を生成できます。
なぜPollo API経由でHappy Horse 1.0を使うべきですか? Pollo APIなら、Happy Horse 1.0と300以上の他モデルを1つの連携で扱え、ドキュメント、タスク追跡、低コスト生成を利用できます。