输入 请填写必填字段以查看价格
Text To Video · 720p · 5s
生成 时长 分辨率 类型 价格 output second 720p 参考生视频 $0.12 / s 1080p 参考生视频 $0.21 / s 3s 720p 图生视频 $0.36 文生视频 $0.36 1080p 图生视频 $0.63 文生视频 $0.63 4s 720p 图生视频 $0.48 文生视频 $0.48 1080p 图生视频 $0.84 文生视频 $0.84 5s 720p 图生视频 $0.60 文生视频 $0.60 1080p 图生视频 $1.05 文生视频 $1.05 6s 720p 图生视频 $0.72 文生视频 $0.72 1080p 图生视频 $1.26 文生视频 $1.26 7s 720p 图生视频 $0.84 文生视频 $0.84 1080p 图生视频 $1.47 文生视频 $1.47 8s 720p 图生视频 $0.96 文生视频 $0.96 1080p 图生视频 $1.68 文生视频 $1.68 9s 720p 图生视频 $1.08 文生视频 $1.08 1080p 图生视频 $1.89 文生视频 $1.89 10s 720p 图生视频 $1.20 文生视频 $1.20 1080p 图生视频 $2.10 文生视频 $2.10 11s 720p 图生视频 $1.32 文生视频 $1.32 1080p 图生视频 $2.31 文生视频 $2.31 12s 720p 图生视频 $1.44 文生视频 $1.44 1080p 图生视频 $2.52 文生视频 $2.52 13s 720p 图生视频 $1.56 文生视频 $1.56 1080p 图生视频 $2.73 文生视频 $2.73 14s 720p 图生视频 $1.68 文生视频 $1.68 1080p 图生视频 $2.94 文生视频 $2.94 15s 720p 图生视频 $1.80 文生视频 $1.80 1080p 图生视频 $3.15 文生视频 $3.15
端点
POST https://pollo.ai/api/platform/v1/generation/alibaba/happyhorse-1-0/video复制 模式
Text To Video Image To Video Reference To Video
查看完整 API 文档 在 Pollo API 上运行 Happy Horse 1.0
Happy Horse 1.0 可同时生成声音和视频。台词与口型匹配,环境音贴合场景,镜头运动遵循提示词,因此片段听起来像有真实配音,而不是静音画面。
通过 Pollo API 接入 Happy Horse 1.0,开发者可以在应用中加入文生视频和图生视频生成,支持 720P 或 1080P 输出,片段时长可在 3 到 15 秒之间选择。
Happy Horse 1.0 API 主要功能
语音与音频同步
让对白、语气和声音与画面保持一致,使说话主体能够按时发声,而不会与自己的声音脱节。
精准口型同步
让嘴型与说出的词句保持一致,使以说话者为主体的镜头在角色说台词、报数或对镜头反应时依然真实可信。
多语言输出
可根据不同语言的提示词生成匹配的语音输出,在不切换工具的情况下支持同一脚本的本地化版本。
提示词驱动的镜头运动
只需描述推进、平移或慢速环绕,模型就会安排对应运动,让你获得有导演感的镜头,而不是固定机位下的“讲话头像”。
精细时长控制
可将片段时长设置为 3 到 15 秒,并支持 1 秒步进,精准匹配一句台词、一个字幕节奏或一个循环段落。
文本与图像双起始
既可从文字场景开始,也可从提供的图片开始,让“先有创意的脚本”和“先有素材的需求”走同一生成路径。
Happy Horse 1.0 API 使用场景
会说话的数字人: 生成可朗读脚本且口型匹配的发言人,用于新手引导流程和虚拟主持工具。
本地化广告变体: 用多种语言生成同一条短广告,每条都语音同步,让一次接入即可支持跨地区营销活动投放。
讲解短片: 将书面步骤转成带旁白的片段,让角色一边说指令,镜头一边移动到对应细节。
角色语音台词: 将静态角色图动起来,生成短说话镜头,为故事、游戏或粉丝内容类应用提供会说话的角色。
产品卖点口播: 让出镜讲解者在镜头前说出功能和价格,口型与词句对齐,适合短视频带货与社媒投放。
配音场景重建: 用新语言重建脚本化片段并生成新的口型同步,帮助本地化工具超越仅加字幕的方式。
社媒口播短片: 将语音钩子放进 3 到 15 秒的竖版或方版格式,在信息流中通常比静音素材更出彩。
如何使用 Happy Horse 1.0 API
获取 API Key: 创建 Pollo API 账号,并在开发者控制台生成你的 API key。
选择模型: 将请求发送到 Happy Horse 1.0 端点 /generation/wanx/happyhorse-1.0。
添加输入: 文生视频提供 prompt,图生视频提供 image URL,然后设置 resolution(720P 或 1080P)和 length(3 到 15)。文生视频还支持 aspectRatio。
生成并获取结果: 提交任务,轮询返回的任务状态,处理成功后下载最终视频。
Happy Horse 1.0 API 提示词最佳实践 把提示词当作“脚本 + 分镜表”。先写清准确台词,标明说话者与语言,再描述镜头和场景,让音频与运动对齐。
一个简单的提示词公式 说话者 + 引号中的台词与语言 + 表情或手势 + 镜头运动 + 场景与声音提示
你需要注意的点
把对白写进引号: 在提示词中放入真实台词,让口型同步有明确文本可跟,而不是跟随改写内容。
标明语言: 需要本地化输出时请明确口语语言,因为模型会按你的指定匹配语音。
只指定一个镜头运动: 例如推进或平移,能让整段镜头更可控。
聚焦单一说话者: 让画面中心对准说话者,使口部细节与声音紧密对齐。
时长贴合台词节奏: 选择接近真实语速的时长,避免语音过快或被拉长。
提示词示例
多语言发言人 “一个友善的银行柜员看向镜头,用西班牙语说:‘Abrir tu cuenta toma dos minutos.’ 网点暖色灯光,轻微微笑,柔和推进,语音同步清晰并带有安静办公室环境音。”
从图片生成会说话角色 “让提供的插画狐狸动起来,转向镜头并用柔和童话口吻说:‘Ready for tonight's story?’ 温馨台灯房间,镜头缓慢平移过桌面,口型运动匹配。”
市场摊主叫卖 “街头小吃摊主举起一串烤串并喊道:‘Fresh off the grill, five dollars each!’ 蒸汽升腾,身后摊位忙碌,手持镜头缓缓靠近,热闹市场环境音与同步语音。”
健身教练报数 “明亮健身房里的教练面向镜头报数:‘Three, two, one, hold,’ 同时向下示意。稳定画面配合慢速环绕,积极的室内氛围音,嘴型与每个数字同步。”
Happy Horse 1.0 vs Veo 3.1 vs Kling 2.6 能力 Happy Horse 1.0 Veo 3.1 Kling 2.6 语音与音频同步 ✅ 内置于生成 ✅ 原生音频 ⚠️ 口型同步为独立步骤 口型同步准确度 ✅ 台词表现强 ✅ 强 ✅ 搭配附加组件效果好 多语言输出 ✅ ✅ ⚠️ 有限 片段时长 3 到 15 秒,1 秒步进 固定短片段 定向短片段 分辨率选项 720P 和 1080P 最高 1080P 最高 1080P 推荐用于 口播短片与本地化 高端音视频镜头 角色运动与风格化场景
为什么选择 Happy Horse 1.0 API? Happy Horse 1.0 适合需要人物或角色出镜说话的产品,在一次生成中同时提供精准口型同步、多语言音频与提示词驱动镜头运动。
通过 Pollo API,你可用一个 API key 接入 Happy Horse 1.0 以及 300+ 主流视频与图像模型,并获得清晰文档、任务状态轮询与生成能力。
Happy Horse 1.0 API 常见问题
Happy Horse 1.0 是什么? Happy Horse 1.0 是一个视频生成模型,可创建音视频同步片段,并具备精准口型同步、多语言语音、真实运动和提示词驱动的镜头运动。
Happy Horse 1.0 API 支持文本和图像输入吗? 支持。你可以通过文本提示词生成,也可以让图片 URL 动起来,因此无论是脚本优先还是素材优先的工作流都能走同一模型。
音频和口型同步是如何实现的? 语音和声音会与视频一同生成并与嘴部运动对齐,因此主体说出的词句会和口型一致,无需额外再做一次同步流程。
可用的分辨率和片段时长有哪些? Happy Horse 1.0 支持输出 720P 或 1080P,片段时长支持 3 到 15 秒,并可按每次请求以 1 秒粒度选择。
能生成多语言视频吗? 可以。用不同语言编写的提示词会生成对应语音输出,适用于本地化广告、配音工具和区域版本内容。
为什么要通过 Pollo API 运行 Happy Horse 1.0? Pollo API 为 Happy Horse 1.0 和其他 300+ 模型提供统一接入,同时具备文档、任务追踪与更低成本的生成能力。