在 Pollo API 上运行 Pollo 2.0
Pollo 2.0 将声音与角色稳定性结合在一起。该模型可以在生成画面的同时产出匹配音频,并在整个片段中保持主体可识别,让短视频看起来是完整成片,而不是静音草稿。
借助部署在 Pollo API 上的 Pollo 2.0,开发者可以为应用添加文生视频、图生视频和参考图引导生成能力,并可在每次请求中选择 480p、720p 或 1080p 输出,以及 5 秒或 10 秒片段。
Pollo 2.0 API 核心功能
内置音频生成
Pollo 2.0 可生成与场景匹配、听感自然的音频,因此生成片段可一步到位自带声音,无需再单独做配音或配乐。
角色一致性
该模型可从首帧到末帧稳定保持主体的脸部、服装与身份特征,使重复出现的角色在短叙事或系列片段中保持连贯。
文本、图像与参考输入
你可以从书面提示词开始、让静态图动起来,或用参考图引导输出,让“想法优先”和“素材优先”的创作者都能直接得到动态结果。
灵活的画幅比例
文本提示词支持宽屏、竖屏、方形和竖版等画幅比例,让一次集成即可输出适配横屏播放器、移动端故事流和方形社媒位的内容,无需裁剪。
丰富风格范围
从写实风到插画与风格化视觉,Pollo 2.0 都能适配不同需求,因此同一模型可在同一产品中服务差异很大的视觉方向。
快速且高性价比的产出
5 秒和 10 秒的短时生成返回速度快、价格低,使该模型非常适合高频打草稿、预览和迭代创作闭环。
Pollo 2.0 API 使用场景
- 口播片段生成: 将描述场景与生成音频配对,产出简短口播或旁白片段,适用于讲解工具和社交工具,无需单独搭建声音制作环节。
- 重复角色内容: 在多期内容中保持吉祥物或主播的视觉一致性,适合连载短片和频道化内容应用。
- 竖版社交短视频: 直接渲染 9:16 与 1:1 片段用于移动端信息流,让创作工具开箱即得可发布格式。
- 参考图引导场景: 输入参考图锁定风格或主体,再生成符合需求的运动画面,适合风格可控的生产流程。
- 静态图片动画化: 将单张商品图或人像图转成短动态镜头,同时保留原始构图与主体。
- 高产量草稿板: 以低成本批量生成多个 5 秒快速片段,在投入更长时长或更高分辨率渲染前先预览创意。
- 多格式广告变体: 用同一提示词生成多种画幅比例和分辨率版本,覆盖不同投放位。