Happy Horse 1.0 génère une synchronisation audio-vidéo avec une synchronisation labiale précise, des mouvements réalistes et une narration cinématographique en plusieurs plans.
curl-X POST 'https://pollo.ai/api/platform/v1/generation/alibaba/happyhorse-1-0/video'\-H'Content-Type: application/json'\-H'x-api-key: YOUR_API_KEY'\-d'{ "input": { "prompt": "A cinematic shot of a golden retriever running through a field of sunflowers at sunset, warm rim light, shallow depth of field", "duration": 5, "resolution": "720p", "aspectRatio": "1:1" }}'
{"input":{"prompt":"A cinematic shot of a golden retriever running through a field of sunflowers at sunset, warm rim light, shallow depth of field","duration":5,"resolution":"720p","aspectRatio":"1:1"},"webhookUrl":"https://example.com/webhooks/pollo"}
模式
输入所选端点和模式的字段。
场地
类型
必需的
描述
prompt
string
支持
Text prompt describing the content to generate.
duration
integer
不
The duration of the generated video, in seconds.
resolution
string
不
Output resolution of the generated media (e.g. 720p, 1080p, 2K, 4K). Values are case-insensitive.
Happy Horse 1.0 génère le son et la vidéo simultanément. Les dialogues correspondent aux mouvements des lèvres, l'ambiance sonore s'accorde à la scène et les mouvements de caméra suivent les instructions, donnant ainsi l'impression d'une voix plutôt que d'un son muet.
Avec Happy Horse 1.0 sur l'API Pollo , les développeurs peuvent ajouter la génération de texte en vidéo et d'image en vidéo à leurs Apps, avec une sortie 720P ou 1080P et des longueurs de clip de 3 à 15 secondes.
Principales caractéristiques de l'API Happy Horse 1.0
Synchronisation de la parole et de l'audio
Veillez à ce que les dialogues, le ton et le son soient en harmonie avec les images, afin que le personnage qui parle parle en rythme et ne se désynchronise pas avec sa propre voix.
Synchronisation labiale précise
Veillez à ce que les formes de la bouche soient alignées avec les mots prononcés, afin que les plans centrés sur l'orateur restent crédibles lorsqu'un personnage prononce une réplique, compte ou réagit devant la caméra.
Livraison multilingue
Générez une sortie vocale correspondante à partir de commandes dans différentes langues, prenant en charge les versions localisées d'un même script sans changer d'outil en cours de travail.
Mouvements de caméra déclenchés par des invites
Décrivez un travelling avant, un panoramique ou une orbite lente, et le modèle met en scène le mouvement, offrant des plans dirigés au lieu d'une image statique avec un visage qui parle.
Contrôle précis de la longueur
Réglez la durée du clip de 3 à 15 secondes par incréments d'une seconde pour correspondre exactement à une phrase prononcée, au rythme d'une légende ou à une boucle.
Début du texte et de l'image
Commencez par une scène écrite ou une image fournie, permettant ainsi aux scénarios axés sur l'idée et aux briefs axés sur les ressources d'utiliser le même processus de génération.
Cas d'utilisation de l'API Happy Horse 1.0
Avatars parlants : Générez un porte-parole qui lit un script à voix haute avec des mouvements des lèvres correspondants pour les flux d’intégration et les outils de présentation virtuelle.
Variantes publicitaires localisées : Produisez le même spot publicitaire court dans plusieurs langues, chacune avec une voix synchronisée, afin qu’une seule campagne soit diffusée dans différentes régions à partir d’une seule intégration.
Extraits explicatifs : Transformez une étape écrite en un clip commenté où un personnage énonce l’instruction tandis que la caméra se déplace vers le détail décrit.
Lignes vocales des personnages : Animez une image fixe d'un personnage en une courte séquence de dialogue, donnant ainsi une voix aux Apps pour les histoires, les jeux ou le contenu de fans.
Présentation de produits : Demandez à un présentateur de nommer une caractéristique et son prix devant la caméra, en synchronisant sa bouche et ses paroles, pour des placements courts, destinés à l’achat et aux réseaux sociaux.
Reconstruction de scènes doublées : Recréez un moment scénarisé dans une nouvelle langue avec une synchronisation labiale améliorée, permettant aux outils de localisation d'aller au-delà des superpositions de sous-titres.
Extraits interactifs pour les réseaux sociaux : Adaptez des séquences vocales de 3 à 15 secondes à des formats verticaux ou carrés pour les flux où le mouvement vocal est plus performant que les images muettes.
Comment utiliser l'API Happy Horse 1.0
Obtenir une clé API : Créez un compte API Pollo et générez votre clé API depuis le tableau de bord développeur.
Choisissez le modèle : Envoyez des requêtes au point de terminaison Happy Horse 1.0 à l’adresse /generation/wanx/ HappyHorse-1.0.
Ajoutez vos paramètres : Indiquez une invite pour la conversion de texte en vidéo, ou une URL d'image pour la conversion d'image en vidéo, puis définissez la résolution (720p ou 1080p) et la longueur (de 3 à 15). La conversion de texte en vidéo accepte également le aspectRatio.
Générer et récupérer : Soumettez la tâche, interrogez l'état de la tâche renvoyée et téléchargez la vidéo terminée une fois le traitement réussi.
Recommandations pour l'API Happy Horse 1.0
Considérez la consigne comme un script accompagné d'une liste de plans. Notez la réplique exacte, le nom du locuteur et la langue, puis décrivez la caméra et le décor afin que le son et l'image soient synchronisés.
Une formule simple pour les invites
Locuteur + réplique entre guillemets et langue + expression ou geste + mouvement de caméra + décor et signal audio
Ce que vous devez remarquer
Citez le dialogue : Indiquez les mots exacts dans l’invite afin que la synchronisation labiale ait une réplique précise à suivre plutôt qu’une paraphrase.
Indiquez la langue : Précisez la langue parlée lorsque vous avez besoin d’une diffusion localisée, car le modèle adapte la parole à ce que vous spécifiez.
Mouvement de caméra unique : Demandez un seul mouvement, comme un zoom avant ou un panoramique, afin que le plan reste contrôlé tout au long du clip.
Concentrez-vous sur un seul interlocuteur : Centrez le cadre sur la personne qui parle afin que les détails de la bouche et la voix restent bien alignés.
Définir la longueur de la ligne : Choisissez une durée proche du rythme réel de la phrase prononcée afin que la parole ne soit ni précipitée ni étirée.
Exemples d'invites
Porte-parole multilingue
« Un guichetier souriant regarde la caméra et dit en espagnol : « Abrir tu cuenta toma dos minutos ». Éclairage chaleureux de l'agence, léger sourire, approche douce, parole claire et synchronisée avec l'ambiance calme du bureau. »
Personnage parlant issu d'une image
« Animez le renard illustré fourni de façon à ce qu'il se tourne vers la caméra et dise d'une voix douce, comme dans un livre pour enfants : « Prêt pour l'histoire de ce soir ? ». Pièce chaleureuse éclairée par une lampe, lent panoramique sur le bureau, synchronisation labiale. »
Appel aux fournisseurs du marché
« Un vendeur de street food brandit une brochette et crie : « Fraîchement grillé, cinq dollars pièce ! » De la vapeur s'élève, un étal animé se trouve derrière, une caméra à main se rapproche, on entend l'ambiance animée du marché et une voix synchronisée. »
Nombre de coachs sportifs
« Dans un studio lumineux, un coach fait face à la caméra et compte : « Trois, deux, un, attendez », en désignant le sol du menton. Plan fixe avec un lent mouvement de rotation, ambiance sonore dynamique, mouvements des lèvres synchronisés avec chaque chiffre prononcé. »
Happy Horse 1.0 vs Veo 3.1 vs Kling 2.6
Capacité
Happy Horse 1.0
Veo 3.1
Kling 2.6
Synchronisation parole et audio
✅ Intégrée à la génération
✅ Audio natif
⚠️ Synchronisation labiale en étape séparée
Précision de la synchronisation labiale
✅ Excellente pour les dialogues parlés
✅ Excellente
✅ Bonne avec les modules complémentaires
Livraison multilingue
✅
✅
⚠️ Limité
Durée des clips
3 à 15 secondes, par incréments de 1 seconde
Clips courts fixes
Clips courts dirigés
Options de résolution
720p et 1080p
Jusqu'à 1080p
Jusqu'à 1080p
Recommandé pour
Clips audio et localisation
Prises de vue audio-vidéo haut de gamme
Animations de personnages et scènes stylisées
Pourquoi choisir l'API Happy Horse 1.0 ?
Happy Horse 1.0 convient aux produits qui nécessitent que des personnes ou des personnages parlent devant la caméra, en associant une synchronisation labiale précise, un audio multilingue et des mouvements de caméra déclenchés par des invites, le tout en une seule génération.
Grâce à l'API Pollo , vous accédez à Happy Horse 1.0 avec une seule clé API, ainsi qu'à plus de 300 modèles vidéo et image de pointe, avec une documentation claire, un suivi de l'état des tâches et une génération.
FAQ sur l'API Happy Horse 1.0
Qu'est-ce que Happy Horse 1.0 ?
Happy Horse 1.0 est un modèle de génération vidéo qui crée des clips audio-vidéo synchronisés avec une synchronisation labiale précise, une parole multilingue, des mouvements réalistes et des mouvements de caméra déclenchés par des invites.
L'API Happy Horse 1.0 prend-elle en charge les entrées de texte et d'image ?
Oui. Vous pouvez générer une animation à partir d'une invite textuelle ou animer une URL d'image ; ainsi, les flux de travail basés sur un script ou sur une ressource suivent le même modèle.
Comment fonctionnent l'audio et la synchronisation labiale ?
La parole et le son sont générés avec la vidéo et synchronisés avec les mouvements de la bouche, de sorte que les mots d'un sujet correspondent à ses lèvres au lieu de nécessiter une synchronisation séparée.
Quelles sont les résolutions et les durées de clip disponibles ?
Happy Horse 1.0 produit des vidéos en 720p ou 1080p et prend en charge des clips d'une durée de 3 à 15 secondes, choisis seconde par seconde à chaque requête.
Peut-il produire des vidéos en plusieurs langues ?
Oui. Les messages rédigés dans différentes langues génèrent une sortie vocale correspondante pour les publicités localisées, les outils de doublage et les variantes spécifiques à chaque région.
Pourquoi exécuter Happy Horse 1.0 via l'API Pollo ?
L'API Pollo offre une intégration pour Happy Horse 1.0 et plus de 300 autres modèles, avec documentation, suivi des tâches et génération à moindre coût.