curl-X POST 'https://pollo.ai/api/platform/v1/generation/alibaba/happyhorse-1-0/video'\-H'Content-Type: application/json'\-H'x-api-key: YOUR_API_KEY'\-d'{ "input": { "prompt": "A cinematic shot of a golden retriever running through a field of sunflowers at sunset, warm rim light, shallow depth of field", "duration": 5, "resolution": "720p", "aspectRatio": "1:1" }}'
Optional kann webhookUrl angegeben werden, um eine Rückruffunktion zu erhalten, wenn die Aufgabe erfolgreich war oder fehlschlug.
Optionales Anfragefeld
{"input":{"prompt":"A cinematic shot of a golden retriever running through a field of sunflowers at sunset, warm rim light, shallow depth of field","duration":5,"resolution":"720p","aspectRatio":"1:1"},"webhookUrl":"https://example.com/webhooks/pollo"}
Schema
Eingabefelder für den ausgewählten Endpunkt und Modus.
Feld
Typ
Erforderlich
Beschreibung
prompt
string
Ja
Text prompt describing the content to generate.
duration
integer
NEIN
The duration of the generated video, in seconds.
resolution
string
NEIN
Output resolution of the generated media (e.g. 720p, 1080p, 2K, 4K). Values are case-insensitive.
Happy Horse 1.0 erzeugt Ton und Video gleichzeitig. Gesprochene Zeilen synchronisieren die Mundbewegungen, Umgebungsgeräusche passen zur Szene und Kamerabewegungen folgen den Anweisungen, sodass die Clips vertont und nicht stummgeschaltet wirken.
Mit Happy Horse 1.0 auf der Pollo API können Entwickler ihren Apps die Generierung von Text-zu-Video und Bild-zu-Video hinzufügen, mit 720P- oder 1080P-Ausgabe und Cliplängen von 3 bis 15 Sekunden.
Hauptmerkmale der Happy Horse 1.0 API
Synchronisierte Sprache und Audio
Achten Sie darauf, dass Dialog, Tonfall und Geräusch mit den Bildern übereinstimmen, damit eine sprechende Person im Takt spricht und nicht aus dem Takt gerät.
Genaue Lippensynchronisation
Achten Sie darauf, dass die Mundbewegungen mit den gesprochenen Worten übereinstimmen, damit die auf den Sprecher fokussierten Aufnahmen glaubwürdig bleiben, wenn eine Figur einen Satz sagt, zählt oder vor der Kamera reagiert.
Mehrsprachige Bereitstellung
Generieren Sie passende Sprachausgaben aus Eingabeaufforderungen in verschiedenen Sprachen und unterstützen Sie lokalisierte Versionen desselben Skripts, ohne mitten im Arbeitsablauf das Tool wechseln zu müssen.
Eingabegesteuerte Kamerabewegungen
Beschreiben Sie eine Nahaufnahme, einen Schwenk oder eine langsame Umlaufbahn, und das Modell inszeniert die Bewegung, wodurch gezielte Aufnahmen anstelle eines statischen Bildes mit einem sprechenden Kopf entstehen.
Feine Längenregulierung
Stellen Sie die Clip-Länge in Ein-Sekunden-Schritten von 3 bis 15 Sekunden ein, um sie exakt an eine gesprochene Zeile, einen Untertitel-Beat oder eine Schleife anzupassen.
Text- und Bildbeginn
Beginnen Sie mit einer schriftlichen Szene oder einem bereitgestellten Bild, damit sowohl ideenorientierte Drehbücher als auch ressourcenorientierte Briefings denselben Generierungspfad nutzen können.
Anwendungsfälle der Happy Horse 1.0 API
Sprechende Avatare: Generieren Sie einen Sprecher, der ein Skript laut vorliest und dabei die Lippenbewegungen dazu anpasst – ideal für Onboarding-Prozesse und virtuelle Präsentationstools.
Lokalisierte Werbevarianten: Es wird derselbe kurze Werbespot in mehreren Sprachen produziert, jeweils mit synchronisierter Sprachausgabe, sodass eine Kampagne regionsübergreifend von einer einzigen Integration aus ausgestrahlt werden kann.
Erklärende Ausschnitte: Verwandeln Sie einen schriftlichen Schritt in einen gesprochenen Clip, in dem eine Figur die Anweisung spricht, während die Kamera auf das beschriebene Detail schwenkt.
Charakter-Sprachausgabe: Animieren Sie ein statisches Charakterbild zu einer kurzen Sprechszene und geben Sie so Apps für Geschichten, Spiele oder Fan-Inhalte eine sprechende Figur.
Produktpräsentationen: Lassen Sie einen Moderator ein Produktmerkmal und den Preis vor der Kamera nennen, wobei Mund und Worte synchronisiert sein müssen, um kurze, kaufbare und Social-Media-Platzierungen zu ermöglichen.
Neugestaltung synchronisierter Szenen: Erstellen Sie einen im Drehbuch festgelegten Moment in einer neuen Sprache mit frischer Lippensynchronisation neu und helfen Sie so den Lokalisierungstools, über die Einblendung von Untertiteln hinauszugehen.
Social Talking Clips: Passen Sie gesprochene Hooks in 3- bis 15-sekündige vertikale oder quadratische Formate für Feeds an, bei denen gesprochene Bewegung stumme Inhalte übertrifft.
So verwenden Sie die Happy Horse 1.0 API
API-Schlüssel anfordern: Erstellen Sie ein Pollo API-Konto und generieren Sie Ihren API-Schlüssel im Entwickler-Dashboard.
Wählen Sie das Modell: Senden Sie Anfragen an den Happy Horse 1.0-Endpunkt unter /generation/wanx/ HappyHorse-1.0.
Fügen Sie Ihre Eingaben hinzu: Geben Sie eine prompt für Text-zu-Video oder eine image-URL für Bild-zu-Video an und legen Sie dann die resolution (720p oder 1080p) und die length (3 bis 15) fest. Bei Text-zu-Video wird auch das aspectRatio akzeptiert.
Generieren und Abrufen: Senden Sie die Aufgabe ab, überprüfen Sie den zurückgegebenen Aufgabenstatus und laden Sie das fertige Video herunter, sobald die Verarbeitung erfolgreich war.
Empfehlungen für bewährte Vorgehensweisen zur Happy Horse 1.0 API
Behandeln Sie die Vorgaben wie ein Drehbuch mit zusätzlicher Shotlist. Schreiben Sie die exakte gesprochene Zeile auf, nennen Sie den Sprecher und die Sprache und beschreiben Sie anschließend Kamera und Setting, damit Ton und Bewegung synchron sind.
Eine einfache Formel für eine Eingabeaufforderung
Sprecher + gesprochene Zeile in Anführungszeichen und Sprache + Ausdruck oder Gestik + Kamerabewegung + Umgebung und Audiohinweis
Was Sie beachten sollten
Dialog zitieren: Geben Sie die genauen Worte in der Anweisung an, damit die Lippensynchronisation eine exakte Zeile hat, der sie folgen kann, und nicht eine Paraphrase.
Sprache angeben: Geben Sie die gesprochene Sprache an, wenn Sie eine lokalisierte Ausgabe benötigen, da das Modell die Sprache an Ihre Angaben anpasst.
Direkte Kamerabewegung: Fordern Sie eine einzelne Bewegung an, z. B. ein Heranzoomen oder einen Schwenk, damit die Einstellung im gesamten Clip kontrolliert bleibt.
Konzentrieren Sie sich auf einen Sprecher: Zentrieren Sie das Bild auf die sprechende Person, damit Mundbewegungen und Stimme präzise aufeinander abgestimmt bleiben.
Länge der Zeile festlegen: Wählen Sie eine Dauer, die dem tatsächlichen Sprechtempo nahekommt, damit die Rede weder gehetzt noch gestreckt wirkt.
Beispielhafte Eingabeaufforderungen
Mehrsprachiger Sprecher
„Eine freundliche Bankangestellte blickt in die Kamera und sagt auf Spanisch: ‚Abrir tu cuenta toma dos minutos.‘ Warme Filialbeleuchtung, ein leichtes Lächeln, sanftes Heranzoomen, klare, synchrone Sprache in ruhiger Büroatmosphäre.“
Sprechende Figur aus einem Bild
„Animieren Sie den mitgelieferten illustrierten Fuchs so, dass er sich zur Kamera umdreht und mit sanfter Bilderbuchstimme sagt: ‚Bereit für die heutige Geschichte?‘. Gemütliches, von einer Lampe erleuchtetes Zimmer, langsamer Schwenk über den Schreibtisch, synchrone Lippenbewegungen.“
Aufruf an Marktverkäufer
„Ein Straßenimbissverkäufer hält einen Spieß hoch und ruft: ‚Frisch vom Grill, fünf Dollar das Stück!‘ Dampf steigt auf, dahinter geschäftiger Stand, die Handkamera gleitet näher heran, lebhafte Marktgeräusche und synchronisierter Kommentar.“
Fitness Coach Count
„Ein Trainer in einem hellen Studio blickt in die Kamera und zählt: ‚Drei, zwei, eins, halten‘, während er nach unten gestikuliert. Ruhiges Bild mit langsamer Bewegung, positiver Raumklang, Mundbewegungen sind auf jede gesprochene Zahl abgestimmt.“
Happy Horse 1.0 vs Veo 3.1 vs Kling 2.6
Kompatibilität
Happy Horse 1.0
Veo 3.1
Kling 2.6
Synchronisierte Sprache und Audio
✅ In die Generierung integriert
✅ Natives Audio
⚠️ Lippensynchronisation als separater Schritt
Lippensynchronisationsgenauigkeit
✅ Stark bei gesprochenen Zeilen
✅ Stark
✅ Gut mit Zusatzinhalten
Mehrsprachige Lieferung
✅
✅
⚠️ Eingeschränkt
Cliplänge
3 bis 15 Sekunden, in 1-Sekunden-Schritten
Kurze, statische Clips
Kurze, animierte Clips
Auflösungsoptionen
720p und 1080p
Bis zu 1080p
Bis zu 1080p
Empfohlen für
Vertonte Dialogsequenzen und Lokalisierung
Hochwertige Audio- und Videoaufnahmen
Charakteranimationen und stilisierte Szenen
Warum Happy Horse 1.0 API wählen?
Happy Horse 1.0 eignet sich für Produkte, bei denen Personen oder Charaktere vor der Kamera sprechen müssen, und vereint präzise Lippensynchronisation, mehrsprachigen Ton und promptgesteuerte Kamerabewegungen in einer Generation.
Über die Pollo API erhalten Sie mit einem einzigen API-Schlüssel Zugriff auf Happy Horse 1.0 sowie auf über 300 führende Video- und Bildmodelle, inklusive übersichtlicher Dokumentation, Abfrage des Aufgabenstatus und Generierung.
Häufig gestellte Fragen zur Happy Horse 1.0 API
Was ist Happy Horse 1.0?
Happy Horse 1.0 ist ein Videogenerierungsmodell, das synchronisierte Audio-Video-Clips mit präziser Lippensynchronisation, mehrsprachiger Sprache, realistischer Bewegung und promptgesteuerten Kamerabewegungen erzeugt.
Unterstützt die Happy Horse 1.0 API Text- und Bildeingaben?
Ja. Sie können aus einer Texteingabeaufforderung generieren oder eine Bild-URL animieren, sodass sowohl skriptbasierte als auch assetbasierte Workflows nach demselben Modell funktionieren.
Wie funktionieren Ton und Lippensynchronisation?
Sprache und Ton werden zusammen mit dem Video erzeugt und auf die Mundbewegungen abgestimmt, sodass die Worte einer Person mit ihren Lippenbewegungen übereinstimmen und kein separater Synchronisationsvorgang erforderlich ist.
Welche Auflösungen und Cliplängen sind verfügbar?
Happy Horse 1.0 gibt 720P oder 1080P aus und unterstützt Clip-Längen von 3 bis 15 Sekunden, die pro Anfrage sekundenweise ausgewählt werden.
Kann es Videos in mehreren Sprachen produzieren?
Ja. In verschiedenen Sprachen verfasste Eingabeaufforderungen erzeugen eine passende gesprochene Ausgabe für lokalisierte Werbespots, Synchronisationswerkzeuge und regionsspezifische Varianten.
Warum sollte Happy Horse 1.0 über die Pollo API laufen?
Die Pollo API bietet eine Integration für Happy Horse 1.0 und über 300 weitere Modelle, inklusive Dokumentation, Aufgabenverfolgung und kostengünstigerer Generierung.