curl-X POST 'https://pollo.ai/api/platform/v1/generation/alibaba/wan-v2-5/video'\-H'Content-Type: application/json'\-H'x-api-key: YOUR_API_KEY'\-d'{ "input": { "prompt": "A cinematic shot of a golden retriever running through a field of sunflowers at sunset, warm rim light, shallow depth of field", "negativePrompt": "blurry, low quality, distorted, watermark, text", "duration": 5, "resolution": "480p", "aspectRatio": "1:1", "generateAudio": true }}'
Optional kann webhookUrl angegeben werden, um eine Rückruffunktion zu erhalten, wenn die Aufgabe erfolgreich war oder fehlschlug.
Optionales Anfragefeld
{"input":{"prompt":"A cinematic shot of a golden retriever running through a field of sunflowers at sunset, warm rim light, shallow depth of field","negativePrompt":"blurry, low quality, distorted, watermark, text","duration":5,"resolution":"480p","aspectRatio":"1:1","generateAudio":true},"webhookUrl":"https://example.com/webhooks/pollo"}
Schema
Eingabefelder für den ausgewählten Endpunkt und Modus.
Feld
Typ
Erforderlich
Beschreibung
audio
string
NEIN
Reference audio URL (HTTP(S)).
prompt
string
Ja
Text prompt describing the content to generate.
negativePrompt
string
NEIN
Text describing elements to avoid in the generated output.
duration
number
NEIN
The duration of the generated video, in seconds.
resolution
string
NEIN
Output resolution of the generated media (e.g. 720p, 1080p, 2K, 4K). Values are case-insensitive.
aspectRatio
string
NEIN
Output aspect ratio, as width:height (e.g. 16:9).
seed
integer
NEIN
Random seed for reproducible generation.
generateAudio
boolean
NEIN
Generate natural-sounding, fitting audio for the output video.
Wan 2.5 kann Video mit passendem Audio erzeugen oder hochgeladenes Audio als Vorgabe verwenden. Das macht es nützlich für Clips, in denen Sound, Bewegung und Timing zusammenspielen müssen.
Mit Wan 2.5 auf Pollo API fügen Entwickler ihren Apps Text-zu-Video- und Bild-zu-Video-Generierung hinzu – mit nativem Audio, negativen Prompts und allen Seitenverhältnissen in 480P, 720P oder 1080P.
Hauptfunktionen der Wan 2.5 API
Native Audio-Generierung
Wan 2.5 erzeugt standardmäßig synchronisierten Sound zum Video, sodass Umgebungsgeräusche, Effekte und Szenen-Audio zusammen ankommen, statt einen separaten Sound-Pass zu brauchen.
Audio-gesteuertes Video
Gib eine Audiospur vor und Wan 2.5 formt Bewegung und Timing danach – so werden Charakterbewegung oder Szenenrhythmus an den bereitgestellten Sound angepasst.
Verbesserte Bewegungsphysik
Bewegung folgt glaubwürdigerer Physik, sodass Gliedmaßen, Stoff und bewegte Objekte mit Gewicht und Kontinuität laufen, statt zwischen Frames zu rutschen oder zu zittern.
Präzisere Prompt-Erkennung
Das Modell liest beschriebene Motive, Aktionen und Inszenierung genauer, sodass das, was du schreibst, auch im Shot landet und die Zahl der Rerolls pro Idee sinkt.
Flexibles Framing
Alle Seitenverhältnisse funktionieren in jeder Auflösung, sodass quadratische, Hochformat- und Breitbild-Ausgaben aus einem Modell kommen – ohne späteres Cropping oder Reframing.
Steuerung mit negativen Prompts
Sag, was weggelassen werden soll, und Wan 2.5 steuert davon weg. Das liefert sauberere Ergebnisse, wenn eine Szene immer wieder unerwünschte Objekte, Farben oder Artefakte hineinzieht.
Anwendungsfälle der Wan 2.5 API
Sound-synchronisierte Erklärvideos: Erzeuge kurze How-to-Clips, bei denen Sprechertext oder Effekte zur Onscreen-Aktion passen, damit Produkttools Video mit Audio in einem Call ausliefern.
Audio-geführte Charakterclips: Lade eine Sprach- oder Musikspur hoch und lass Wan 2.5 Bewegung und Tempo eines Charakters darauf abstimmen – für sprechende oder performende Shots.
Ambient-Scene-Loops: Erstelle Natur- oder Umgebungsclips, bei denen generierter Sound wie rauschendes Wasser oder knisterndes Feuer die Atmosphäre ohne zusätzliche Bearbeitung vervollständigt.
Bild-zu-Bewegung: Gib ein Standbild vor und animiere es zu einem kurzen bewegten Shot, der die Originalkomposition beibehält und Bewegung plus Sound ergänzt.
Vertikaler Social Content: Erstelle 9:16-Clips in voller Auflösung für Short-Form-Feeds und nutze natives Audio, um einen manuellen Sound-Schritt in der Pipeline zu überspringen.
Werbevarianten für mehrere Formate: Generiere dasselbe Konzept in Quadrat-, Hochformat- und Breitbild aus einem Modell, um verschiedene Platzierungen gleichzeitig abzudecken.
Rhythmusangepasste Montagen: Gib einen Beat oder ein Musikbett vor und lass das Modell Schnitte und Bewegung darauf timen – für musikreaktive Creator-Tools.
Prompt-treues Prototyping: Sieh dir eine beschriebene Szene schnell als Preview an und nutze engere Prompt-Treue, bevor du in längere Produktion gehst.
So nutzt du die Wan 2.5 API
API-Schlüssel holen: Erstelle ein Pollo API-Konto und generiere deinen API-Schlüssel im Entwickler-Dashboard.
Modell wählen: Sende deine Anfrage an den Wan-2.5-Endpunkt unter /generation/wanx/wan-v2-5-preview.
Inputs hinzufügen: Gib einen prompt für Text-zu-Video oder eine image-URL für Bild-zu-Video an, dann setze resolution (480P, 720P, 1080P) und length (5 oder 10). Übergib audioUrl für audio-gesteuerte Generierung oder lasse wanAudio aktiv für generierten Sound.
Generieren und abrufen: Reiche die Aufgabe ein, poll den zurückgegebenen Aufgabenstatus und lade das fertige Video herunter, sobald die Verarbeitung erfolgreich ist.
Prompting-Best-Practices für die Wan 2.5 API
Schreibe für Bild und Sound zugleich. Nenne Motiv und Aktion, dann beschreibe den erwarteten Sound, das Framing und die Stimmung, damit das Modell Bewegung auf die Spur ausrichten kann.
Eine einfache Prompt-Formel
Motiv + spezifische Aktion + Audio- oder Sound-Cue + Kamera und Framing + Setting und Stimmung
Darauf solltest du achten
Sound beschreiben: Nenne den gewünschten Audioinhalt, z. B. Schritte, Wellen oder eine gesprochene Zeile, damit natives Audio ein klares Ziel hat.
Bewegung an Audio koppeln: Wenn du eine Spur vorgibst, beschreibe, wie Bewegung ihr folgen soll – etwa Schritte, die auf den Beat fallen.
Seitenverhältnis früh wählen: Entscheide dich früh für Quadrat, Hochformat oder Breitbild, damit die Komposition fürs finale Placement passt.
Negative Prompts nutzen: Liste aus, was ausgeschlossen werden soll, wenn eine Szene immer wieder Unordnung, hartes Licht oder unerwünschte Elemente ergänzt.
Eine klare Aktion halten: Fokussiere jeden 5- oder 10-Sekunden-Clip auf eine einzelne Bewegung, damit Bild und Sound kohärent bleiben.
Seed setzen zum Wiederholen: Nutze denselben Seed erneut, wenn du auf einem Ergebnis iterieren willst, ohne dein bevorzugtes Framing zu verlieren.
Beispiel-Prompts
Szene mit Ambient-Sound
"Eine gusseiserne Pfanne zischt, als geschnittene Zwiebeln auf heißes Öl treffen, Dampf steigt auf, ein Holzlöffel rührt langsam. Erzeuge passendes Zisch- und Rührgeräusch. Overhead-Nahaufnahme, warmes Küchenlicht, realistischer Stil, ruhige Bewegung."
Audio-gesteuerte Performance
"Ein Straßenakkordeonspieler wiegt sich und bewegt den Balg im Takt der bereitgestellten Musikspur, der Fuß tippt auf den Gehweg. Halbnah bei Dämmerung, weiches Straßenlaternenlicht, Bewegung eng mit dem Audio-Rhythmus synchronisiert."
Naturatmosphäre
"Ein schmaler Waldwasserfall fällt in ein klares Becken, Nebel zieht, Farne zittern vom Sprühwasser. Erzeuge fließendes Wasser und Vogelgesang. Langsamer Push-in, geflecktes Morgenlicht, Hochformat-9:16-Framing, ruhiger realistischer Ton."
Bildgeführte Animation
"Animiere das bereitgestellte Foto eines nachts von Laternen beleuchteten Markts: Dampf kringelt aus Essensständen, Lichterketten schwingen, ein Verkäufer winkt. Füge sanftes Menschenmurmeln und Ambient-Audio hinzu. Behalte die Originalkomposition, langsamer lateraler Kameradrift."
Wan 2.5 vs Veo 3.1 vs Kling 2.6
Fähigkeit
Wan 2.5
Veo 3.1
Kling 2.6
Native Audio-Generierung
✅ Sound standardmäßig generiert
✅ Natives Audio
❌ Nur Video
Audio-gesteuert von hochgeladener Spur
✅
❌
❌
Text- und Bild-Inputs
✅
✅
✅
Seitenverhältnisse
Alle Verhältnisse bei jeder Auflösung
Fester Satz
Fester Satz
Auflösungsoptionen
480P, 720P, 1080P
Bis 1080P
Bis 1080P
Clip-Länge
5 oder 10 Sekunden
Kurze geführte Clips
Kurze geführte Clips
Empfohlen für
Sound-synchrones und audio-geführtes Video
Dialoglastige Szenen
Steuerung von Charakterbewegung
Warum Wan 2.5 API wählen?
Wan 2.5 passt zu Produkten, die Bild und Sound gemeinsam brauchen – egal ob Audio automatisch erzeugt oder Bewegung auf eine hochgeladene Spur abgestimmt wird, mit verbesserter Physik und engerer Prompt-Treue.
Über Pollo API erreichst du Wan 2.5 mit einem API-Schlüssel neben 300+ führenden Video- und Bildmodellen – mit klarer Doku, Aufgabenstatus-Polling und Webhooks.
Starte mit dem Wan-2.5-Endpunkt auf Pollo API, um audio-native Video-Features auszurollen, und vergleiche es dann mit Veo, Kling und Sora, ohne deine Integration anzufassen.
Wan 2.5 API FAQs
Was ist Wan 2.5?
Wan 2.5 ist ein Videogenerierungsmodell von wanx, das Text-zu-Video und Bild-zu-Video mit nativem Audio, audio-gesteuerter Bewegung, verbesserter Physik und präziserer Prompt-Erkennung unterstützt.
Erzeugt die Wan 2.5 API Audio?
Ja. Sie erzeugt standardmäßig synchronisierten Sound zum Video, und du kannst zusätzlich eine Audiospur hochladen, um Bewegung und Timing des Clips zu steuern.
Welche Inputs unterstützt Wan 2.5?
Du kannst aus einem Text-Prompt generieren, eine Bild-URL animieren und optional eine Audiodatei bereitstellen. Das macht sie flexibel für Idea-first-, Asset-first- und Sound-first-Workflows.
Welche Auflösungen und Längen sind verfügbar?
Wan 2.5 gibt 480P, 720P und 1080P in jedem Seitenverhältnis aus, mit Clip-Längen von 5 oder 10 Sekunden pro Anfrage.
Wie funktioniert audio-gesteuerte Generierung?
Gib eine Audio-URL an, und Wan 2.5 baut Bewegung und Tempo des Videos um diese Spur auf und richtet die Bewegung am Sound aus, statt eigenes Audio zu erzeugen.
Warum Wan 2.5 über Pollo API ausführen?
Pollo API bietet eine Integration für Wan 2.5 und 300+ weitere Modelle – mit Dokumentation, Aufgaben-Tracking, Webhooks und geringeren Generierungskosten als vergleichbare Anbieter.