curl-X POST 'https://pollo.ai/api/platform/v1/generation/alibaba/wan-v2-5/video'\-H'Content-Type: application/json'\-H'x-api-key: YOUR_API_KEY'\-d'{ "input": { "prompt": "A cinematic shot of a golden retriever running through a field of sunflowers at sunset, warm rim light, shallow depth of field", "negativePrompt": "blurry, low quality, distorted, watermark, text", "duration": 5, "resolution": "480p", "aspectRatio": "1:1", "generateAudio": true }}'
È possibile includere facoltativamente l'URL del webhook per ricevere una notifica in caso di successo o fallimento dell'attività.
Campo di richiesta facoltativo
{"input":{"prompt":"A cinematic shot of a golden retriever running through a field of sunflowers at sunset, warm rim light, shallow depth of field","negativePrompt":"blurry, low quality, distorted, watermark, text","duration":5,"resolution":"480p","aspectRatio":"1:1","generateAudio":true},"webhookUrl":"https://example.com/webhooks/pollo"}
Schema
Campi di input per l'endpoint e la modalità selezionati.
Campo
Tipo
Necessario
Descrizione
audio
string
NO
Reference audio URL (HTTP(S)).
prompt
string
Sì
Text prompt describing the content to generate.
negativePrompt
string
NO
Text describing elements to avoid in the generated output.
duration
number
NO
The duration of the generated video, in seconds.
resolution
string
NO
Output resolution of the generated media (e.g. 720p, 1080p, 2K, 4K). Values are case-insensitive.
aspectRatio
string
NO
Output aspect ratio, as width:height (e.g. 16:9).
seed
integer
NO
Random seed for reproducible generation.
generateAudio
boolean
NO
Generate natural-sounding, fitting audio for the output video.
Wan 2.5 potrafi generować wideo z dopasowanym dźwiękiem albo używać przesłanego audio jako wskazówki. Dzięki temu świetnie sprawdza się w klipach, w których dźwięk, ruch i timing muszą ze sobą współgrać.
Z Wan 2.5 w Pollo API deweloperzy dodają do swoich aplikacji generowanie text-to-video i image-to-video, z natywnym audio, negatywnymi promptami oraz wszystkimi proporcjami obrazu dostępnymi w 480P, 720P lub 1080P.
Kluczowe funkcje Wan 2.5 API
Natywne generowanie audio
Wan 2.5 domyślnie tworzy dźwięk zsynchronizowany z wideo, więc szum tła, efekty i audio sceny pojawiają się razem, zamiast wymagać osobnego etapu udźwiękowienia.
Wideo sterowane dźwiękiem
Podaj ścieżkę audio, a Wan 2.5 dopasuje do niej ruch i timing, synchronizując ruch postaci lub rytm sceny z dostarczonym dźwiękiem.
Ulepszona fizyka ruchu
Ruch jest zgodny z bardziej wiarygodną fizyką, więc kończyny, tkaniny i poruszające się obiekty przemieszczają się z odpowiednią masą i płynnością, zamiast ślizgać się lub drgać między klatkami.
Lepsze rozumienie promptów
Model dokładniej odczytuje opisane obiekty, działania i ustawienie sceny, więc to, co napiszesz, trafia do ujęcia, a liczba ponownych prób na pomysł się zmniejsza.
Elastyczne kadrowanie
Wszystkie proporcje obrazu działają w każdej rozdzielczości, więc wyniki w formacie kwadratowym, pionowym i panoramicznym pochodzą z jednego modelu bez późniejszego przycinania ani przekadrowywania.
Kontrola negatywnymi promptami
Wskaż, co ma zostać pominięte, a Wan 2.5 będzie tego unikać, dając czystsze rezultaty, gdy scena ciągle dodaje niechciane obiekty, kolory lub artefakty.
Przypadki użycia Wan 2.5 API
Explainer’y zsynchronizowane z dźwiękiem: Generuj krótkie klipy instruktażowe, w których narracja lub efekty pasują do akcji na ekranie, dzięki czemu narzędzia produktowe mogą dostarczać wideo z audio w jednym wywołaniu.
Klipy postaci prowadzone przez audio: Prześlij ścieżkę głosową lub muzyczną i pozwól, by Wan 2.5 sterował ruchem oraz tempem postaci w ujęciach mówionych lub performatywnych.
Pętle scen ambientowych: Twórz klipy przyrodnicze lub środowiskowe, w których generowany dźwięk, np. rwąca woda czy trzaskający ogień, dopełnia atmosferę bez dodatkowej edycji.
Od obrazu do ruchu: Podaj nieruchomy obraz i ożyw go w krótkie ruchome ujęcie, które zachowuje oryginalną kompozycję, a jednocześnie dodaje ruch i dźwięk.
Pionowe treści społecznościowe: Twórz klipy 9:16 w pełnej rozdzielczości dla krótkich formatów, używając natywnego audio, by pominąć ręczny etap dodawania dźwięku w pipeline.
Warianty reklam w wielu proporcjach: Generuj tę samą koncepcję w formacie kwadratowym, pionowym i panoramicznym z jednego modelu, aby od razu pokryć różne umiejscowienia.
Montaże dopasowane do rytmu: Dostarcz beat lub podkład muzyczny i pozwól modelowi dopasować cięcia oraz ruch do rytmu, tworząc narzędzia kreatorskie reagujące na muzykę.
Prototypowanie wierne promptowi: Szybko podglądaj opisaną scenę, ufając lepszemu trzymaniu się promptu, zanim przejdziesz do dłuższej produkcji.
Jak używać Wan 2.5 API
Pobierz klucz API: Utwórz konto Pollo API i wygeneruj klucz API w panelu deweloperskim.
Wybierz model: Wyślij żądanie do endpointu Wan 2.5 pod adresem /generation/wanx/wan-v2-5-preview.
Dodaj dane wejściowe: Podaj prompt dla text-to-video lub URL image dla image-to-video, a następnie ustaw resolution (480P, 720P, 1080P) i length (5 lub 10). Przekaż audioUrl dla generowania sterowanego audio albo pozostaw wanAudio włączone dla generowanego dźwięku.
Generuj i pobierz: Wyślij zadanie, odpytyj zwrócony status zadania i pobierz gotowe wideo, gdy przetwarzanie zakończy się sukcesem.
Najlepsze praktyki promptowania dla Wan 2.5 API
Pisz z myślą o obrazie i dźwięku. Nazwij obiekt i działanie, a potem opisz oczekiwane audio, kadrowanie i nastrój, żeby model mógł zsynchronizować ruch ze ścieżką.
Prosta formuła promptu
Obiekt + konkretne działanie + wskazówka audio lub dźwiękowa + kamera i kadrowanie + otoczenie i nastrój
Na co zwrócić uwagę
Opisz dźwięk: Nazwij audio, którego chcesz, np. kroki, fale albo wypowiadana linia dialogowa, aby natywne audio miało jasny cel.
Dopasuj ruch do audio: Gdy dostarczasz ścieżkę, opisz, jak ruch ma za nią podążać, np. kroki trafiające w beat.
Wcześnie wybierz proporcje: Wybierz format kwadratowy, pionowy albo panoramiczny od razu, żeby kompozycja była przygotowana pod docelowe umiejscowienie.
Używaj negatywnych promptów: Wypisz, co wykluczyć, gdy scena ciągle dodaje bałagan, ostre światło albo niechciane elementy.
Trzymaj się jednej wyraźnej akcji: Skup każdy 5- lub 10-sekundowy klip na jednym ruchu, żeby obraz i dźwięk pozostały spójne.
Ustaw seed, by powtarzać: Użyj ponownie seed, gdy chcesz iterować wynik bez utraty kadru, który Ci się podobał.
Przykładowe prompty
Scena z dźwiękiem ambientowym
"Na żeliwnej patelni skwierczy olej, gdy wpadają na nią pokrojone cebule, unosi się para, a drewniana łyżka powoli miesza. Wygeneruj pasujące dźwięki skwierczenia i mieszania. Zbliżenie z góry, ciepłe światło kuchenne, realistyczny styl, niespieszny ruch."
Występ sterowany dźwiękiem
"Uliczny akordeonista kołysze się i porusza miechem w rytm dostarczonej ścieżki muzycznej, stopą wystukując takt na chodniku. Ujęcie średnie o zmierzchu, miękka poświata latarni, ruch ściśle zsynchronizowany z rytmem audio."
Atmosfera natury
"Wąski leśny wodospad wpada do czystego basenu, mgiełka dryfuje, paprocie drżą od rozprysku. Wygeneruj odgłos płynącej wody i śpiew ptaków. Powolny najazd, poranne światło przesiane przez liście, pionowe kadrowanie 9:16, spokojny realistyczny ton."
Animacja oparta na obrazie
"Ożyw dostarczone zdjęcie nocnego targu oświetlonego lampionami: para unosi się znad stoisk z jedzeniem, girlandy świateł kołyszą się, sprzedawca macha ręką. Dodaj delikatny szmer tłumu i ambientowe audio. Zachowaj oryginalną kompozycję, powolny boczny dryf kamery."
Wan 2.5 vs Veo 3.1 vs Kling 2.6
Możliwość
Wan 2.5
Veo 3.1
Kling 2.6
Natywne generowanie audio
✅ Dźwięk generowany domyślnie
✅ Natywne audio
❌ Tylko wideo
Sterowanie audio z przesłanej ścieżki
✅
❌
❌
Wejście tekstowe i obrazowe
✅
✅
✅
Proporcje obrazu
Wszystkie proporcje w każdej rozdzielczości
Stały zestaw
Stały zestaw
Opcje rozdzielczości
480P, 720P, 1080P
Do 1080P
Do 1080P
Długość klipu
5 lub 10 sekund
Krótkie klipy reżyserowane
Krótkie klipy reżyserowane
Zalecane do
Wideo zsynchronizowanego z dźwiękiem i prowadzonego audio
Scen z dużą ilością dialogów
Kontroli ruchu postaci
Dlaczego warto wybrać Wan 2.5 API?
Wan 2.5 pasuje do produktów, które potrzebują obrazu i dźwięku razem — niezależnie od tego, czy dźwięk jest generowany automatycznie, czy ruch jest dopasowywany do przesłanej ścieżki — z ulepszoną fizyką i lepszym trzymaniem się promptu.
Dzięki Pollo API uzyskujesz dostęp do Wan 2.5 za pomocą jednego klucza API obok ponad 300 wiodących modeli wideo i obrazów, z przejrzystą dokumentacją, odpytywaniem statusu zadań i webhookami.
Zacznij od endpointu Wan 2.5 w Pollo API, aby wdrożyć funkcje wideo z natywnym audio, a następnie porównaj go z Veo, Kling i Sora bez ruszania integracji.
FAQ dotyczące Wan 2.5 API
Czym jest Wan 2.5?
Wan 2.5 to model generowania wideo od wanx, który obsługuje text-to-video i image-to-video z natywnym audio, ruchem sterowanym dźwiękiem, ulepszoną fizyką i lepszym rozumieniem promptów.
Czy Wan 2.5 API generuje audio?
Tak. Domyślnie tworzy dźwięk zsynchronizowany z wideo, a dodatkowo możesz przesłać ścieżkę audio, aby sterować ruchem i timingiem klipu.
Jakie dane wejściowe obsługuje Wan 2.5?
Możesz generować z tekstowego promptu, animować URL obrazu i opcjonalnie dostarczyć plik audio, co daje elastyczność dla workflowów opartych na pomyśle, zasobach i dźwięku.
Jakie rozdzielczości i długości są dostępne?
Wan 2.5 generuje 480P, 720P i 1080P w dowolnych proporcjach obrazu, z długościami klipów 5 lub 10 sekund wybieranymi dla każdego żądania.
Jak działa generowanie sterowane dźwiękiem?
Podaj URL audio, a Wan 2.5 zbuduje ruch i tempo wideo wokół tej ścieżki, dopasowując ruch do dźwięku zamiast generować własne audio.
Dlaczego uruchamiać Wan 2.5 przez Pollo API?
Pollo API daje jedną integrację dla Wan 2.5 i ponad 300 innych modeli, z dokumentacją, śledzeniem zadań, webhookami i niższym kosztem generowania niż porównywalni dostawcy.