curl-X POST 'https://pollo.ai/api/platform/v1/generation/alibaba/wan-v2-5/video'\-H'Content-Type: application/json'\-H'x-api-key: YOUR_API_KEY'\-d'{ "input": { "prompt": "A cinematic shot of a golden retriever running through a field of sunflowers at sunset, warm rim light, shallow depth of field", "negativePrompt": "blurry, low quality, distorted, watermark, text", "duration": 5, "resolution": "480p", "aspectRatio": "1:1", "generateAudio": true }}'
È possibile includere facoltativamente l'URL del webhook per ricevere una notifica in caso di successo o fallimento dell'attività.
Campo di richiesta facoltativo
{"input":{"prompt":"A cinematic shot of a golden retriever running through a field of sunflowers at sunset, warm rim light, shallow depth of field","negativePrompt":"blurry, low quality, distorted, watermark, text","duration":5,"resolution":"480p","aspectRatio":"1:1","generateAudio":true},"webhookUrl":"https://example.com/webhooks/pollo"}
Schema
Campi di input per l'endpoint e la modalità selezionati.
Campo
Tipo
Necessario
Descrizione
audio
string
NO
Reference audio URL (HTTP(S)).
prompt
string
Sì
Text prompt describing the content to generate.
negativePrompt
string
NO
Text describing elements to avoid in the generated output.
duration
number
NO
The duration of the generated video, in seconds.
resolution
string
NO
Output resolution of the generated media (e.g. 720p, 1080p, 2K, 4K). Values are case-insensitive.
aspectRatio
string
NO
Output aspect ratio, as width:height (e.g. 16:9).
seed
integer
NO
Random seed for reproducible generation.
generateAudio
boolean
NO
Generate natural-sounding, fitting audio for the output video.
Wan 2.5 può generare video con audio corrispondente oppure usare un audio caricato come guida. Questo lo rende utile per clip in cui suono, movimento e timing devono funzionare insieme.
Con Wan 2.5 su Pollo API, gli sviluppatori possono aggiungere la generazione text-to-video e image-to-video alle loro app, con audio nativo, prompt negativi e tutti i rapporti d’aspetto disponibili in 480P, 720P o 1080P.
Funzionalità principali della Wan 2.5 API
Generazione audio nativa
Wan 2.5 produce per impostazione predefinita un suono sincronizzato con il video, così rumore ambientale, effetti e audio di scena arrivano insieme invece di richiedere un passaggio separato di sonorizzazione.
Video guidato dall’audio
Fornisci una traccia audio e Wan 2.5 modella movimento e timing su di essa, allineando il movimento di un personaggio o il ritmo di una scena al suono che fornisci.
Fisica del movimento migliorata
Il movimento segue una fisica più credibile, quindi arti, tessuti e oggetti in movimento si spostano con peso e continuità invece di scivolare o tremolare tra i fotogrammi.
Maggiore comprensione del prompt
Il modello interpreta con più precisione soggetti, azioni e messa in scena descritti, così ciò che scrivi finisce nell’inquadratura e riduce il numero di rigenerazioni per ogni idea.
Inquadratura flessibile
Tutti i rapporti d’aspetto funzionano a ogni risoluzione, quindi output quadrati, verticali e widescreen provengono da un unico modello senza ritagli o reinquadrature successive.
Controllo con prompt negativi
Indica cosa escludere e Wan 2.5 lo evita, offrendo risultati più puliti quando una scena continua a introdurre oggetti, colori o artefatti indesiderati.
Casi d’uso della Wan 2.5 API
Spiegazioni sincronizzate al suono: Genera brevi clip tutorial in cui narrazione o effetti corrispondono all’azione sullo schermo, permettendo ai tool di prodotto di pubblicare video con audio in una sola chiamata.
Clip di personaggi guidate dall’audio: Carica una traccia vocale o musicale e lascia che Wan 2.5 guidi movimento e ritmo di un personaggio per inquadrature parlanti o performative.
Loop di scene ambientali: Produci clip naturalistiche o ambientali in cui il suono generato, come acqua impetuosa o crepitio del fuoco, completa l’atmosfera senza editing aggiuntivo.
Da immagine a movimento: Fornisci un’immagine statica e animala in una breve inquadratura in movimento che mantiene la composizione originale aggiungendo movimento e suono.
Contenuti social verticali: Crea clip 9:16 a piena risoluzione per feed short-form, usando audio nativo per saltare una fase manuale del suono nella pipeline.
Varianti pubblicitarie multi-ratio: Genera lo stesso concept in quadrato, verticale e widescreen da un unico modello per coprire diversi posizionamenti contemporaneamente.
Montaggi sincronizzati al ritmo: Fornisci un beat o una base musicale e lascia che il modello sincronizzi tagli e movimento per strumenti creator reattivi alla musica.
Prototipazione fedele al prompt: Visualizza rapidamente una scena descritta, affidandoti a un’aderenza più stretta al prompt per riflettere il brief prima di passare a una produzione più lunga.
Come usare la Wan 2.5 API
Ottieni una API Key: Crea un account Pollo API e genera la tua API key dalla dashboard sviluppatori.
Scegli il modello: Invia la tua richiesta all’endpoint Wan 2.5 su /generation/wanx/wan-v2-5-preview.
Aggiungi i tuoi input: Fornisci un prompt per text-to-video o un URL image per image-to-video, poi imposta resolution (480P, 720P, 1080P) e length (5 o 10). Passa audioUrl per la generazione guidata dall’audio oppure lascia wanAudio attivo per l’audio generato.
Genera e recupera: Invia il task, controlla periodicamente lo stato del task restituito e scarica il video finale una volta completata l’elaborazione.
Best practice di prompting per la Wan 2.5 API
Scrivi sia per l’immagine sia per il suono. Indica soggetto e azione, poi descrivi l’audio atteso, l’inquadratura e il mood, così il modello può allineare il movimento alla traccia.
Una formula di prompt semplice
Soggetto + azione specifica + indicazione audio o sonora + camera e inquadratura + ambientazione e mood
Cosa dovresti notare
Descrivi il suono: Specifica l’audio che vuoi, come passi, onde o una battuta parlata, così l’audio nativo ha un obiettivo chiaro.
Abbina il movimento all’audio: Quando fornisci una traccia, descrivi come il movimento deve seguirla, ad esempio passi che cadono a tempo.
Scegli subito il ratio: Seleziona all’inizio quadrato, verticale o widescreen, così la composizione è già impostata per il posizionamento finale.
Usa prompt negativi: Elenca cosa escludere quando una scena continua ad aggiungere elementi di disturbo, luce dura o componenti indesiderate.
Mantieni un’unica azione chiara: Focalizza ogni clip da 5 o 10 secondi su un solo movimento, così immagine e suono restano coerenti.
Imposta un seed per ripetere: Riutilizza un seed quando vuoi iterare su un risultato senza perdere l’inquadratura che ti piaceva.
Esempi di prompt
Scena con suono ambientale
"Una padella in ghisa sfrigola mentre fette di cipolla toccano olio caldo, vapore in salita, un cucchiaio di legno che mescola lentamente. Genera suoni di sfrigolio e mescolata corrispondenti. Primo piano dall’alto, luce calda da cucina, stile realistico, movimento rilassato."
Performance guidata dall’audio
"Un suonatore di fisarmonica in strada ondeggia e comprime il mantice a tempo con la traccia musicale fornita, piede che batte sul marciapiede. Inquadratura media al crepuscolo, morbido bagliore dei lampioni, movimento sincronizzato da vicino al ritmo audio."
Atmosfera naturale
"Una stretta cascata nel bosco cade in una pozza limpida, foschia in deriva, felci che tremano per gli spruzzi. Genera acqua che scorre e canto degli uccelli. Lento avvicinamento, luce mattutina filtrata, inquadratura verticale 9:16, tono realistico e calmo."
Animazione guidata da immagine
"Anima la foto fornita di un mercato notturno illuminato da lanterne: vapore che sale dai chioschi di cibo, fili di luci che oscillano, un venditore che saluta con la mano. Aggiungi un lieve brusio della folla e audio ambientale. Mantieni la composizione originale, lento movimento laterale della camera."
Wan 2.5 vs Veo 3.1 vs Kling 2.6
Capacità
Wan 2.5
Veo 3.1
Kling 2.6
Generazione audio nativa
✅ Suono generato per impostazione predefinita
✅ Audio nativo
❌ Solo video
Guida audio da traccia caricata
✅
❌
❌
Input testo e immagine
✅
✅
✅
Rapporti d’aspetto
Tutti i ratio a ogni risoluzione
Set fisso
Set fisso
Opzioni di risoluzione
480P, 720P, 1080P
Fino a 1080P
Fino a 1080P
Durata clip
5 o 10 secondi
Clip brevi dirette
Clip brevi dirette
Consigliato per
Video sincronizzati al suono e guidati dall’audio
Scene ricche di dialoghi
Controllo del movimento dei personaggi
Perché scegliere la Wan 2.5 API?
Wan 2.5 è adatta a prodotti che richiedono immagine e suono insieme, sia generando audio automaticamente sia modellando il movimento su una traccia che carichi, con fisica migliorata e maggiore aderenza al prompt.
Con Pollo API, accedi a Wan 2.5 con una sola API key insieme a oltre 300 modelli video e immagine leader, con documentazione chiara, polling dello stato dei task e webhook.
Inizia con l’endpoint Wan 2.5 su Pollo API per distribuire funzionalità video con audio nativo, poi confrontala con Veo, Kling e Sora senza toccare la tua integrazione.
FAQ sulla Wan 2.5 API
Che cos’è Wan 2.5?
Wan 2.5 è un modello di generazione video di wanx che supporta text-to-video e image-to-video con audio nativo, movimento guidato dall’audio, fisica migliorata e maggiore comprensione del prompt.
La Wan 2.5 API genera audio?
Sì. Produce per impostazione predefinita suono sincronizzato con il video e puoi anche caricare una traccia audio per guidare movimento e timing della clip.
Quali input supporta Wan 2.5?
Puoi generare da un prompt testuale, animare un URL immagine e facoltativamente fornire un file audio, rendendolo flessibile per workflow idea-first, asset-first e sound-first.
Quali risoluzioni e durate sono disponibili?
Wan 2.5 produce output 480P, 720P e 1080P in qualsiasi rapporto d’aspetto, con clip da 5 o 10 secondi selezionabili per richiesta.
Come funziona la generazione guidata dall’audio?
Fornisci un URL audio e Wan 2.5 costruisce movimento e ritmo del video intorno a quella traccia, allineando il movimento al suono invece di generare audio proprio.
Perché usare Wan 2.5 tramite Pollo API?
Pollo API offre un’unica integrazione per Wan 2.5 e oltre 300 altri modelli, con documentazione, tracciamento task, webhook e generazione a costo inferiore rispetto a provider comparabili.