curl-X POST 'https://pollo.ai/api/platform/v1/generation/alibaba/wan-v2-5/video'\-H'Content-Type: application/json'\-H'x-api-key: YOUR_API_KEY'\-d'{ "input": { "prompt": "A cinematic shot of a golden retriever running through a field of sunflowers at sunset, warm rim light, shallow depth of field", "negativePrompt": "blurry, low quality, distorted, watermark, text", "duration": 5, "resolution": "480p", "aspectRatio": "1:1", "generateAudio": true }}'
Opcionalmente, inclua o webhookUrl para receber uma notificação quando a tarefa for concluída com sucesso ou falhar.
Campo de solicitação opcional
{"input":{"prompt":"A cinematic shot of a golden retriever running through a field of sunflowers at sunset, warm rim light, shallow depth of field","negativePrompt":"blurry, low quality, distorted, watermark, text","duration":5,"resolution":"480p","aspectRatio":"1:1","generateAudio":true},"webhookUrl":"https://example.com/webhooks/pollo"}
Esquema
Campos de entrada para o ponto de extremidade e o modo selecionados.
Campo
Tipo
Obrigatório
Descrição
audio
string
Não
Reference audio URL (HTTP(S)).
prompt
string
Sim
Text prompt describing the content to generate.
negativePrompt
string
Não
Text describing elements to avoid in the generated output.
duration
number
Não
The duration of the generated video, in seconds.
resolution
string
Não
Output resolution of the generated media (e.g. 720p, 1080p, 2K, 4K). Values are case-insensitive.
aspectRatio
string
Não
Output aspect ratio, as width:height (e.g. 16:9).
seed
integer
Não
Random seed for reproducible generation.
generateAudio
boolean
Não
Generate natural-sounding, fitting audio for the output video.
O Wan 2.5 pode gerar vídeo com áudio correspondente ou usar um áudio enviado como guia. Isso torna o modelo útil para clipes em que som, movimento e timing precisam funcionar juntos.
Com o Wan 2.5 na Pollo API, desenvolvedores adicionam geração de text-to-video e image-to-video aos seus apps, com áudio nativo, prompts negativos e todas as proporções disponíveis em 480P, 720P ou 1080P.
Principais recursos da Wan 2.5 API
Geração de áudio nativo
O Wan 2.5 produz som sincronizado com o vídeo por padrão, então ruído ambiente, efeitos e áudio da cena chegam juntos, em vez de exigir uma etapa separada de sonorização.
Vídeo guiado por áudio
Forneça uma faixa de áudio e o Wan 2.5 molda o movimento e o timing com base nela, alinhando o movimento de um personagem ou o ritmo de uma cena ao som que você enviar.
Física de movimento aprimorada
O movimento segue uma física mais crível, então membros, tecidos e objetos em movimento se deslocam com peso e continuidade, em vez de deslizarem ou tremerem entre quadros.
Maior compreensão de prompt
O modelo interpreta com mais precisão os sujeitos, ações e encenação descritos, então o que você escreve aparece no plano e reduz a quantidade de rerolls por ideia.
Enquadramento flexível
Todas as proporções funcionam em todas as resoluções, então saídas quadradas, verticais e widescreen vêm de um único modelo sem precisar cortar ou reenquadrar depois.
Controle com prompt negativo
Diga o que deve ficar de fora, e o Wan 2.5 evita isso, entregando resultados mais limpos quando uma cena insiste em incluir objetos, cores ou artefatos indesejados.
Casos de uso da Wan 2.5 API
Explicativos sincronizados com som: Gere clipes curtos de tutorial em que narração ou efeitos acompanham a ação na tela, permitindo que ferramentas de produto publiquem vídeo com áudio em uma única chamada.
Clipes de personagem guiados por áudio: Envie uma faixa de voz ou música e deixe o Wan 2.5 conduzir o movimento e o ritmo de um personagem para tomadas de fala ou performance.
Loops de cenas ambientes: Produza clipes de natureza ou ambiente em que o som gerado, como água corrente ou fogo crepitando, completa a atmosfera sem edição extra.
De imagem para movimento: Envie uma imagem estática e anime para uma tomada curta em movimento que mantém a composição original enquanto adiciona movimento e som.
Conteúdo vertical para redes sociais: Crie clipes 9:16 em resolução total para feeds de formato curto, usando áudio nativo para pular uma etapa manual de som no pipeline.
Variações de anúncio em múltiplas proporções: Gere o mesmo conceito em quadrado, vertical e widescreen a partir de um único modelo para cobrir diferentes posicionamentos de uma vez.
Montagens sincronizadas ao ritmo: Forneça uma batida ou base musical e deixe o modelo sincronizar cortes e movimento para ferramentas de criação reativas à música.
Prototipagem fiel ao prompt: Visualize rapidamente uma cena descrita, confiando em maior aderência ao prompt para refletir o briefing antes de partir para uma produção mais longa.
Como usar a Wan 2.5 API
Obtenha uma chave de API: Crie uma conta na Pollo API e gere sua chave de API no painel do desenvolvedor.
Escolha o modelo: Envie sua solicitação para o endpoint do Wan 2.5 em /generation/wanx/wan-v2-5-preview.
Adicione suas entradas: Forneça um prompt para text-to-video ou uma URL de image para image-to-video, depois defina resolution (480P, 720P, 1080P) e length (5 ou 10). Passe audioUrl para geração guiada por áudio ou mantenha wanAudio ativado para som gerado.
Gere e recupere: Envie a tarefa, faça polling do status retornado e baixe o vídeo final quando o processamento for concluído com sucesso.
Boas práticas de prompting para a Wan 2.5 API
Escreva pensando tanto em imagem quanto em som. Nomeie o sujeito e a ação, depois descreva o áudio esperado, o enquadramento e o clima, para que o modelo consiga alinhar o movimento com a faixa.
Uma fórmula simples de prompt
Sujeito + ação específica + indicação de áudio ou som + câmera e enquadramento + cenário e clima
O que você deve observar
Descreva o som: Nomeie o áudio que você quer, como passos, ondas ou uma fala, para que o áudio nativo tenha um alvo claro.
Combine movimento com áudio: Ao fornecer uma faixa, descreva como o movimento deve segui-la, como passos acompanhando a batida.
Escolha a proporção cedo: Selecione quadrado, vertical ou widescreen desde o início para que a composição já fique enquadrada para o posicionamento final.
Use prompts negativos: Liste o que excluir quando a cena continuar adicionando excesso de elementos, luz dura ou itens indesejados.
Mantenha uma ação clara: Foque cada clipe de 5 ou 10 segundos em um único movimento para manter imagem e som coerentes.
Defina uma seed para repetir: Reutilize uma seed quando quiser iterar um resultado sem perder o enquadramento que você gostou.
Exemplos de prompts
Cena com som ambiente
"Uma frigideira de ferro fundido chia quando fatias de cebola tocam óleo quente, vapor subindo, uma colher de madeira mexendo lentamente. Gere sons correspondentes de chiado e mexida. Close superior, luz quente de cozinha, estilo realista, movimento sem pressa."
Performance guiada por áudio
"Um sanfoneiro de rua balança o corpo e movimenta o fole no tempo da faixa musical fornecida, batendo o pé na calçada. Plano médio ao entardecer, brilho suave de poste de rua, movimento sincronizado de perto ao ritmo do áudio."
Atmosfera de natureza
"Uma cachoeira estreita na floresta cai em uma piscina cristalina, névoa flutuando, samambaias tremendo com os respingos. Gere som de água corrente e canto de pássaros. Lento push-in, luz da manhã filtrada, enquadramento vertical 9:16, tom realista e calmo."
Animação guiada por imagem
"Anime a foto fornecida de um mercado noturno iluminado por lanternas: vapor subindo das barracas de comida, cordões de luz balançando, um vendedor acenando. Adicione murmúrio suave de multidão e áudio ambiente. Mantenha a composição original, deriva lateral lenta de câmera."
Wan 2.5 vs Veo 3.1 vs Kling 2.6
Capacidade
Wan 2.5
Veo 3.1
Kling 2.6
Geração de áudio nativo
✅ Som gerado por padrão
✅ Áudio nativo
❌ Apenas vídeo
Guiado por áudio de faixa enviada
✅
❌
❌
Entradas de texto e imagem
✅
✅
✅
Proporções de tela
Todas as proporções em qualquer resolução
Conjunto fixo
Conjunto fixo
Opções de resolução
480P, 720P, 1080P
Até 1080P
Até 1080P
Duração do clipe
5 ou 10 segundos
Clipes curtos dirigidos
Clipes curtos dirigidos
Recomendado para
Vídeo sincronizado com som e guiado por áudio
Cenas com muito diálogo
Controle de movimento de personagem
Por que escolher a Wan 2.5 API?
O Wan 2.5 se encaixa em produtos que precisam de imagem e som juntos, seja gerando áudio automaticamente ou moldando o movimento a uma faixa que você envia, com física aprimorada e maior aderência ao prompt.
Com a Pollo API, você acessa o Wan 2.5 com uma única chave de API ao lado de mais de 300 modelos líderes de vídeo e imagem, com documentação clara, polling de status de tarefa e webhooks.
Comece com o endpoint do Wan 2.5 na Pollo API para lançar recursos de vídeo com áudio nativo e depois compare com Veo, Kling e Sora sem mexer na sua integração.
FAQs da Wan 2.5 API
O que é Wan 2.5?
Wan 2.5 é um modelo de geração de vídeo da wanx que suporta text-to-video e image-to-video com áudio nativo, movimento guiado por áudio, física aprimorada e maior compreensão de prompt.
A Wan 2.5 API gera áudio?
Sim. Ela produz som sincronizado com o vídeo por padrão, e você também pode enviar uma faixa de áudio para guiar o movimento e o timing do clipe.
Quais entradas a Wan 2.5 suporta?
Você pode gerar a partir de um prompt de texto, animar uma URL de imagem e opcionalmente fornecer um arquivo de áudio, o que traz flexibilidade para fluxos que começam pela ideia, por um ativo visual ou por uma faixa de áudio.
Quais resoluções e durações estão disponíveis?
O Wan 2.5 gera 480P, 720P e 1080P em qualquer proporção, com duração de clipe de 5 ou 10 segundos selecionada por solicitação.
Como funciona a geração guiada por áudio?
Forneça uma URL de áudio e o Wan 2.5 constrói o movimento e o pacing do vídeo em torno dessa faixa, alinhando o movimento ao som em vez de gerar o próprio áudio.
Por que executar o Wan 2.5 pela Pollo API?
A Pollo API oferece uma integração única para Wan 2.5 e mais de 300 outros modelos, com documentação, rastreamento de tarefas, webhooks e geração de menor custo do que provedores comparáveis.