O Kling 3.0 Omni gera visuais coerentes em múltiplas cenas com qualidade cinematográfica, estabilidade de personagens e sequências de imagens profissionais.
curl-X POST 'https://pollo.ai/api/platform/v1/generation/kling-ai/kling-v3-omni/video'\-H'Content-Type: application/json'\-H'x-api-key: YOUR_API_KEY'\-d'{ "input": { "prompt": "A cinematic shot of a golden retriever running through a field of sunflowers at sunset, warm rim light, shallow depth of field", "aspectRatio": "16:9", "duration": 5, "mode": "pro", "generateAudio": true }}'
{"input":{"prompt":"A cinematic shot of a golden retriever running through a field of sunflowers at sunset, warm rim light, shallow depth of field","aspectRatio":"16:9","duration":5,"mode":"pro","generateAudio":true},"webhookUrl":"https://example.com/webhooks/pollo"}
スキーマ
選択したエンドポイントとモードの入力フィールド。
分野
タイプ
必須
説明
prompt
string
あり
Text prompt describing the content to generate.
aspectRatio
string
なし
Output aspect ratio, as width:height (e.g. 16:9).
duration
integer
なし
The duration of the generated video, in seconds.
mode
string
なし
Generation mode of the model (e.g. a faster or higher-quality tier).
generateAudio
boolean
なし
Generate natural-sounding, fitting audio for the output video.
O Kling 3.0 Omni gera vídeo a partir de vários tipos de entrada, incluindo texto, imagens, conjuntos de sujeito, vídeo de origem e áudio, em uma única solicitação de até 4K.
Com o Kling 3.0 Omni na Pollo API, desenvolvedores podem conduzir a geração de vídeo guiada por referências a partir de uma combinação de tipos de orientação, escolhendo duração do clipe, proporção e áudio correspondente opcional por solicitação.
Principais recursos da API do Kling 3.0 Omni
Entrada de referência multimodal
O modelo aceita até sete referências de uma vez, combinando uma imagem, um vídeo de origem, um conjunto de sujeito e uma pista de áudio para orientar uma única geração.
Consistência de sujeito
Forneça várias imagens de um personagem ou objeto. O modelo mantém a identidade do sujeito ao longo do take conforme a cena se move.
Movimento guiado por áudio
Forneça uma referência de áudio e o modelo ajusta o movimento e o ritmo do som, alinhando a ação com batidas, fala ou pistas de ambiente no clipe.
Simulação de ambiente
A simulação espacial renderiza cenas em take único com luz, profundidade e reação ambiental coerentes à medida que câmera e sujeitos se movem pelo espaço.
Saída volumétrica em 4K
As gerações chegam a até 4K, preservando textura fina e pistas de profundidade em alta resolução para casos de uso de transmissão e telas grandes.
Duração e enquadramento flexíveis
Os clipes vão de 3 a 15 segundos em paisagem, retrato ou quadrado, permitindo que uma integração atenda social, produto e entrega em quadro completo a partir do mesmo modelo.
Casos de uso da API do Kling 3.0 Omni
Conteúdo com personagem recorrente: Reutilize um conjunto de sujeito para manter um mascote, apresentador ou avatar consistente em clipes episódicos sem redesenhar a identidade toda vez.
Clipes de performance sincronizados com áudio: Direcione um dançarino, músico ou palestrante para que o movimento trave na faixa enviada, útil para ferramentas de música e sincronização labial.
Restilização referenciada por vídeo: Envie um clipe existente como referência e regenere com nova direção mantendo intactos o movimento e a mise-en-scène originais.
Pipelines de continuação de cena: Combine referências de imagem e vídeo para estender um take para frente, mantendo continuidade de ambiente e sujeito em uma sequência mais longa.
Storyboard com múltiplas referências: Misture várias imagens e um sujeito em um prompt para pré-visualizar cenas complexas antes de se comprometer com uma passagem completa de produção.
Assets de transmissão em alta resolução: Gere cenas em take único 4K para sinalização, intros de streaming ou displays grandes onde resolução e profundidade importam.
Variações de anúncios localizadas: Reutilize um sujeito e troque referências de áudio para produzir versões específicas por região com ritmo correspondente e branding consistente.
Demos de ambiente imersivo: Mostre um espaço se preenchendo com neblina, água ou movimento de multidão, com arredores reagindo de forma crível para prévias de imóveis ou eventos.
Como usar a API do Kling 3.0 Omni
Obtenha uma chave de API: Crie uma conta na Pollo API e gere sua chave de API no painel de desenvolvedor.
Escolha o modelo: Envie solicitações para o endpoint do Kling 3.0 Omni em /generation/kling-ai/kling-v3-omni/ref2video.
Adicione suas entradas: Forneça um prompt e de uma a sete refs (imagem, sujeito, vídeo ou áudio), depois defina duration (3-15), aspectRatio e resolution (720P, 1080P ou 4K).
Gere e recupere: Envie a tarefa, consulte o status da tarefa retornada e baixe o vídeo finalizado, opcionalmente com generateAudio produzindo uma trilha sonora correspondente.
Boas práticas de prompting para a API do Kling 3.0 Omni
Pense no prompt como direção das referências, e não como descrição do zero. Nomeie o papel de cada referência, a ação desejada e como a cena deve se comportar ao redor do seu sujeito.
Uma fórmula simples de prompt
Sujeito e seu papel de referência + ação específica + comportamento da cena e do ambiente + movimento de câmera + pista de áudio ou pacing
O que você deve observar
Atribua papéis às referências: Diga ao modelo qual referência é o sujeito, qual é o cenário e qual conduz o áudio, para que as orientações não compitam.
Mantenha os sujeitos claros: Forneça imagens limpas e variadas de um personagem para manter a identidade estável no take gerado.
Descreva a resposta do ambiente: Indique como luz, clima ou arredores devem mudar, já que o modelo simula espaço em vez de um fundo plano.
Combine áudio com ação: Ao usar referência de áudio, nomeie o movimento com o qual ele deve sincronizar para que o pacing siga o som.
Escolha a resolução pelo objetivo: Use 4K para transmissão e telas grandes, configurações menores para rascunhos e iterações mais rápidas.
Mantenha uma cena única: Limite cada geração a um único momento coerente para que o clipe permaneça contínuo do início ao fim.
Exemplos de prompts
Episódio com mascote consistente
"Use a referência de sujeito de uma raposa vermelha ilustrada com uniforme de escoteiro. A raposa caminha por uma biblioteca iluminada pelo sol, para para puxar um livro brilhante de uma prateleira alta e sorri. Dolly-in lento, luz quente com poeira no ar."
Dançarino de rua sincronizado com áudio
"Anime o sujeito dançarino com a faixa de bateria enviada. Passos marcados e golpes de braço caem em cada batida dentro de uma passagem subterrânea de concreto ao anoitecer, sombras azuis frias, câmera na mão circulando enquanto os pulsos de grave aumentam."
Revelação de simulação de ambiente
"Um pátio de pedra ao amanhecer se enche lentamente com neblina rasteira ondulante que se enrola em colunas antigas e capta a primeira luz. A câmera sobe de grua para revelar a cena completa, tons ambientes suaves, estilo realista e calmo."
Restilização referenciada por vídeo
"Pegue o clipe de referência de um ciclista em uma estrada costeira e regenere em um visual de pintura à mão. Mantenha a mesma rota e o movimento de pedalada, adicione grama ao vento e gaivotas passando, luz suave de fim de tarde."
Kling 3.0 Omni vs Veo 3.1 vs Sora 2
Capacidade
Kling 3.0 Omni
Veo 3.1
Sora 2
Entrada com múltiplas referências (imagem, vídeo, sujeito, áudio)
✅ Até sete referências mistas
✅ Orientação por imagem e prompt
✅ Orientação por prompt e referência
Consistência de sujeito a partir de conjuntos de imagens
✅ Conjuntos de sujeito com múltiplas imagens
✅
✅
Movimento guiado por áudio
✅ Sincronização com referência de áudio
✅ Áudio gerado
✅ Áudio sincronizado
Resolução máxima
Até 4K
Até 1080P
Até 1080P
Duração do clipe
3 a 15 segundos
Clipes curtos dirigidos
Clipes curtos dirigidos
Recomendado para
Cenas em take único de alta resolução com referências combinadas
Takes narrativos guiados por prompt
Cenas criativas guiadas por física
Por que escolher a API do Kling 3.0 Omni?
O Kling 3.0 Omni é ideal para produtos que criam vídeos a partir de ativos existentes, permitindo combinar sujeitos, clipes de origem e áudio em cenas consistentes e em alta resolução, em vez de criar prompts no escuro para cada take.
Com a Pollo API, você acessa o Kling 3.0 Omni com uma única chave de API junto de mais de 300 modelos líderes de vídeo e imagem, com documentação clara, consulta de tarefas e webhooks.
Comece com o endpoint do Kling 3.0 Omni na Pollo API para lançar recursos de vídeo guiados por referência e prontos para 4K, depois compare com Veo, Sora e outros modelos Kling sem mexer na sua integração.
FAQs da API do Kling 3.0 Omni
O que é o Kling 3.0 Omni?
Kling 3.0 Omni é um modelo de vídeo da Kling AI que gera a partir de referências combinadas de texto, imagem, sujeito, vídeo e áudio, produzindo cenas consistentes em take único de até 4K.
Quais entradas a API do Kling 3.0 Omni pode combinar?
Ela aceita até sete referências em uma solicitação, misturando imagem, vídeo de origem, conjunto de imagens de sujeito e pista de áudio junto com seu prompt de texto.
Como funciona a consistência de sujeito?
Você fornece um pequeno conjunto de imagens de um personagem ou objeto, e o modelo mantém esse sujeito reconhecível durante todo o clipe gerado conforme a cena se move.
Quais resoluções e durações são suportadas?
A API do Kling 3.0 Omni gera em 720P, 1080P ou 4K, com duração de clipe selecionável de 3 a 15 segundos e enquadramento paisagem, retrato ou quadrado.
Ele pode gerar áudio correspondente?
Sim. Ele pode produzir áudio com som natural para o vídeo de saída, e uma referência de áudio também pode guiar o tempo e o ritmo do movimento na tela.
Por que executar o Kling 3.0 Omni via Pollo API?
A Pollo API oferece uma única integração para o Kling 3.0 Omni e mais de 300 outros modelos, com documentação, acompanhamento de tarefas e webhooks.