Generador de imágenes con IAImagen a Imagen IACrear videos con IA a partir de texto gratisVídeo con referenciaImagen a Video IADesde 0,0308 $ / imagen
Kling 3.0 Omni genera imágenes coherentes en múltiples escenas con calidad cinematográfica, estabilidad de los personajes y secuencias de imágenes profesionales.
Aporte
Modo
Complete los campos obligatorios para ver el precio.
curl-X POST 'https://pollo.ai/api/platform/v1/generation/kling-ai/kling-v3-omni/video'\-H'Content-Type: application/json'\-H'x-api-key: YOUR_API_KEY'\-d'{ "input": { "prompt": "A cinematic shot of a golden retriever running through a field of sunflowers at sunset, warm rim light, shallow depth of field", "aspectRatio": "16:9", "duration": 5, "mode": "pro", "generateAudio": true }}'
Opcionalmente, incluya la URL del webhook para recibir una notificación cuando la tarea se complete con éxito o falle.
Campo de solicitud opcional
{"input":{"prompt":"A cinematic shot of a golden retriever running through a field of sunflowers at sunset, warm rim light, shallow depth of field","aspectRatio":"16:9","duration":5,"mode":"pro","generateAudio":true},"webhookUrl":"https://example.com/webhooks/pollo"}
Esquema
Campos de entrada para el punto final y el modo seleccionados.
Campo
Tipo
Requerido
Descripción
prompt
string
Sí
Text prompt describing the content to generate.
aspectRatio
string
No
Output aspect ratio, as width:height (e.g. 16:9).
duration
integer
No
The duration of the generated video, in seconds.
mode
string
No
Generation mode of the model (e.g. a faster or higher-quality tier).
generateAudio
boolean
No
Generate natural-sounding, fitting audio for the output video.
Kling 3.0 Omni genera vídeo a partir de múltiples tipos de entrada, incluyendo texto, imágenes, conjuntos de sujetos, vídeo de origen y audio, en una sola solicitud con una resolución de hasta 4K.
Con Kling 3.0 Omni en la API de Pollo , los desarrolladores pueden generar vídeos basados en referencias a partir de una combinación de tipos de guía, eligiendo la duración del clip, la relación de aspecto y el audio correspondiente opcional según la solicitud.
Características clave de la API Omni de Kling 3.0
Entrada de referencia omnimodal
El modelo acepta hasta siete referencias a la vez, combinando una imagen, un vídeo de origen, un conjunto de sujetos y una señal de audio para guiar una única generación.
Consistencia del tema
Proporcione varias imágenes de un personaje u objeto. El modelo mantiene su identidad a lo largo de la toma, incluso cuando la escena se mueve.
Movimiento guiado por audio
Proporciona una referencia de audio y el modelo sincroniza el movimiento, el ritmo y la cadencia con el sonido, alineando la acción con los compases, el habla o las señales ambientales del clip.
Simulación ambiental
La simulación espacial recrea escenas de una sola toma con luz, profundidad y reacción ambiental coherentes a medida que la cámara y los sujetos se mueven por el espacio.
Salida volumétrica 4K
Las nuevas generaciones alcanzan hasta 4K, manteniendo texturas finas y detalles de profundidad en alta resolución para su uso en transmisiones y pantallas grandes.
Duración y estructura flexibles
Los clips tienen una duración de entre 3 y 15 segundos y pueden presentarse en formato horizontal, vertical o cuadrado, lo que permite que una sola integración sirva para la difusión en redes sociales, productos y contenido a pantalla completa desde el mismo modelo.
Casos de uso de la API Omni de Kling 3.0
Contenido recurrente de personajes: Reutiliza un conjunto de temas para mantener la coherencia de una mascota, presentador o avatar en los clips episódicos sin tener que redibujar su identidad cada vez.
Clips de actuación sincronizados con audio: Controla a un bailarín, músico o orador para que sus movimientos se sincronicen con una pista cargada, útil para herramientas de música y sincronización labial.
Reestilización con referencia de vídeo: Utilice un clip existente como referencia y reprodúzcalo con una nueva dirección, manteniendo intactos el movimiento y la puesta en escena originales.
Sistemas de continuación de escena: Combinan referencias de imagen y vídeo para extender una toma hacia adelante, manteniendo la continuidad del entorno y del sujeto a lo largo de una secuencia más larga.
Guion gráfico con múltiples referencias: Combina varias imágenes y un sujeto en una sola indicación para previsualizar escenas complejas antes de realizar una versión final de producción.
Recursos de transmisión de alta resolución: Genere escenas de una sola toma en 4K para señalización, introducciones de transmisión o pantallas grandes donde la resolución y la profundidad son importantes.
Variantes de anuncios localizadas: Reutilice un mismo tema y cambie las referencias de audio para producir versiones específicas para cada región con un ritmo uniforme y una imagen de marca coherente.
Demostraciones de entornos inmersivos: Muestre un espacio que se llena de niebla, agua o movimiento de multitud, donde el entorno responde de forma creíble para previsualizaciones de bienes raíces o eventos.
Cómo usar la API Omni de Kling 3.0
Obtén una clave API: Crea una cuenta de API de Pollo y genera tu clave API desde el panel de desarrolladores.
Elige el modelo: Envía solicitudes al punto final Kling 3.0 Omni en /generation/kling-ai/kling-v3-omni/ref2video.
Agregue sus entradas: Proporcione un mensaje y de una a siete referencias (imagen, sujeto, video o audio), luego configure la duración (3-15), la relación de aspecto y la resolución (720P, 1080P o 4K).
Generar y recuperar: Envíe la tarea, consulte el estado de la tarea devuelta y descargue el vídeo finalizado, opcionalmente con generateAudio produciendo una banda sonora correspondiente.
Mejores prácticas para solicitar información a la API Omni de Kling 3.0
Considera la consigna como una guía de referencias, en lugar de una descripción desde cero. Indica el papel de cada referencia, la acción que deseas y cómo debe desarrollarse la escena en torno a tu sujeto.
Una fórmula sencilla para obtener indicaciones
Sujeto y su rol de referencia + acción específica + comportamiento de la escena y el entorno + movimiento de la cámara + señal de audio o ritmo
Lo que debes tener en cuenta
Asignar roles de referencia: Indique al modelo qué referencia es el sujeto, cuál es el entorno y cuál controla el audio, para que la guía no compita.
Mantenga los sujetos claros: Proporcione imágenes limpias y variadas de un mismo personaje para que su identidad se mantenga constante en toda la toma generada.
Describa la respuesta del entorno: Indique cómo deberían cambiar la luz, el clima o el entorno, ya que el modelo simula el espacio en lugar de un fondo plano.
Sincronizar audio con acción: Al usar una referencia de audio, indique el movimiento con el que debe sincronizarse para que el ritmo siga el sonido.
Seleccione la resolución según su propósito: Elija 4K para transmisiones y pantallas grandes, y configuraciones más bajas para borradores e iteraciones más rápidas.
Mantén una sola escena: Mantén cada generación en un único momento coherente para que el clip permanezca continuo de principio a fin.
Ejemplos de indicaciones
Episodio de mascota consistente
"Utiliza como referencia la ilustración de un zorro rojo con uniforme de explorador. El zorro camina por una biblioteca iluminada por el sol, se detiene para sacar un libro brillante de un estante alto y sonríe. Movimiento de cámara lento, luz cálida y polvorienta."
Bailarina callejera con audio sincronizado
"Animar al bailarín al ritmo de la pista de batería subida. Los precisos movimientos de pies y brazos coinciden con cada compás dentro de un paso subterráneo de hormigón al atardecer, con frías sombras azules y una cámara en mano que gira mientras los pulsos del bajo aumentan."
Revelación de la simulación del entorno
"Un patio de piedra al amanecer se llena lentamente de una niebla que se arremolina alrededor de viejas columnas y capta los primeros rayos de luz. La cámara se eleva para revelar la escena completa, con tonos ambientales suaves y un estilo realista y sereno."
Rediseño con referencia a vídeo
"Toma el vídeo de referencia de un ciclista en una carretera costera y transfórmalo en una imagen con aspecto de pintura a mano. Mantén la misma ruta y el mismo movimiento de pedaleo, añade hierba mecida por el viento, gaviotas que pasan y una suave luz de la tarde."
Kling 3.0 Omni vs Veo 3.1 vs Sora 2
Capacidad
Kling 3.0 Omni
Veo 3.1
Sora 2
Entrada de referencia múltiple (imagen, vídeo, sujeto, audio)
✅ Hasta siete referencias mixtas
✅ Guía de imágenes y sugerencias
✅ Guía de sugerencias y referencias
Consistencia del sujeto a partir de conjuntos de imágenes
✅ Conjuntos de sujetos con múltiples imágenes
✅
✅
Movimiento guiado por audio
✅ Sincronización de referencia de audio
✅ Audio generado
✅ Audio sincronizado
Resolución máxima
Hasta 4K
Hasta 1080P
Hasta 1080P
Duración del clip
De 3 a 15 segundos
Clips cortos dirigidos
Clips cortos dirigidos
Recomendado para
Escenas de una sola toma de alta resolución con mezcla de referencias
Tomas narrativas guiadas por indicaciones
Escenas creativas basadas en la física
¿Por qué elegir la API Omni de Kling 3.0 ?
Kling 3.0 Omni es ideal para productos que se construyen a partir de recursos, permitiéndote fusionar sujetos, clips de origen y audio en escenas coherentes y de alta resolución, en lugar de seleccionar cada toma a ciegas.
Mediante la API de Pollo , puedes acceder a Kling 3.0 Omni con una sola clave API, junto con más de 300 modelos líderes de vídeo e imagen, con documentación clara, sondeo de tareas y webhooks.
Comience con el punto final Kling 3.0 Omni en la API de Pollo para implementar funciones de video basadas en referencias y listas para 4K, y luego compárelo con Veo, Sora y otros modelos de Kling sin modificar su integración.
Preguntas frecuentes sobre la API Omni de Kling 3.0
¿Qué es Kling 3.0 Omni?
Kling 3.0 Omni es un modelo de vídeo de Kling AI que genera contenido a partir de la combinación de referencias de texto, imagen, sujeto, vídeo y audio, produciendo escenas consistentes de una sola toma con una resolución de hasta 4K.
¿Qué entradas puede combinar la API Omni de Kling 3.0 ?
Admite hasta siete referencias en una sola solicitud, combinando una imagen, un vídeo de origen, un conjunto de imágenes del tema y una señal de audio junto con su mensaje de texto.
¿Cómo funciona la consistencia del sujeto?
Usted proporciona un pequeño conjunto de imágenes de un personaje u objeto, y el modelo mantiene a ese sujeto reconocible a lo largo de todo el vídeo generado, a medida que avanza la escena.
¿Qué resoluciones y longitudes son compatibles?
La API Omni Kling 3.0 ofrece salidas en 720P, 1080P o 4K, con duraciones de clip seleccionables de 3 a 15 segundos y encuadre horizontal, vertical o cuadrado.
¿Puede generar audio coincidente?
Sí. Puede producir un audio con sonido natural para el vídeo de salida, y una referencia de audio también puede guiar la sincronización y el ritmo del movimiento en pantalla.
¿Por qué ejecutar Kling 3.0 Omni a través de la API de Pollo ?
La API de Pollo ofrece una integración para Kling 3.0 Omni y más de 300 modelos adicionales, con documentación, seguimiento de tareas y webhooks.