GPT Image 2 ofrece una representación de texto casi perfecta, salida de producción en 4K, realismo basado en el conocimiento del mundo y una capacidad extrema para seguir instrucciones en múltiples materias.
Maak een taak aan voor het genereren van een model.
Verzoek
curl-X POST 'https://pollo.ai/api/platform/v1/generation/openai/gpt-image-2/image'\-H'Content-Type: application/json'\-H'x-api-key: YOUR_API_KEY'\-d'{ "input": { "prompt": "A cinematic shot of a golden retriever running through a field of sunflowers at sunset, warm rim light, shallow depth of field", "aspectRatio": "1:1", "resolution": "1K", "quality": "low", "background": "auto" }}'
Voeg optioneel een webhookUrl toe om een callback te ontvangen wanneer de taak is geslaagd of mislukt.
Optioneel aanvraagveld
{"input":{"prompt":"A cinematic shot of a golden retriever running through a field of sunflowers at sunset, warm rim light, shallow depth of field","aspectRatio":"1:1","resolution":"1K","quality":"low","background":"auto"},"webhookUrl":"https://example.com/webhooks/pollo"}
Schema
Invoervelden voor het geselecteerde eindpunt en de modus.
Veld
Type
Vereist
Beschrijving
prompt
string
Ja
Text prompt describing the content to generate.
aspectRatio
string
Nee
Output aspect ratio, as width:height (e.g. 16:9).
resolution
string
Nee
Output resolution of the generated media (e.g. 720p, 1080p, 2K, 4K). Values are case-insensitive.
quality
string
Nee
Output quality tier of the generation.
background
string
Nee
Background of the generated image: auto lets the model decide, transparent produces an alpha background (PNG), opaque forces a solid background.
El texto legible dentro de una imagen es donde GPT Image 2 marca la diferencia. Los titulares, las etiquetas y la letra pequeña se renderizan con limpieza, así que pósteres, empaques y diagramas salen listos para usar.
Con GPT Image 2 en Pollo API, los desarrolladores añaden a sus apps generación de texto a imagen, edición de imagen y composición de múltiples imágenes, generando salida de hasta 4K con relaciones de aspecto elegidas por solicitud.
Características clave de la API de GPT Image 2
Texto fiable dentro de la imagen
La tipografía se mantiene consistente en titulares, pies de foto y etiquetas densas, lo que hace que el modelo sea fiable para menús, infografías y cualquier diseño donde el texto tenga que leerse, no ser un simple relleno decorativo.
Seguimiento extremo de instrucciones
Los prompts largos y detallados se respetan de cerca, así que los recuentos específicos de objetos, posiciones, colores y frases escritas aparecen tal como se describen, en lugar de derivar en una interpretación suelta.
Edición a nivel de píxel
Pasa una imagen existente y cambia una región con precisión: sustituye objetos, ajusta texto o refina detalles mientras las partes no tocadas del encuadre permanecen intactas.
Conocimiento del mundo fundamentado
Las escenas reflejan relaciones reales entre objetos, materiales y entornos, así que una herramienta, plato o escaparate descritos se ven plausibles en lugar de montados con piezas inconexas.
Salida 4K
Las generaciones escalan a 4K, dando resolución suficiente para diseños de impresión, banners grandes y fotos de producto detalladas sin un paso aparte de escalado dentro del flujo de trabajo.
Composición de múltiples imágenes
Combina varias imágenes de referencia en una sola solicitud para fusionar sujetos, colocar un producto en una escena nueva o crear un compuesto que mantenga cada fuente reconocible.
Casos de uso de la API de GPT Image 2
Mockups de empaques y etiquetas: Genera cajas, botellas y bolsas con nombres de marca legibles, listas de ingredientes y letra pequeña colocada como se especifica en el prompt.
Infografías y diagramas: Produce gráficos, esquemas etiquetados y diseños por pasos donde el texto y la estructura aportan el significado, no solo lo visual.
Menús y cartelería: Crea menús de restaurante, pizarras de precios y señalética de tienda con texto preciso y tipografía consistente para herramientas de hostelería y retail.
Ediciones de foto dirigidas: Permite que los usuarios seleccionen una región y cambien un elemento, como recolorear una prenda o sustituir un logotipo, preservando el resto.
Composición de producto: Inserta un producto de una imagen en un entorno nuevo, manteniendo su forma y acabado para catálogos de ecommerce e imágenes lifestyle.
Diseños de póster y anuncio: Construye diseños promocionales donde un titular, subtítulo y llamada a la acción deben aparecer exactamente como están escritos y seguir siendo legibles.
Conceptos de app y UI: Renderiza mockups de interfaz e ideas de pantalla con etiquetas reales de botones y texto de menú para apps de diseño y prototipado.
Variantes localizadas de assets: Regenera el mismo diseño con texto distinto para producir variantes por idioma o campaña a escala.
Cómo usar la API de GPT Image 2
Consigue una clave de API: Crea una cuenta de Pollo API y genera tu clave de API desde el panel de desarrollador.
Elige el modelo: Envía solicitudes al endpoint de GPT Image 2 en /generation/openai/gpt-image-2-0/image.
Añade tus entradas: Pasa un prompt para texto a imagen, o proporciona imageUrl o images para edición y composición, y luego define aspectRatio, resolution (1K, 2K, 4K) y quality.
Genera y recupera: Envía la tarea, consulta el taskId y el status devueltos, y descarga la imagen cuando se complete con éxito.
Buenas prácticas de prompting para la API de GPT Image 2
Escribe el prompt como una hoja de especificaciones. Cita el texto exacto que quieres renderizar, indica dónde va cada elemento y nombra colores y materiales para que el seguimiento de instrucciones tenga objetivos claros.
Una fórmula simple de prompt
Sujeto y entorno + texto exacto entre comillas + diseño y colocación + estilo y color + detalle de material o iluminación
En qué deberías fijarte
Pon el texto entre comillas: Pon entre comillas el texto que quieras renderizar para que el modelo lo trate como copia literal y no como un tema abierto.
Nombra la colocación: Di dónde va cada elemento, como en el banner superior o en la esquina inferior izquierda, para controlar el diseño.
Describe la región de edición: Para edición de imagen, especifica exactamente qué cambiar para que las áreas no tocadas se mantengan como estaban.
Define pronto la relación de aspecto: Elige la relación que encaje con el formato final para que la composición quede bien encuadrada desde el inicio.
Ajusta la resolución al uso: Elige 4K para impresión y formatos grandes, y resoluciones más bajas para borradores e iteración más rápida.
Mantén un foco por edición: Cambia un único elemento por pasada de edición para mantener resultados predecibles y limpios.
Prompts de ejemplo
Empaque de producto
"Una bolsa de café kraft mate de pie sobre una estantería de madera clara, etiqueta frontal con 'MORNING ROOT — Single Origin' en serif en negrita, con 'Net 340g' en texto pequeño en la base. Luz natural suave, poca profundidad, toma de producto en 4K."
Infografía etiquetada
"Una infografía limpia de estilo flat titulada 'How Composting Works' con cuatro pasos numerados organizados de izquierda a derecha, cada uno con un icono simple y un pie corto. Paleta suave en verde y beige, texto sans-serif nítido y legible."
Edición de región
"Usando la foto de escaparate subida, sustituye el letrero colgante en blanco por uno que diga 'AZURE BOOKS' con rotulación cálida pintada a mano. Mantén edificio, toldo y calle sin cambios, igualando la luz diurna y las sombras originales."
Composición con múltiples imágenes
"Combina la zapatilla proporcionada y la imagen de fondo de estudio para que la zapatilla quede centrada sobre un pedestal reflectante, foco desde arriba a la izquierda, reflejo sutil en el suelo, manteniendo la combinación exacta de colores y el detalle de las costuras del calzado."
GPT Image 2 vs Google Imagen 4 vs FLUX.1 Kontext
Capacidad
GPT Image 2
Google Imagen 4
FLUX.1 Kontext
Renderizado de texto en imagen
✅ Fuerte con texto largo y pequeño
✅ Buena tipografía
⚠️ Enfocado en edición, texto más débil
Seguimiento de instrucciones
✅ Maneja prompts detallados con múltiples elementos
✅ Buena adherencia
✅ Fuerte para instrucciones de edición
Edición a nivel de píxel
✅
⚠️ Limitada
✅ Punto fuerte principal
Composición de múltiples imágenes
✅
❌
⚠️ Basado en referencias
Resolución máxima
Hasta 4K
Hasta clase 2K
Hasta clase 4MP
Recomendado para
Assets con mucho texto y ediciones precisas
Generación fotorrealista
Edición iterativa de imagen
¿Por qué elegir la API de GPT Image 2?
GPT Image 2 encaja en productos que necesitan texto legible y ediciones fieles, desde empaques e infografías hasta cambios dirigidos por región, todo en resoluciones suficientemente altas para impresión.
A través de Pollo API, accedes a GPT Image 2 con una sola clave de API junto con más de 300 modelos líderes de imagen y vídeo, con documentación limpia, consulta del estado de tareas y generación que cuesta menos que Fal AI.
Empieza con el endpoint de GPT Image 2 en Pollo API para lanzar funciones de imagen con texto preciso y luego compáralo con Imagen, FLUX y otros sin tocar tu integración.
Preguntas frecuentes de la API de GPT Image 2
¿Qué es GPT Image 2?
GPT Image 2 es un modelo de imagen de OpenAI conocido por su texto preciso dentro de la imagen, fuerte seguimiento de instrucciones y edición a nivel de píxel, con soporte para texto a imagen, edición de imagen y composición de múltiples imágenes hasta 4K.
¿La API de GPT Image 2 renderiza texto de forma fiable?
Sí. Es una de sus fortalezas definitorias: maneja titulares, etiquetas y letra pequeña, lo que la hace muy adecuada para empaques, menús, pósteres e infografías.
¿Puede editar una imagen existente?
Sí. Proporciona una imagen y describe el cambio, y el modelo edita una región concreta mientras mantiene intacto el resto del encuadre.
¿Qué resoluciones y relaciones de aspecto admite?
La salida escala a 1K, 2K o 4K, con relaciones de aspecto desde cuadrado y retrato hasta panorámico y ultrapanorámico, elegidas por solicitud.
¿Puede combinar varias imágenes?
Sí. Puedes pasar varias imágenes de referencia en una sola solicitud para fusionar sujetos o colocar un producto en una escena nueva manteniendo cada fuente reconocible.
¿Por qué ejecutar GPT Image 2 a través de Pollo API?
Pollo API ofrece una sola integración para GPT Image 2 y más de 300 modelos adicionales, con documentación clara, seguimiento de tareas y generación de menor coste que proveedores comparables.