GPT Image 2 offre una resa del testo pressoché perfetta, output di produzione 4K, un realismo basato sulla conoscenza del mondo e un'estrema capacità di seguire istruzioni multi-argomento.
curl-X POST 'https://pollo.ai/api/platform/v1/generation/openai/gpt-image-2/image'\-H'Content-Type: application/json'\-H'x-api-key: YOUR_API_KEY'\-d'{ "input": { "prompt": "A cinematic shot of a golden retriever running through a field of sunflowers at sunset, warm rim light, shallow depth of field", "aspectRatio": "1:1", "resolution": "1K", "quality": "low", "background": "auto" }}'
{"input":{"prompt":"A cinematic shot of a golden retriever running through a field of sunflowers at sunset, warm rim light, shallow depth of field","aspectRatio":"1:1","resolution":"1K","quality":"low","background":"auto"},"webhookUrl":"https://example.com/webhooks/pollo"}
แผนผัง
ช่องป้อนข้อมูลสำหรับปลายทางและโหมดที่เลือก
สนาม
ประเภท
ที่จำเป็น
คำอธิบาย
prompt
string
ใช่
Text prompt describing the content to generate.
aspectRatio
string
เลขที่
Output aspect ratio, as width:height (e.g. 16:9).
resolution
string
เลขที่
Output resolution of the generated media (e.g. 720p, 1080p, 2K, 4K). Values are case-insensitive.
quality
string
เลขที่
Output quality tier of the generation.
background
string
เลขที่
Background of the generated image: auto lets the model decide, transparent produces an alpha background (PNG), opaque forces a solid background.
La leggibilità del testo all'interno di un'immagine è ciò che distingue GPT Image 2. Titoli, etichette e caratteri di piccole dimensioni vengono riprodotti in modo nitido, consentendo di realizzare poster, imballaggi e diagrammi pronti all'uso.
Con GPT Image 2 su Pollo API, gli sviluppatori possono aggiungere alle proprie Apps come la conversione di testo in immagine, la modifica delle immagini e la composizione di più immagini, generando output fino a 4K con proporzioni personalizzabili in base alle esigenze.
Caratteristiche principali dell'API GPT Image 2
Testo affidabile all'interno dell'immagine
La tipografia si mantiene coerente tra titoli, didascalie ed etichette dense, rendendo il modello affidabile per menu, infografiche e qualsiasi layout in cui il testo deve essere leggibile e non un semplice elemento decorativo.
Istruzioni estreme che seguono
Le istruzioni lunghe e dettagliate vengono rispettate scrupolosamente, in modo che il numero di oggetti, il loro posizionamento, i colori e le frasi scritte risultino esattamente come descritto, senza essere interpretati in modo approssimativo.
Modifica a livello di pixel
Importa un'immagine esistente e modifica con precisione una regione, scambiando oggetti, regolando il testo o perfezionando i dettagli, mentre le parti non modificate dell'inquadratura rimangono intatte.
Conoscenza del mondo radicata
Le scene riflettono le relazioni reali tra oggetti, materiali e ambientazioni, in modo che uno strumento, un piatto o una vetrina descritti appaiano plausibili anziché assemblati con parti non corrispondenti.
Uscita 4K
Generations scala fino a 4K, offrendo una risoluzione sufficiente per layout di stampa, banner di grandi dimensioni e foto dettagliate dei prodotti senza la necessità di un passaggio di upscaling separato nel flusso di lavoro.
Composizione multi-immagine
È possibile combinare più immagini di riferimento in un'unica richiesta per unire soggetti, inserire un prodotto in una nuova scena o creare un'immagine composita che mantenga riconoscibile ciascuna fonte.
Casi d'uso dell'API GPT Image 2
Mockup di imballaggi ed etichette: Genera scatole, bottiglie e buste con nomi di marchi leggibili, elenchi di ingredienti e scritte in piccolo posizionati come specificato nel prompt.
Infografiche e diagrammi: Realizzare grafici, schemi etichettati e diagrammi a fasi in cui il testo e la struttura trasmettano il significato, non solo gli elementi visivi.
Menu e insegne: Crea menu per ristoranti, cartelli dei prezzi e insegne per negozi con testi accurati e tipografia coerente per il settore della ristorazione e della vendita al dettaglio.
Modifiche mirate alle foto: Consentono agli utenti di selezionare un'area e modificare un singolo elemento, come ad esempio ricolorare un capo di abbigliamento o sostituire un logo, preservando il resto.
Composizione del prodotto: Inserisci un prodotto da un'immagine in un nuovo contesto, mantenendone forma e finitura, per cataloghi di e-commerce e immagini lifestyle.
Layout per poster e annunci pubblicitari: Crea layout promozionali in cui titolo, sottotitolo e invito all'azione devono apparire esattamente come scritti e rimanere leggibili.
Concetti di app e interfaccia utente: Realizza mockup di interfacce e idee per schermate con etichette di pulsanti e testo di menu reali per la progettazione e la prototipazione Apps.
Varianti di risorse localizzate: Rigenera lo stesso layout con testo diverso per produrre varianti linguistiche o di campagna su larga scala.
Come utilizzare l'API GPT Image 2
Ottieni una chiave API: Crea un account Pollo API e genera la tua chiave API dalla dashboard per sviluppatori.
Scegli il modello: Invia le richieste all'endpoint GPT Image 2 all'indirizzo /generation/ OpenAI/gpt-image-2-0/image.
Aggiungi i tuoi input: Passa un prompt per la conversione da testo a immagine, oppure fornisci imageUrl o images per la modifica e la composizione, quindi imposta aspectRatio, resolution (1K, 2K, 4K) e quality.
Generazione e recupero: Invia l'attività, verifica i valori restituiti di taskId e status e scarica l'immagine una volta completata con successo.
Suggerimenti sulle migliori pratiche per l'API GPT Image 2
Scrivi la richiesta come se fosse una scheda tecnica. Riporta il testo esatto che desideri venga visualizzato, indica la posizione degli elementi e nomina colori e materiali in modo che le istruzioni successive abbiano obiettivi chiari.
Una semplice formula di richiesta
Soggetto e ambientazione + testo esatto tra virgolette + impaginazione e posizionamento + stile e colore + dettagli relativi a materiali o illuminazione
Cosa dovresti notare
Cita il testo: Inserisci il testo che desideri venga visualizzato tra virgolette, in modo che il modello lo tratti come copia letterale e non come un tema libero.
Posizionamento del nome: Specifica la posizione di ciascun elemento, ad esempio banner superiore o angolo inferiore sinistro, per controllare il layout.
Descrivi l'area di modifica: Per la modifica delle immagini, specifica esattamente cosa modificare in modo che le aree non modificate rimangano invariate.
Imposta le proporzioni fin da subito: Scegli le proporzioni che meglio si adattano al formato finale, in modo che la composizione risulti correttamente inquadrata fin dall'inizio.
Risoluzione di abbinamento da utilizzare: Scegli 4K per la stampa e i grandi formati, risoluzioni inferiori per bozze e iterazioni più rapide.
Concentrati su un solo elemento per ogni modifica: Modifica un singolo elemento per ogni passaggio di modifica per mantenere i risultati prevedibili e puliti.
Esempi di richieste
Imballaggio del prodotto
"Una confezione di caffè in carta kraft opaca appoggiata su uno scaffale di legno chiaro, con l'etichetta frontale che recita 'MORNING ROOT — Single Origin' in caratteri serif in grassetto e 'Net 340g' in piccolo alla base. Luce diurna soffusa, profondità di campo ridotta, scatto del prodotto in 4K."
Infografica etichettata
"Un'infografica pulita e minimalista intitolata 'Come funziona il compostaggio', con quattro passaggi numerati disposti da sinistra a destra, ognuno con una semplice icona e una breve didascalia. Palette di colori verde e beige tenui, testo sans-serif nitido e leggibile."
Modifica regione
"Utilizzando la foto della facciata caricata, sostituite l'insegna vuota appesa con una che reciti 'AZURE BOOKS' in lettere dipinte a mano dai toni caldi. Mantenete invariati l'edificio, la tenda da sole e la strada, riproducendo la luce naturale e le ombre originali."
Composizione multi-immagine
"Combina la sneaker fornita con l'immagine di sfondo dello studio in modo che la sneaker sia centrata su un piedistallo riflettente, con un riflettore proveniente dall'alto a sinistra e un leggero riflesso sul pavimento, mantenendo la colorazione e i dettagli delle cuciture esatti della scarpa."
GPT Image 2 vs Google Imagen 4 vs FLUX.1 Kontext
Capacità
GPT Image 2
Immagine Google Imagen 4
FLUX.1 Kontext
Rendering del testo nell'immagine
✅ Ottimo per testi lunghi e piccoli
✅ Buona tipografia
⚠️ Testo meno performante, orientato alla modifica
Seguire le istruzioni
✅ Gestisce prompt dettagliati con elementi multipli
✅ Aderenza solida
✅ Forte per le istruzioni di modifica
Modifica a livello di pixel
✅
⚠️ Limitato
✅ Forza del nucleo
Composizione multi-immagine
✅
❌
⚠️ Basata su riferimento
Risoluzione massima
Fino a 4K
Fino a 2K
Fino a 4MP
Consigliato per
Risorse con molto testo e modifiche precise
Generazione fotorealistica
Modifica iterativa delle immagini
Perché scegliere l'API GPT Image 2 ?
Il formato GPT Image 2 è adatto a prodotti che necessitano di testo leggibile e modifiche fedeli, dal packaging alle infografiche, fino alle modifiche mirate a specifiche aree geografiche, il tutto a risoluzioni sufficientemente elevate per la stampa.
Tramite Pollo API, puoi accedere a GPT Image 2 con una sola chiave API, insieme a oltre 300 modelli di immagini e video leader del settore, con documentazione chiara, monitoraggio dello stato delle attività e una generazione a un costo inferiore rispetto a Fal AI.
Inizia con l'endpoint GPT Image 2 sull'API Pollo per fornire caratteristiche di immagine accurate rispetto al testo, quindi confrontale con Imagen, Flux e altri senza modificare la tua integrazione.
Domande frequenti sull'API GPT Image 2
Cos'è GPT Image 2?
GPT Image 2 è un modello di immagine OpenAI noto per la precisione del testo all'interno delle immagini, la forte capacità di seguire le istruzioni e la modifica a livello di pixel, supportando la conversione di testo in immagine, la modifica di immagini e la composizione di immagini multiple fino a 4K.
L'API GPT Image 2 visualizza il testo in modo affidabile?
Sì. È uno dei suoi punti di forza principali, la gestione di titoli, etichette e caratteri piccoli, il che lo rende particolarmente adatto a imballaggi, menu, poster e infografiche.
Può modificare un'immagine esistente?
Sì. Fornisci un'immagine e descrivi la modifica, e il modello modificherà la regione specifica mantenendo intatto il resto dell'inquadratura.
Quali risoluzioni e rapporti d'aspetto sono supportati?
La risoluzione di output può essere 1K, 2K o 4K, con proporzioni che vanno dal formato quadrato e verticale al formato widescreen e ultrawide, selezionabili su richiesta.
È possibile combinare più immagini?
Sì. È possibile inviare più immagini di riferimento in un'unica richiesta per unire soggetti o inserire un prodotto in una nuova scena, mantenendo riconoscibile ciascuna fonte.
Perché eseguire GPT Image 2 tramite l'API Pollo ?
Pollo API offre un'integrazione per GPT Image 2 e oltre 300 altri modelli, con documentazione chiara, tracciamento delle attività e costi di generazione inferiori rispetto ai fornitori comparabili.