GPT Image 2 bietet eine nahezu perfekte Textwiedergabe, 4K-Produktionsausgabe, realistische Darstellung von Weltwissen und eine extrem präzise Verfolgung von Anweisungen mehrerer Themen.
curl-X POST 'https://pollo.ai/api/platform/v1/generation/openai/gpt-image-2/image'\-H'Content-Type: application/json'\-H'x-api-key: YOUR_API_KEY'\-d'{ "input": { "prompt": "A cinematic shot of a golden retriever running through a field of sunflowers at sunset, warm rim light, shallow depth of field", "aspectRatio": "1:1", "resolution": "1K", "quality": "low", "background": "auto" }}'
선택적으로, 작업 성공 또는 실패 시 콜백을 수신하기 위해 webhookUrl을 포함할 수 있습니다.
선택적 요청 필드
{"input":{"prompt":"A cinematic shot of a golden retriever running through a field of sunflowers at sunset, warm rim light, shallow depth of field","aspectRatio":"1:1","resolution":"1K","quality":"low","background":"auto"},"webhookUrl":"https://example.com/webhooks/pollo"}
개요
선택한 엔드포인트 및 모드에 대한 입력 필드입니다.
필드
유형
필수의
화면 설명
prompt
string
예
Text prompt describing the content to generate.
aspectRatio
string
아니요
Output aspect ratio, as width:height (e.g. 16:9).
resolution
string
아니요
Output resolution of the generated media (e.g. 720p, 1080p, 2K, 4K). Values are case-insensitive.
quality
string
아니요
Output quality tier of the generation.
background
string
아니요
Background of the generated image: auto lets the model decide, transparent produces an alpha background (PNG), opaque forces a solid background.
Gut lesbarer Text innerhalb eines Bildes ist der Bereich, in dem sich GPT Image 2 klar abhebt. Überschriften, Labels und Kleingedrucktes werden sauber gerendert, sodass Poster, Verpackungen und Diagramme direkt einsatzbereit sind.
Mit GPT Image 2 auf der Pollo API fügen Entwickler Text-zu-Bild, Bildbearbeitung und Multi-Bild-Komposition zu ihren Apps hinzu und erzeugen Ausgaben bis 4K mit pro Anfrage gewählten Seitenverhältnissen.
Hauptfunktionen der GPT Image 2 API
Zuverlässiger Text im Bild
Die Typografie bleibt über Überschriften, Beschriftungen und dichte Labels hinweg stabil, wodurch das Modell verlässlich für Speisekarten, Infografiken und jedes Layout ist, bei dem Text lesbar sein muss und nicht nur dekoratives Beiwerk.
Extrem präzise Befolgung von Anweisungen
Lange, detaillierte Prompts werden eng befolgt, sodass konkrete Objektanzahlen, Positionen, Farben und geschriebene Formulierungen wie beschrieben erscheinen, statt in eine lose Interpretation abzudriften.
Bearbeitung auf Pixelebene
Gib ein bestehendes Bild ein und ändere einen Bereich präzise: Objekte austauschen, Text anpassen oder Details verfeinern, während unberührte Teile des Bildausschnitts intakt bleiben.
Verankertes Weltwissen
Szenen spiegeln reale Beziehungen zwischen Objekten, Materialien und Umgebungen wider, sodass ein beschriebenes Werkzeug, Gericht oder Ladenlokal plausibel wirkt statt aus unpassenden Teilen zusammengesetzt.
4K-Ausgabe
Generierungen skalieren bis 4K und bieten genug Auflösung für Print-Layouts, große Banner und detaillierte Produktaufnahmen ohne separaten Upscaling-Schritt im Workflow.
Multi-Bild-Komposition
Kombiniere mehrere Referenzbilder in einer Anfrage, um Motive zusammenzuführen, ein Produkt in eine neue Szene zu setzen oder ein Komposit zu erstellen, bei dem jede Quelle erkennbar bleibt.
Anwendungsfälle der GPT Image 2 API
Verpackungs- und Label-Mockups: Erstelle Boxen, Flaschen und Beutel mit gut lesbaren Markennamen, Zutatenlisten und Kleingedrucktem, wie im Prompt positioniert.
Infografiken und Diagramme: Erzeuge Charts, beschriftete Schemata und Schritt-Layouts, bei denen Text und Struktur die Bedeutung tragen, nicht nur die Visuals.
Menü- und Beschilderungstafeln: Erstelle Restaurantmenüs, Preistafeln und Ladenschilder mit präziser Wortwahl und konsistenter Typografie für Hospitality- und Retail-Tools.
Gezielte Fotobearbeitungen: Lass Nutzer einen Bereich auswählen und ein Element ändern, etwa ein Kleidungsstück umfärben oder ein Logo ersetzen, während der Rest erhalten bleibt.
Produkt-Compositing: Setze ein Produkt aus einem Bild in eine neue Umgebung und erhalte Form und Oberfläche für E-Commerce-Katalog- und Lifestyle-Bilder.
Poster- und Werbe-Layouts: Erstelle Promotions-Layouts, in denen Überschrift, Unterzeile und Call-to-Action exakt wie geschrieben erscheinen und lesbar bleiben müssen.
App- und UI-Konzepte: Rendere Interface-Mockups und Screen-Ideen mit echten Button-Labels und Menütext für Design- und Prototyping-Apps.
Lokalisierte Assets-Varianten: Generiere dasselbe Layout mit anderem Text neu, um Sprach- oder Kampagnenvarianten im großen Maßstab zu produzieren.
So verwendest du die GPT Image 2 API
API-Key holen: Erstelle ein Pollo API-Konto und generiere deinen API-Key im Entwickler-Dashboard.
Modell wählen: Sende Anfragen an den GPT Image 2-Endpoint unter /generation/openai/gpt-image-2-0/image.
Eingaben hinzufügen: Übergib einen prompt für Text-zu-Bild oder gib imageUrl bzw. images für Bearbeitung und Komposition an und setze dann aspectRatio, resolution (1K, 2K, 4K) und quality.
Generieren und abrufen: Reiche die Aufgabe ein, frage die zurückgegebenen taskId und status per Polling ab und lade das Bild herunter, sobald der Vorgang erfolgreich ist.
Prompting-Best-Practices für die GPT Image 2 API
Schreibe den Prompt wie ein Lastenheft. Zitiere den exakten Text, der gerendert werden soll, gib an, wo Elemente sitzen, und nenne Farben und Materialien, damit die Anweisungsbefolgung klare Zielvorgaben hat.
Eine einfache Prompt-Formel
Motiv und Setting + exakter Text in Anführungszeichen + Layout und Platzierung + Stil und Farbe + Material- oder Lichtdetail
Worauf du achten solltest
Text in Anführungszeichen setzen: Setze Wortlaut, der gerendert werden soll, in Anführungszeichen, damit das Modell ihn als wörtliche Kopie behandelt und nicht als loses Thema.
Platzierung benennen: Sag, wo jedes Element hingehört, z. B. oberes Banner oder untere linke Ecke, um das Layout zu steuern.
Bearbeitungsbereich beschreiben: Gib bei Bildbearbeitung genau an, was geändert werden soll, damit unberührte Bereiche unverändert bleiben.
Seitenverhältnis früh festlegen: Wähle das Verhältnis passend zum Endformat, damit die Komposition von Beginn an korrekt gerahmt ist.
Auflösung dem Zweck anpassen: Wähle 4K für Druck und große Formate, niedrigere Auflösungen für schnellere Entwürfe und Iterationen.
Pro Bearbeitung ein Fokus: Ändere pro Bearbeitungsdurchlauf nur ein Element, um Ergebnisse vorhersehbar und sauber zu halten.
Beispiel-Prompts
Produktverpackung
"Eine matte Kraftpapier-Kaffeetüte auf einem hellen Holzregal, Frontlabel mit 'MORNING ROOT — Single Origin' in fetter Serifenschrift, dazu 'Net 340g' in kleiner Schrift am unteren Rand. Weiches Tageslicht, geringe Tiefenschärfe, 4K-Produktaufnahme."
Beschriftete Infografik
"Eine saubere Infografik im Flat-Style mit dem Titel 'How Composting Works', mit vier nummerierten Schritten von links nach rechts, jeweils mit einem einfachen Icon und einer kurzen Beschriftung. Gedämpfte Grün- und Beigetöne, scharfer gut lesbarer Sans-Serif-Text."
Bereichsbearbeitung
"Verwende das hochgeladene Schaufensterfoto und ersetze das leere Hängeschild durch eines mit der Aufschrift 'AZURE BOOKS' in warm wirkender handgemalter Schrift. Gebäude, Markise und Straße unverändert lassen, dabei ursprüngliches Tageslicht und Schatten beibehalten."
Multi-Bild-Komposit
"Kombiniere den bereitgestellten Sneaker und das Studio-Hintergrundbild so, dass der Sneaker zentriert auf einem reflektierenden Podest steht, mit Spotlicht von links oben und subtiler Bodenreflexion, wobei die exakte Farbgebung und Nahtdetails des Schuhs erhalten bleiben."
GPT Image 2 vs Google Imagen 4 vs FLUX.1 Kontext
Fähigkeit
GPT Image 2
Google Imagen 4
FLUX.1 Kontext
Textdarstellung im Bild
✅ Stark bei langem und kleinem Text
✅ Gute Typografie
⚠️ Fokus auf Bearbeitung, schwächerer Text
Anweisungsbefolgung
✅ Verarbeitet detaillierte Multi-Element-Prompts
✅ Solide Einhaltung
✅ Stark bei Bearbeitungsanweisungen
Bearbeitung auf Pixelebene
✅
⚠️ Begrenzt
✅ Kernstärke
Multi-Bild-Komposition
✅
❌
⚠️ Referenzbasiert
Maximale Auflösung
Bis zu 4K
Bis zu 2K-Klasse
Bis zu 4MP-Klasse
Empfohlen für
Textlastige Assets und präzise Bearbeitungen
Fotorealistische Generierung
Iterative Bildbearbeitung
Warum die GPT Image 2 API wählen?
GPT Image 2 passt zu Produkten, die gut lesbaren Text und präzise Bearbeitungen benötigen – von Verpackungen und Infografiken bis zu gezielten Bereichsänderungen, alles in Auflösungen, die hoch genug für den Druck sind.
Über die Pollo API erreichst du GPT Image 2 mit einem API-Key zusammen mit über 300 führenden Bild- und Videomodellen, mit klarer Dokumentation, Task-Status-Polling und Generierung zu geringeren Kosten als bei Fal AI.
Starte mit dem GPT Image 2-Endpoint auf der Pollo API, um textgenaue Bildfunktionen auszurollen, und vergleiche es anschließend mit Imagen, FLUX und anderen, ohne deine Integration anzufassen.
GPT Image 2 API – FAQs
Was ist GPT Image 2?
GPT Image 2 ist ein OpenAI-Bildmodell, bekannt für präzisen Text im Bild, starke Anweisungsbefolgung und Bearbeitung auf Pixelebene. Es unterstützt Text-zu-Bild, Bildbearbeitung und Multi-Bild-Komposition bis 4K.
Rendert die GPT Image 2 API Text zuverlässig?
Ja. Das ist eine seiner definierenden Stärken: Überschriften, Labels und Kleingedrucktes werden gut verarbeitet, wodurch es sich ideal für Verpackungen, Menüs, Poster und Infografiken eignet.
Kann es ein bestehendes Bild bearbeiten?
Ja. Gib ein Bild an und beschreibe die Änderung, dann bearbeitet das Modell einen gezielten Bereich, während der Rest des Bildausschnitts intakt bleibt.
Welche Auflösungen und Seitenverhältnisse werden unterstützt?
Die Ausgabe skaliert auf 1K, 2K oder 4K, mit Seitenverhältnissen von quadratisch und Hochformat bis Breitbild und Ultraweit, jeweils pro Anfrage wählbar.
Kann es mehrere Bilder kombinieren?
Ja. Du kannst mehrere Referenzbilder in einer Anfrage übergeben, um Motive zusammenzuführen oder ein Produkt in eine neue Szene zu setzen, wobei jede Quelle erkennbar bleibt.
Warum GPT Image 2 über die Pollo API ausführen?
Die Pollo API bietet eine Integration für GPT Image 2 und über 300 weitere Modelle, mit klarer Dokumentation, Task-Tracking und kostengünstigerer Generierung als bei vergleichbaren Anbietern.