GPT Image 2 zapewnia niemal idealne renderowanie tekstu, produkcję w rozdzielczości 4K, realizm wiedzy o świecie i ekstremalnie wszechstronne nauczanie wielotematyczne.
Aporte
Modo
Complete los campos obligatorios para ver el precio.
curl-X POST 'https://pollo.ai/api/platform/v1/generation/openai/gpt-image-2/image'\-H'Content-Type: application/json'\-H'x-api-key: YOUR_API_KEY'\-d'{ "input": { "prompt": "A cinematic shot of a golden retriever running through a field of sunflowers at sunset, warm rim light, shallow depth of field", "aspectRatio": "1:1", "resolution": "1K", "quality": "low", "background": "auto" }}'
Opcionalmente, incluya la URL del webhook para recibir una notificación cuando la tarea se complete con éxito o falle.
Campo de solicitud opcional
{"input":{"prompt":"A cinematic shot of a golden retriever running through a field of sunflowers at sunset, warm rim light, shallow depth of field","aspectRatio":"1:1","resolution":"1K","quality":"low","background":"auto"},"webhookUrl":"https://example.com/webhooks/pollo"}
Esquema
Campos de entrada para el punto final y el modo seleccionados.
Campo
Tipo
Requerido
Descripción
prompt
string
Sí
Text prompt describing the content to generate.
aspectRatio
string
No
Output aspect ratio, as width:height (e.g. 16:9).
resolution
string
No
Output resolution of the generated media (e.g. 720p, 1080p, 2K, 4K). Values are case-insensitive.
quality
string
No
Output quality tier of the generation.
background
string
No
Background of the generated image: auto lets the model decide, transparent produces an alpha background (PNG), opaque forces a solid background.
Czytelny tekst wewnątrz obrazu to obszar, w którym GPT Image 2 naprawdę się wyróżnia. Nagłówki, etykiety i drobny druk renderują się czysto, więc plakaty, opakowania i diagramy wychodzą gotowe do użycia.
Dzięki GPT Image 2 w Pollo API deweloperzy dodają do swoich aplikacji generowanie tekst-na-obraz, edycję obrazu i kompozycję wielu obrazów, uzyskując wyjście do 4K z proporcjami wybieranymi dla każdego żądania.
Kluczowe funkcje GPT Image 2 API
Niezawodny tekst w obrazie
Typografia zachowuje spójność w nagłówkach, podpisach i gęstych etykietach, dzięki czemu model jest niezawodny w menu, infografikach i każdym układzie, gdzie treść musi być czytelna, a nie tylko dekoracyjnym wypełnieniem.
Bardzo dokładne podążanie za instrukcjami
Długie, szczegółowe prompty są ściśle respektowane, więc konkretne liczby obiektów, rozmieszczenie, kolory i zapisane frazy pojawiają się zgodnie z opisem zamiast przechodzić w luźną interpretację.
Edycja na poziomie pikseli
Prześlij istniejący obraz i precyzyjnie zmień wybrany obszar — podmień obiekty, popraw tekst lub dopracuj detale, podczas gdy nietknięte części kadru pozostają bez zmian.
Ugruntowana wiedza o świecie
Sceny odzwierciedlają realne relacje między obiektami, materiałami i otoczeniem, więc opisane narzędzie, potrawa lub witryna sklepu wyglądają wiarygodnie, a nie jak złożone z niedopasowanych elementów.
Wyjście 4K
Generacje skalują się do 4K, dając wystarczającą rozdzielczość do układów do druku, dużych banerów i szczegółowych ujęć produktów bez osobnego kroku skalowania w workflow.
Kompozycja wielu obrazów
Połącz kilka obrazów referencyjnych w jednym żądaniu, aby scalić obiekty, umieścić produkt w nowej scenie lub zbudować kompozycję, która zachowuje rozpoznawalność każdego źródła.
Przypadki użycia GPT Image 2 API
Makiety opakowań i etykiet: Generuj pudełka, butelki i saszetki z czytelnymi nazwami marek, listami składników i drobnym drukiem umieszczonym zgodnie z promptem.
Infografiki i diagramy: Twórz wykresy, podpisane schematy i układy kroków, gdzie to tekst i struktura niosą znaczenie, a nie tylko warstwa wizualna.
Menu i tablice informacyjne: Twórz menu restauracyjne, cenniki i oznakowanie sklepów z poprawnym brzmieniem i spójną typografią dla narzędzi z branży HoReCa i retail.
Ukierunkowane edycje zdjęć: Pozwól użytkownikom zaznaczyć obszar i zmienić jeden element, np. kolor ubrania lub logo, przy zachowaniu reszty obrazu.
Komponowanie produktów: Przenieś produkt z jednego obrazu do nowego otoczenia, zachowując jego kształt i wykończenie na potrzeby katalogów e-commerce i zdjęć lifestyle.
Układy plakatów i reklam: Buduj promocyjne layouty, w których nagłówek, podnagłówek i call to action muszą pojawić się dokładnie tak, jak zapisano, i pozostać czytelne.
Koncepcje aplikacji i UI: Renderuj makiety interfejsów i pomysły ekranów z prawdziwymi etykietami przycisków i tekstem menu do aplikacji projektowych i prototypowania.
Zlokalizowane warianty zasobów: Regeneruj ten sam układ z różnymi tekstami, aby masowo tworzyć warianty językowe lub kampanijne.
Jak używać GPT Image 2 API
Pobierz klucz API: Załóż konto Pollo API i wygeneruj klucz API w panelu deweloperskim.
Wybierz model: Wysyłaj żądania do endpointu GPT Image 2 pod adresem /generation/openai/gpt-image-2-0/image.
Dodaj dane wejściowe: Przekaż prompt dla tekst-na-obraz albo podaj imageUrl lub images do edycji i kompozycji, a następnie ustaw aspectRatio, resolution (1K, 2K, 4K) i quality.
Generuj i pobieraj: Wyślij zadanie, odpytyj zwrócone taskId i status, a po powodzeniu pobierz obraz.
Najlepsze praktyki promptowania dla GPT Image 2 API
Pisz prompt jak specyfikację. Cytuj dokładny tekst, który ma zostać wyrenderowany, określ, gdzie leżą elementy, i nazwij kolory oraz materiały, aby podążanie za instrukcjami miało jasne cele.
Prosta formuła promptu
Temat i sceneria + dokładny tekst w cudzysłowie + układ i rozmieszczenie + styl i kolor + detal materiału lub oświetlenia
Na co warto zwrócić uwagę
Cytuj tekst: Umieszczaj treść, którą chcesz wyrenderować, w cudzysłowie, aby model traktował ją dosłownie, a nie jako luźny motyw.
Nazwij rozmieszczenie: Określ, gdzie powinien znaleźć się każdy element, np. górny baner lub lewy dolny róg, aby kontrolować układ.
Opisz obszar edycji: Przy edycji obrazu dokładnie określ, co zmienić, żeby nietknięte obszary pozostały bez zmian.
Ustaw proporcje na początku: Wybierz proporcje pasujące do finalnego formatu, aby kompozycja od początku była poprawnie wykadrowana.
Dopasuj rozdzielczość do zastosowania: Wybieraj 4K do druku i dużych formatów, a niższe rozdzielczości do szybszych szkiców i iteracji.
Jedna zmiana na edycję: W każdej iteracji edytuj tylko jeden element, aby wyniki były przewidywalne i czyste.
Przykładowe prompty
Opakowanie produktu
"Matowa torba na kawę z papieru kraft stojąca na jasnej drewnianej półce, przednia etykieta z napisem 'MORNING ROOT — Single Origin' pogrubioną szeryfową czcionką, z 'Net 340g' małym tekstem u podstawy. Miękkie światło dzienne, mała głębia ostrości, ujęcie produktu 4K."
Infografika z etykietami
"Czysta infografika w płaskim stylu zatytułowana 'How Composting Works' z czterema ponumerowanymi krokami ułożonymi od lewej do prawej, każdy z prostą ikoną i krótkim podpisem. Stonowana paleta zieleni i beżu, wyraźny, czytelny tekst bezszeryfowy."
Edycja obszaru
"Korzystając z przesłanego zdjęcia witryny sklepowej, zastąp pusty wiszący szyld napisem 'AZURE BOOKS' w ciepłym, ręcznie malowanym liternictwie. Zachowaj budynek, markizę i ulicę bez zmian, dopasowując oryginalne światło dzienne i cienie."
Kompozycja z wielu obrazów
"Połącz dostarczony obraz sneakersa i obraz studyjnego tła tak, aby sneaker znalazł się centralnie na odbijającym światło postumencie, z reflektorem z lewego górnego rogu i subtelnym odbiciem na podłodze, zachowując dokładną kolorystykę buta i detale przeszyć."
GPT Image 2 vs Google Imagen 4 vs FLUX.1 Kontext
Możliwość
GPT Image 2
Google Imagen 4
FLUX.1 Kontext
Renderowanie tekstu w obrazie
✅ Mocny w długim i drobnym tekście
✅ Dobra typografia
⚠️ Skupiony na edycji, słabszy tekst
Podążanie za instrukcjami
✅ Radzi sobie ze szczegółowymi promptami wieloelementowymi
✅ Solidna zgodność
✅ Mocny przy instrukcjach edycji
Edycja na poziomie pikseli
✅
⚠️ Ograniczona
✅ Kluczowa mocna strona
Kompozycja wielu obrazów
✅
❌
⚠️ Oparta na referencjach
Maksymalna rozdzielczość
Do 4K
Do klasy 2K
Do klasy 4MP
Polecane do
Zasobów z dużą ilością tekstu i precyzyjnych edycji
Generacji fotorealistycznej
Iteracyjnej edycji obrazu
Dlaczego warto wybrać GPT Image 2 API?
GPT Image 2 pasuje do produktów, które potrzebują czytelnego tekstu i wiernych edycji — od opakowań i infografik po precyzyjne zmiany wybranych obszarów — wszystko w rozdzielczościach wystarczających do druku.
Przez Pollo API uzyskujesz dostęp do GPT Image 2 jednym kluczem API obok ponad 300 wiodących modeli obrazów i wideo, z przejrzystą dokumentacją, odpytywaniem statusu zadań i generowaniem, które kosztuje mniej niż Fal AI.
Zacznij od endpointu GPT Image 2 w Pollo API, aby wdrożyć funkcje obrazów z dokładnym tekstem, a następnie porównaj go z Imagen, FLUX i innymi bez ruszania integracji.
FAQ GPT Image 2 API
Czym jest GPT Image 2?
GPT Image 2 to model obrazowy OpenAI znany z dokładnego tekstu w obrazie, mocnego podążania za instrukcjami i edycji na poziomie pikseli, obsługujący tekst-na-obraz, edycję obrazu i kompozycję wielu obrazów do 4K.
Czy GPT Image 2 API niezawodnie renderuje tekst?
Tak. To jedna z jego kluczowych mocnych stron — dobrze radzi sobie z nagłówkami, etykietami i drobnym drukiem, dzięki czemu świetnie nadaje się do opakowań, menu, plakatów i infografik.
Czy może edytować istniejący obraz?
Tak. Prześlij obraz i opisz zmianę, a model edytuje wskazany obszar, zachowując resztę kadru bez zmian.
Jakie rozdzielczości i proporcje obrazu są obsługiwane?
Wyjście skaluje się do 1K, 2K lub 4K, a proporcje — od kwadratu i pionu po panoramiczne i ultrapanoramiczne — wybierasz dla każdego żądania.
Czy może łączyć wiele obrazów?
Tak. W jednym żądaniu możesz przekazać kilka obrazów referencyjnych, aby scalić obiekty lub umieścić produkt w nowej scenie, zachowując rozpoznawalność każdego źródła.
Dlaczego uruchamiać GPT Image 2 przez Pollo API?
Pollo API daje jedną integrację dla GPT Image 2 i ponad 300 innych modeli, z przejrzystą dokumentacją, śledzeniem zadań i tańszym generowaniem niż u porównywalnych dostawców.