在Pollo API 上執行GPT Image 2
GPT Image 2 的優點在於能夠清楚呈現影像中的文字。標題、標籤和小字都能清楚顯示,因此海報、包裝和圖表等都可以直接使用。
借助Pollo API 上的GPT Image 2 ,開發者可以向其Apps添加文字轉圖像、圖像編輯和多圖像合成功能,產生高達 4K 的輸出,並可根據請求選擇寬高比。
GPT Image 2 API 的主要特性
可靠的圖像內文本
標題、說明文字和密集標籤的排版保持一致,使模型適用於選單、資訊圖表以及任何需要文字清晰易讀而非僅供裝飾性填充的佈局。
極端指令遵循
冗長而詳細的提示會被嚴格遵守,因此具體的物體數量、位置、顏色和文字短語都會按照描述呈現,而不是偏離到隨意的解釋。
像素級編輯
輸入現有影像並精確更改區域,交換物件、調整文字或細化細節,同時保持畫面中未觸及的部分不變。
紮實的世界知識
場景反映了物件、材料和環境之間的真實關係,因此所描述的工具、餐具或店面看起來合情合理,而不是由不匹配的部件組裝而成。
4K 輸出
Generations 可擴展至 4K,無需在工作流程中單獨進行放大步驟,即可為印刷佈局、大型橫幅和詳細的產品照片提供足夠的解析度。
多影像合成
將多個參考影像合併到一個請求中,以合併主體、將產品放置到新場景中,或建立一個保持每個來源可辨識的合成影像。
GPT Image 2 API 的應用案例
- 包裝和標籤模型: 產生盒子、瓶子和袋子,並按照提示中的指定位置添加清晰易讀的品牌名稱、成分列表和小字。
- **資訊圖表和示意圖:**製作圖表、標籤的示意圖和步驟佈局,其中文字和結構承載意義,而不僅僅是視覺效果。
- 菜單和標誌: 為餐飲和零售工具建立餐廳菜單、價格板和商店標牌,確保措辭準確、排版一致。
- **定向照片編輯:**允許使用者選擇一個區域並更改一個元素,例如重新著色服裝或替換徽標,同時保留其餘部分。
- 產品合成: 將產品從一張圖片拖放到新的場景中,保持其形狀和外觀,適用於電子商務目錄和生活方式圖片。
- 海報和廣告版面: 製作宣傳版面時,標題、副標題和行動號召必須按原樣顯示,並保持清晰易讀。
- **應用程式和使用者介面概念:**渲染介面模型和螢幕創意,包含真實的按鈕標籤和選單文本,用於Apps的設計和原型製作。
- 在地化資產變體: 使用不同的文字重新產生相同的佈局,以大規模產生語言或廣告系列變體。