2025 年 12 月 16 日,OpenAI 正式推出全新的 ChatGPT Images 功能,由最新旗艦圖像生成模型 GPT Image 1.5 驅動。
根據 OpenAI 官方公告,這是該公司「迄今為止最強大的通用文字轉圖像模型」,具備更強的指令遵循能力、更精準的編輯功能,以及更自然的視覺效果。
迎來圖文轉換的下一階段
此次更新的技術規格相當亮眼。根據 TechCrunch 報導,GPT Image 1.5 的圖像生成速度比前一代快了 4 倍,典型完成時間從過去的數十秒縮短至 5 至 8 秒。
OpenAI 應用執行長 Fidji Simo 在官方部落格中表示:「許多人與 ChatGPT 的第一次接觸,就是將文字提示轉換成圖片。這是一種神奇的體驗,能展示這項技術的能力,但聊天介面最初並不是為此設計的。」因此,OpenAI 在 ChatGPT 側邊欄推出了專屬的「Images」工作區,提供預設風格濾鏡、趨勢提示詞,以及一次性上傳個人肖像以供未來創作重複使用的功能。
四大核心優化,重新定義圖像編輯體驗
根據 OpenAI 官方文件與多家科技媒體的測試報告,GPT Image 1.5 在四個關鍵面向實現了顯著提升:
01 精準編輯與細節保留
OpenAI 強調,新模型「能更可靠地遵循指令——細節到位」,只改變使用者要求的部分,同時保持光線、構圖和人物外觀在輸入、輸出和後續編輯中的一致性。
TechRadar 的測試證實,這項功能讓「更實用的照片編輯、更逼真的服裝與髮型試穿,以及在保留原始圖像精髓的同時套用風格濾鏡和概念轉換」成為可能。
Cybernews 的研究團隊進行了實測:他們先生成一張棒球選手擊出全壘打的圖像,接著要求模型「只將球衣改成紫色和深藍色,保留所有其他特徵」。結果顯示,GPT Image 1.5 確實只改變了球衣顏色,而背景、臉部和球衣設計都完整保留,而這在過去的模型中幾乎不可能做到。
02 多步驟編輯的視覺一致性
新模型能「更精準地編輯和保留標誌與臉部」,在多次迭代編輯過程中維持關鍵視覺元素。測試資料顯示,GPT Image 1.5 在多輪編輯設定中提供「更高的視覺品質」,85% 的多步驟編輯在首次嘗試就能產生可用的輸出結果。
這項能力對企業應用至關重要。對於每月生成 500 個產品變體的中型電商平台,這項技術可將每項資產的創建時間從 45 分鐘(需要多次重新生成循環)縮短至約 10 分鐘,每年節省約 290 小時的創意勞動。
03 密集文字呈現能力躍進
OpenAI 官方文件特別強調,GPT Image 1.5「在文字呈現方面又邁進一步,能夠處理更密集和更小的文字」。這項能力讓模型能生成清晰的資訊圖表、海報和廣告素材。
然而,這項功能也有其限制:當要求生成一份 1950 年代報紙時,模型在處理大標題(如「HISTORIC SUMMIT ENDS」)時表現良好,但較小的正文文字則「完全無法辨識」。這顯示模型在文字呈現上雖有進步,但複雜排版和極小字級仍是挑戰。
04 更自然的整體視覺品質
新模型「能生成人群中眾多細小臉孔而不產生過多怪異樣貌」,且能在多次編輯中「追蹤各個元素,讓你改變圖像的一個面向,而不會讓 AI 決定改動其他部分」。
速度與品質的新平衡
對行銷與影音創作團隊而言,GPT Image 1.5 帶來顯著的效率提升,但也存在需要注意的限制。
根據外媒分析,其三大優勢包括:「大規模視覺一致性」讓品牌能安全地進行視覺迭代、「內建創意工作流程」減少應用程式切換、以及「支援活動時程的速度」讓即時內容製作成為可能——過去需要數天完成的全球行銷素材,現在能在數分鐘內批量生成。
然而,比起完全仰賴 AI,行銷、影音、創意工作者更適合將 GPT Image 1.5 定位為「日常交付物」的工具:適合廣告橫幅、主視覺或產品場景等需要穩定性的應用,而非突破性創意概念。
資料來源:OpenAI、TechRadar、Cybernews