GPT Image是由OpenAI开发的一系列图像生成与编辑模型。GPT Image是GPT系列中文本转图像的一个变体,运用深度学习技术,能够依据自然语言描述或现有图像,精准地生成数字图像。GPT Image是DALL-E的继任者,已作为ChatGPT Images功能原生集成于ChatGPT中,同时也可通过API供外部调用。GPT Image于2025年3月发布后迅速在社交媒体上走红,尤以其能够生成吉卜力工作室风格图像的能力而备受瞩目。此外,GPT Image也已集成至Microsoft Copilot和Apple Intelligence服务中。
歷史
OpenAI 於2025年3月25日的部落格文章中公開了 GPT Image 的首個模型,稱之為「GPT-4o圖像生成」(GPT-4o image generation),該模型是基於 GPT-4o 模型開發以生成圖像。 該功能最初僅開放給付費使用者,由於需求量極大,向免費使用者的推送被推遲。 隨後該功能的使用受到限制,萨姆·奥尔特曼表示由於使用量過大,GPU「快融化了」。 OpenAI 隨後表示,在發布首週內,全球超過1.3億名使用者已生成了超過7億張圖片。 該模型被命名為 GPT Image 1(gpt-image-1),並於4月23日導入至 API 中。一款具備成本效益的版本 GPT Image 1 Mini(gpt-image-1-mini)於10月6日(即2025年 OpenAI 開發者大會)發布,其 API 費用比 GPT Image 1 便宜 80%。
名為 GPT Image 1.5(gpt-image-1.5)的新模型於12月16日推出,該模型以「ChatGPT Images」之名向全球所有使用者推送,並隨即開放 API 存取。 OpenAI 聲稱該新模型能夠在保持細節完整的同時進行精確編輯,且生成圖像的速度最高可達原先的四倍。與 GPT Image 1 相比,GPT Image 1.5 的 API 圖像輸入與輸出費用降低了 20%。
2026年4月,OpenAI 發布了 GPT Image 2(gpt-image-2),在其生成過程中引入了推理模型。
功能
不同於 DALL-E 2 與 DALL-E 3 等基於扩散模型的先前版本,GPT Image 模型屬於自我迴歸模型,並具備多項新功能,包含影像編輯轉換、先進的照相寫實主義,以及精確遵循指令的能力。 GPT Image 能夠生成三種尺寸的圖像,分別為 1024 × 1024(1:1,正方形)、1536 × 1024(3:2,橫向)以及 1024 × 1536(2:3,直向)像素。
GPT Image 1.5 解決了先前模型中存在的過早裁切(premature cropping)以及偏暖色調的問題,
参考来源
外部連結
- [https://chatgpt.com/images ChatGPT Images 2.0]
- [https://developers.openai.com/api/docs/models/all#image OpenAI image models] - including GPT Image 1, 1.5 and 2
- [https://chatgpt.com/g/g-6940a876d5f4819186b4668deabcd580-4o-imagegen 4o ImageGen] - the official custom GPT for GPT Image 1
评论 (0)