Imagen、Imagen 2和Imagen 3是由Google DeepMind開發的文字轉圖像模型。在2023年4月Google Brain與Google DeepMind合併前,該模型由Google Brain 負責開發。Imagen主要用於從文字提示生成圖像,類似於Stability AI的Stable Diffusion、OpenAI的DALL-E或Midjourney。
該模型的初代版本最早於2022年5月的一篇論文中介紹。它能產生高品質圖像,目前任何擁有Google帳號的使用者皆可透過Gemini、ImageFX和Vertex AI等服務使用此工具
歷史
Imagen的初代版本於2022年5月首次在一篇論文中發表,具備從自然語言生成高保真圖像的能力。其突出特點是能生成文字與標誌圖像。 Imagen 3則於2024年8月推出,Google表示此新版在細節與光影呈現方面有明顯提升。
技術
Imagen 運用了兩項關鍵技術:
第一,採用了基於Transformer架構的大型語言模型,尤其是,用以理解文字並對其進行編碼,供圖像生成之用;
第二,使用階層式擴散模型進行高保真圖像生成。其生成流程分為三個階段:先產生64x64的基礎圖像,接著依序升級至256x256與1024x1024。
功能
Imagen可依文字提示生成寫實風格圖像。它也支援多種風格,包括電影感、35毫米膠片風、插畫風和超現實風。該模型可輸出五種畫面比例:9:16、3:4、1:1、4:3、16:9。此外,Imagen還可透過修改文字提示來編輯已生成的圖像。
參見
- 人工智慧藝術
- 生成藝術
- Midjourney
- DALL-E
- 穩定擴散
參考資料
外部連結
- [https://deepmind.google/technologies/imagen-3/ Imagen 3 website]
- [https://deepmind.google/technologies/imagen-2/ Imagen 2 website]
评论 (0)