Imagen

ImagenImagen 2Imagen 3是由Google DeepMind開發的文字轉圖像模型。在2023年4月Google Brain與Google DeepMind合併前,該模型由Google Brain 負責開發。Imagen主要用於從文字提示生成圖像,類似於Stability AI的Stable Diffusion、OpenAI的DALL-E或Midjourney。

該模型的初代版本最早於2022年5月的一篇論文中介紹。它能產生高品質圖像,目前任何擁有Google帳號的使用者皆可透過Gemini、ImageFX和Vertex AI等服務使用此工具

歷史
Imagen的初代版本於2022年5月首次在一篇論文中發表,具備從自然語言生成高保真圖像的能力。其突出特點是能生成文字與標誌圖像。 Imagen 3則於2024年8月推出,Google表示此新版在細節與光影呈現方面有明顯提升。

技術
Imagen 運用了兩項關鍵技術:

第一,採用了基於Transformer架構的大型語言模型,尤其是,用以理解文字並對其進行編碼,供圖像生成之用;

第二,使用階層式擴散模型進行高保真圖像生成。其生成流程分為三個階段:先產生64x64的基礎圖像,接著依序升級至256x256與1024x1024。

功能
Imagen可依文字提示生成寫實風格圖像。它也支援多種風格,包括電影感、35毫米膠片風、插畫風和超現實風。該模型可輸出五種畫面比例:9:16、3:4、1:1、4:3、16:9。此外,Imagen還可透過修改文字提示來編輯已生成的圖像。

參見

  • 人工智慧藝術
  • 生成藝術
  • Midjourney
  • DALL-E
  • 穩定擴散

參考資料
外部連結

评论 (0)

  • 还没有评论,来抢沙发吧。