Stable Diffusion是2022年發布的深度學習文本到图像生成模型。它主要用於根據文本的描述產生詳細圖像,儘管它也可以應用於其他任務,如內補繪製、外補繪製,以及在提示詞指導下產生圖生圖的转变。
它是一種擴散模型,由慕尼黑大學的CompVis研究團體開發的各種生成性人工神經網絡之一。 截至2022年10月,StabilityAI籌集了1.01億美元的資金。
Stable Diffusion的源代碼和模型權重已分别公開發布在GitHub和Hugging Face,可以在大多數配備有適度GPU的電腦硬件上運行。而以前的專有文生圖模型(如DALL-E和Midjourney)只能通過雲端運算服務訪問。)通過使用模型的擴散去噪機制(diffusion-denoising mechanism)。
Stable Diffusion建議在10GB以上的显存下運行,
但是显存較少的用戶可以選擇以float16的精度加載權重,而不是默認的float32,以降低显存使用率。 Stable Diffusion模型是在由512×512分辨率圖像組成的數據集上訓練出來的, Stable Diffusion 2.0版本後來引入了以768×768分辨率圖像生成的能力。更具實驗性或創造性的用例可以選擇較低的值,而旨在獲得更具體輸出的用例可以使用較高的值。 與使用強調符(emphasis marker)相比,使用反向提示詞在降低生成不良的圖像的頻率方面具有高度統計顯著的效果;強調符是另一種為提示的部分增加權重的方法,被一些Stable Diffusion的開源實現所利用,在關鍵詞中加入括號以增加或減少強調。
圖生圖
Stable Diffusion包括另一個取樣腳本,稱為"img2img",它接受一個提示詞、現有圖像的文件路徑和0.0到1.0之間的去噪強度,並在原始圖像的基礎上產生一個新的圖像,該圖像也具有提示詞中提供的元素;去噪強度表示添加到輸出圖像的噪聲量,值越大,圖像變化越多,但在語義上可能與提供的提示不一致。 相反,外補繪製(outpainting)將圖像擴展到其原始尺寸之外,用根據所提供的提示詞生成的內容來填補以前的空白空間。 用戶擁有其生成的圖像的權利,並可自由地將其用於商業用途。
模型训练
Stable Diffusion是在LAION-5B的圖片和標題對上訓練的,LAION-5B是一個公開的數據集,源自從網絡上抓取的數據。該數據集由創建,LAION是一家德國非營利組織,接受StabilityAI的資助。 該模型最初是在LAION-5B的一個大子集上訓練的,最後幾輪訓練是在「LAION-Aesthetics v2 5+」上進行的,這是一個由6億張帶標題的圖片組成的子集,人工智能預測人類在被要求對這些圖片的喜歡程度打分時至少會給5/10打分。 這個最終的子集也排除了低分辨率的圖像和被人工智能識別為帶有水印的圖像。 對該模型的訓練數據進行的第三方分析發現,在從所使用的原始更廣泛的數據集中抽取的1200萬張圖片的較小子集中,大約47%的圖像樣本量來自100個不同的網站,其中Pinterest佔8.5%子集,其次是WordPress,Blogspot,Flickr,DeviantArt和維基共享資源等網站。
該模型是在亞馬遜雲計算服務上使用256個NVIDIA A100 GPU訓練,共花费15萬個GPU小時,成本為60萬美元。
終端用戶微調訓練
為了糾正模型初始訓練的局限性,終端用戶可以選擇實施額外的訓練,以微調生成輸出以匹配更具體的使用情況。有三種方法可以讓用戶對Stable Diffusion模型權重存檔點進行微調:
- 「嵌入」(Embedding)可以從用戶提供的一些圖像被訓練出來,並允許模型在提示詞中使用嵌入的名稱時生成視覺上相似的圖像。嵌入是基於2022年臺拉維夫大學的研究人員在輝達的支持下開發的「文本倒置」(Textual Inversion)概念,其中模型的文本編碼器使用的特定標記的矢量表示與新的偽詞相關聯。嵌入可以用來減少原始模型中的偏差,或模仿風格。
- 「超網路」(Hypernetwork)是NovelAI軟件開發員Kurumuz在2021年創造的一種技術,最初用於調節文本生成的Transformer模型,它能讓Stable Diffusion衍生的文生圖模型模仿各種特定藝術家的風格,無論原始模型能否識別此藝術家,通過在較大的神經網路中的不同點應用一個預訓練的小神經網路。超網路將文生圖或圖生圖結果導向特定方向,例如加上藝術風格,當與一個較大的神經網絡結合使用時。它通過尋找重要的關鍵區域來處理圖像(例:眼睛,頭髮),然後在二級潛在空間中修補這些區域。超網路的一個缺點是它們的準確性相對較低,也有時會產生不可預知的結果。因此,超網路適用於加上視覺風格或清理人體瑕疵。
:
- DreamBooth是一個深度學習模型,由Google Research和波士頓大學的研究人員於2022年開發,可以微調模型以產生與指定主題相關的輸出圖像。
发行
社會影響
由於藝術風格和構圖不受版權保護,因此通常認為使用Stable Diffusion生成藝術品圖像的用戶不應被視為侵犯視覺相似作品的版權,绝大部分的画作作者也没有授权允许用他们的作品训练ai,这将导致画师的失业。 而且諸如可識別的品牌標識等知識產權仍然受到版權保護。儘管如此,藝術家們表示擔心Stable Diffusion等模型的廣泛使用最終可能導致人類藝術家以及攝影師、模特、電影攝影師和演員逐漸失去與基於人工智能的競爭對手的商業可行性。
StabilityAI的首席執行官Emad Mostaque解決了該模型可能被用於濫用目的的擔憂,他解釋說:「人們有責任了解他們在操作這項技術時是否符合道德、道德和法律」,
}}
外部鏈接
- [https://huggingface.co/spaces/stabilityai/stable-diffusion Stable Diffusion演示]
- [https://poloclub.github.io/diffusion-explainer/ Interactive Explanation of Stable Diffusion]
- [https://github.com/AUTOMATIC1111/stable-diffusion-webui AUTOMATIC1111的開源Stable Diffusion網絡用戶界面(支持繁體中文,簡體中文)]
评论 (0)