AlphaFold(中譯名:阿爾法折疊)是Alphabet旗下Google子公司DeepMind所開發的人工智慧軟體,運用深度学习技術進行蛋白质结构预测(即從胺基酸序列推算蛋白質的三維結構)。
AlphaFold已發展出三個主要版本。AlphaFold 1於2018年12月在第13屆蛋白質結構預測關鍵評估(CASP)競賽中排名總體第一。2020年的AlphaFold 2在CASP14競賽中達到與X光晶體學等實驗方法相當的準確度,被譽為在一項困擾學界達50年的難題上取得重大突破;其成績被同儕形容為「驚人」與「變革性」,不過也有研究者強調AlphaFold解決的是結構「預測」問題,並未闡明蛋白质折叠的機制。2024年發表的AlphaFold 3進一步能預測蛋白質與DNA、RNA、配體及离子所形成之複合物的結構。此後建立的AlphaFold蛋白質結構資料庫擴充至涵蓋逾2億個蛋白質的預測結構,成為結構生物學的重要資源,該論文亦躋身近年被引用次數最高的科學文獻之列。
杰米斯·哈萨比斯與约翰·江珀因AlphaFold在「蛋白質結構預測」上的成就,於2024年與戴維·貝克共同獲得诺贝尔化学奖,貝克的另一半獎項則表彰其在計算蛋白質設計上的貢獻;哈薩比斯與江珀先前亦於2023年獲頒生命科学突破奖與拉斯克基礎醫學研究獎。
隨著定序技術的進步,取得蛋白質的胺基酸序列變得愈來愈容易且廉價,如今已知的蛋白質序列超過2億條,測定其三維結構卻困難得多。1960年代的實驗顯示,變性後的蛋白質僅憑自身序列便能重新摺回原本的結構,這意味著序列已蘊含決定結構的全部資訊,即。既然如此,僅從序列以計算方式推得結構理論上應屬可行,這一構想遂成為結構生物學數十年來追尋的目標。
然而在AlphaFold出現之前,取得結構幾乎只能仰賴實驗。蛋白質結構主要透過X光晶體學測定,另有低温电子显微镜與核磁共振(NMR)等方法,這些技術雖然精確,卻昂貴、費時,且並非所有蛋白質都能結晶或適用。除了在2018年CASP競賽中對蛋白質序列進行運算外,其程式碼並未公開。
在技術層面,托里西(Mirko Torrisi)等人於2020年的一篇綜述中,將AlphaFold 1的方法概括如下:其核心是一個距離圖預測器,以極深的殘差神經網路實作,運用220個殘差模塊處理64×64×128的表示,模型共有約2,100萬個參數;網路結合一維與二維輸入,包括多序列比對所得的演化特徵與共演化特徵,除了以精細距離直方圖形式輸出的距離圖外,還會預測每個殘基的二面角,並據此建立初步的三維結構預測。
AlphaFold 2(2020)
施加局部物理約束,此步驟僅對預測結構做輕微調整。
2020年系統的核心是一個稱為「Evoformer」的模塊,由48個區塊堆疊而成,以Transformer式的注意力机制運作。它同時維護兩種資訊表示:一為源自多序列比對、描述不同物種同源序列的「MSA表示」,一為描述蛋白質中每對胺基酸殘基之間關係的「配對表示」。
AlphaFold 3(2024)
AlphaFold 3於2024年5月8日發表,由Google DeepMind與同構實驗室共同開發,兩者皆為Alphabet的子公司。AlphaFold 3不再侷限於蛋白質,還能預測蛋白質與DNA、RNA、轉譯後修飾及部分配體與離子所形成之複合物的結構。Pairformer模塊的初步預測交由一個扩散模型生成最終結構,取代了AlphaFold 2的結構模組;該擴散模型從隨機雜訊出發,在Pairformer輸出的引導下反覆去噪,逐步生成分子結構的三維原子座標。
在多項基準測試上,AlphaFold 3的表現優於既有的專門方法。在PoseBusters蛋白質與配體對接基準上,即使不提供任何蛋白質結構資訊(盲對接),其準確度仍顯著高於傳統對接程式AutoDock Vina與RoseTTAFold All-Atom。截至2025年5月,AlphaFold 3的研究論文已被直接引用逾9,000次。
競賽
CASP13
2018年12月,DeepMind的AlphaFold以參賽隊名「A7D」在第13屆蛋白質結構預測技術評估(CASP)中排名總體第一,這是DeepMind首度跨足結構生物學領域,在CASP的全局距離測試(GDT)中取得58.9的中位數分數,領先於排名第二、第三隊伍的52.5與52.4,後兩者同樣運用深度學習估算接觸距離。就所有目標整體而言,AlphaFold 1取得68.5的GDT分數。
2020年1月,AlphaFold 1的實作與示範程式碼在GitHub上以開放原始碼發佈。不過如該網站的「讀我」檔案所述,此程式碼無法用於預測任意蛋白質序列的結構,只能用於CASP13資料集,因其特徵生成程式碼與DeepMind內部基礎設施及外部工具緊密耦合而無法開源。因此所發佈的程式碼並不適合一般用途,DeepMind當時亦未公開可供普遍使用的完整程式碼,此一情況要到AlphaFold 2發表後才改變。
CASP14
2020年11月,DeepMind的新版本AlphaFold 2贏得CASP14,在97個目標中對其中88個做出最佳預測。
CASP16
在2024年舉行的CASP16中,單域蛋白質的摺疊預測被評估為已幾近解決,所有評估單元中沒有任何目標的摺疊遭到錯誤預測。AlphaFold 2與AlphaFold 3仍居主導地位,以AlphaFold 3、或AlphaFold 2與3並用的表現優於單用AlphaFold 2,其中AlphaFold 3在信賴度估計上尤為出色,不過整體相對CASP15的進步已趨於細微。評估者同時指出,儘管單域摺疊已近乎解決,仍有若干難題尚存,包括截斷序列的建模、不規則二級結構的預測,以及對多個候選模型優劣進行排序的能力不足。AlphaFold 3於2024年5月發表時,情況一度引發爭議:其《自然》論文僅附偽代碼而未提供可執行程式碼,連審稿人在審查期間也多次請求卻無法取得程式碼,研究界因而批評其揭露程度不足以驗證論文主張或供大規模使用;《自然》則表示接受以偽代碼供審稿人審查。在科學界的要求下,AlphaFold 3的推論程式碼於2024年11月以Apache 2.0授權開源(允許商業用途),但其模型權重並未一併公開,須另行向Google DeepMind申請取得,且受限於禁止特定用途的非商業使用條款。
外界另發表了若干AlphaFold的複製品,多採寬鬆授權。針對AlphaFold 3的複製品包括字节跳动的Protenix(Apache 2.0授權)、AlQuraishi實驗室的OpenFold-3(MIT授權)以及Boltz-1/2(MIT授權)。
較舊版本也有複製品,但隨著AlphaFold 1與2原始碼開源而重要性降低。仍具參考價值的是那些修改了AlphaFold架構的模型,無論開源與否。就AlphaFold 2而言,一個著名例子是Meta的ESMFold,它以蛋白質語言模型的潛在空間取代多序列比對。此外亦有輔助AlphaFold的開源工具,一個廣受引用的例子是ColabFold,它以MMseqs2取代HHblits來加速序列搜尋,使AlphaFold流程能在上快速執行。
AlphaFold蛋白質結構資料庫
{{Infobox biodatabase
|title = AlphaFold蛋白質結構資料庫
|scope = 蛋白質結構預測
|organism = 全部UniProt蛋白質組
|center = EMBL-EBI
|citation = 。AlphaFold早期的目標是將資料庫擴充至涵蓋逾1億種蛋白質的UniRef90集合大部分;截至2022年5月15日,資料庫已含992,316筆預測。
2021年7月,UniProt-KB與隨之更新,會在有預測可用時一併顯示AlphaFold的結果。
2022年7月28日,團隊將約2億種、來自100萬個物種的蛋白質結構上傳至資料庫,幾乎涵蓋地球上每一種已知蛋白質。截至2024年,此數字為2.14億,其中2,600萬為序列完全相同的重複項,但重複項之間的預測結構可能有顯著差異。截至2025年,AFDB以AlphaFold 2進行預測,所產生的結構皆為單體,但可透過3D-Beacons API連結到其他資料庫提供的多體結構,並整合了提供快速結構搜尋的Foldseek,以及運用AlphaFold預測錯義突變後果的AlphaMissense。2025年底,AFDB進一步改版,重新設計入口介面並加入互動式三維檢視器,首度納入Swiss-Prot剪接異構體、公開各結構所用的多序列比對資料,整合來自域百科全書的逾3.6億筆結構域註解,並將資料重新同步至UniProt 2025_03版本。
AFDB衍生出多個資料庫。AlphaFill會在適當之處為AlphaFold模型補上辅因子,方法是在蛋白質資料庫中搜尋相似結構,再將輔因子移植至類似位置。TmAlphaFold將AlphaFold模型對接至生物膜,功能類似OPM對蛋白質資料庫結構所做的處理;AFTM則運用AlphaFold模型辨識人類蛋白質中的跨膜區域,功能類似PDBTM對蛋白質資料庫結構所做者。ChannelsDB 2.0則利用蛋白質資料庫或AlphaFill模型,計算分子抵達酶活性位、或穿越跨膜孔道另一側可能採取的路徑。由於AFDB不隨UniProt序列變動而更新,AlphaSync會使AFDB與UniProt條目的變更保持同步,生成更新後的結構、殘基層級特徵與接觸資訊,並補上AFDB缺漏的大型蛋白質(殘基逾2,700個)及含特殊FASTA字元的蛋白質。域百科全書(TED)將的結構域辨識方法套用於AFDB中1.88億個獨特結構,辨識出近3.65億個結構域,較序列方法所能辨識者多出約1億個。
另有一些並非直接衍生自AFDB、但同樣以AlphaFold為基礎的資料庫。isoform.io收錄了以AlphaFold 2生成、涵蓋人類基因組中推定剪接異構體的結構,包含237,275條人類轉錄本的資訊,曾用於偵測若干基因mRNA預測中的錯誤。
效能、驗證與限制
AlphaFold呈現出若干限制。就AlphaFold 1、2及AlphaFold資料庫而言,資料庫僅提供單一蛋白質鏈(單體)的模型,而非其具生物意義的複合物。AlphaFold為每個殘基輸出一項稱為pLDDT的預測局部信賴度分數(0至100),並以「預測對齊誤差」(predicted aligned error,PAE)評估不同結構域相對位置的可信度。另有研究以部分成功的結果,驗證AlphaFold 2能預測點突變對結構的影響與自由能。
就AlphaFold 3而言,其在多項基準測試中預測小分子與蛋白質結合模式的平均表現優於傳統的搜尋式對接演算法。研究亦顯示,AlphaFold 3雖能聯合建模蛋白質與配體的共摺疊,但在與訓練資料相似度低的測試案例上準確度明顯下滑,而這正是藥物研發格外看重的領域。另有研究發現,AlphaFold對於藉由改變結合口袋物理化學性質所生成的對抗性誘餌並不敏感,顯示其可能倚賴對訓練集的記憶,而非真正理解化學。
在更一般的層面上,由於演算法中殘基可自由移動、不受約束,建模時鏈的完整性未獲維持,AlphaFold因而可能產生拓撲錯誤的結果,例如帶有任意數目結點的結構。此外,模型某種程度上倚賴來自相似蛋白質的共演化資訊,因此在合成蛋白質或與訓練資料庫同源性極低的蛋白質上可能表現不佳。基準測試支持這項限制:套用於自然演化出的從頭蛋白質時,AlphaFold 2常給出低信賴且因預測器而異的模型;對於孤兒蛋白質,基於蛋白質語言模型的無比對結構預測器往往表現得比AlphaFold 2更好。蛋白質本質上具動態性,取得多種天然構型往往是理解其功能的關鍵,然而模型呈現這些替代構型狀態的能力有限,尤以在生物環境中共存或相互轉換的構型為然。具體而言,AlphaFold 2對蛋白結構的預測,與加州大學柏克萊分校研究者以低溫電子顯微鏡測定的結構十分相近;該蛋白被認為有助於病毒在複製後突破宿主細胞,並在觸發感染的發炎反應中扮演角色。
除了直接預測未知結構,AlphaFold也顯著改變了實驗結構生物學的工作流程。在X光晶體學中,AlphaFold 2模型大幅提升了分子置換求解相位的成功率,一項針對215個以實驗相位法解出結構的研究顯示,其中208例可用AlphaFold模型完成分子置換,且約87%經自動精修得到高品質模型;在低溫電子顯微鏡中,AlphaFold的預測也被用於在解析度較低的電子密度圖中輔助建構原子模型。
在商業層面,AlphaFold 3的共同開發者、同屬Alphabet旗下的Isomorphic Labs以AI驅動的藥物研發為業務。2024年初,該公司與藥廠禮來及诺华達成合作,運用相關技術針對特定疾病靶點開發小分子療法;其中與禮來、諾華的合作預付款分別為4,500萬與3,750萬美元,連同各階段里程碑款項的潛在總值接近30億美元。
評價
學界反應
AlphaFold 2在CASP的GDT測試中得分超過90,被視為计算生物学領域的重大成就,各國主要報紙亦廣泛報導此事。一個常見的主題,是這種依據胺基酸序列預測蛋白質結構的能力預期將惠及生命科學,加速藥物研發並促進對疾病的理解與拉斯克基礎醫學研究獎。二人其後於2024年因在「蛋白質結構預測」上的成就,與華盛頓大學的戴維·貝克共同獲得諾貝爾化學獎。批評者也指出,AlphaFold 2約有三分之一的預測準確度仍嫌不足,且模型並未揭示摺疊背後的物理規則。此外,即使取得了一個蛋白質的結構,要進一步理解它的功能以及它如何嵌入更廣的生物過程,往往仍相當困難。綜合而言,論者多將AlphaFold 2定位為一項重大的技術躍進與智識成就,而非對整個蛋白質摺疊問題的完整解答。
對領域的影響
AlphaFold的影響在其後數年持續擴大。它催生出一整個由開源重製版本與專用工具構成的生態系,各方競相以更寬鬆的授權重現或擴充其能力。回顧性的評估認為,AlphaFold已實質改變實驗結構生物學的工作方式,並加速生命科學多個領域的研究。至於DeepMind起初未完全公開AlphaFold 2程式碼所引發的批評,也隨著2021至2022年間程式碼陸續開源而漸趨平息。
相關條目
- Folding@home
- Rosetta@home
- Foldit
- IBM藍色基因
*
資料來源
延伸閱讀
*
*
*
*
*
评论 (0)