{{Infobox custom computer
| Image =
| Caption =
| Dates = 2012年10月29日開始運作
2019年8月2日退役
| Operators = 美國能源部、美國國家海洋和大氣管理局、克雷公司
| Sponsors = 出資:美國能源部、美國國家海洋和大氣管理局(15次浮點運算),然而,在2012年11月的LINPACK基準效能測試中卻僅取得17.59petaFLOPS的成績(每秒17.59×1015次浮點運算),直到2013年6月在Top500位列第一的排名被中國的天河二號取代。儘管如此,無論從效能上抑或是能效比上來說,仍然要比同時期的其它超級電腦更勝一籌。
泰坦可用於任何目的的資料處理。然而,資料處理任務的優先級,需要基於三個方面的考量:任務計劃的重要度、任務計劃對異構運算的利用潛力以及任務計劃的運算程式源碼與其它超級電腦的相容性。經過篩選排程後,選中六個運算計劃,這六個「前鋒」計劃在泰坦開放使用後由泰坦依排程執行處理,這些處理任務多為關於奈米科技或氣候模型。不過其它沒被選為首先處理的任務計劃,仍會進行優先級排程,進入等候貯列,以待泰坦的運行處理。由於以圖形處理器來處理資料,基於圖形處理器擁有比中央處理器多得多的執行緒的理由,不少程式需要進行源碼變動處理以適應新的混合架構,這些處理常常需要有更高階的運算平行度,而這些變更甚至也可以在以中央處理器為主的超級電腦上獲得效能的提升。
泰坦於2019年6月30日截止受理運算任務,並於同年的8月2日正式退役,而日後泰坦的計算任務將會由高峰接手。泰坦拆除後留下的空間將進行擴展並安裝同樣採用AMD處理器的前沿(英文:Frontier)超級電腦,而前沿預計於2021年完工,屆時將成為繼Summit之後的第二代AI系統。
歷史介紹
泰坦是橡樹嶺實驗室美洲虎超級電腦的升级版。美洲虎初期純粹使用中央處理器,而後期也以圖形處理器輔助中央處理器運算。
原美洲虎升級計劃
為了在保持效能功耗比的情況下提升資料處理效能,原來的美洲虎超級電腦在2005年落成後不久時已經制定了多种升級方案,當時美洲虎仍使用主機平台,峰值運算效能為25teraFLOPS。2008年美洲虎的Cray XT3主機平台升級主機平台,峰值效能也提升至263teraFLOPS;2009年繼續升級至主機平台,峰值效能為1.4petaFLOPS。
泰坦建造計劃
2005年當美洲虎落成時,橡樹嶺國家實驗室已計劃打造一台達到20petaFLOPS效能級別的超級電腦,而以傳統的中央處理器架構來實作在當時來說有不低的難度和成本,因此選擇以中央處理器+圖形處理器的混合架構方案,儘管這個方案直到2010年才得以實作,2011年以後計劃將升級後的美洲虎更名為泰坦。2010年11月16日在非正式私人會議上公布了美洲虎的大升級計劃(亦即泰坦的建造),在會議的前一年(2009年)還和NVIDIA簽署通用圖形處理器的供應協議。2011年10月11日對外宣布開始第一階段的升級。最初的計劃是將新建一個佔地15,000平方米(160,000平方英尺)的新機房,來置放升級後的美洲虎,但最後限於預算而取消,改為沿用美洲虎現有的基礎設施。
2011年10月9日,美洲虎的主機開始了為期一年的汰換升級,完全升級後的超級電腦會重命名為“泰坦”。
第一階段
第一階段的升級主要是更換新的中央處理器。
2011年10月至12月期間,美洲虎200個機櫃中的96個機櫃中裝備的Cray XT5平台主機(刀鋒伺服器,配置為每節點兩顆6核心的AMD Opteron處理器)升級為平台主機(刀鋒伺服器,配置為每節點一顆16核心的Opteron 6274處理器),其它剩餘的機櫃仍照常運作。同年12月,所有運算任務轉移至96個已更換Cray XK6主機平台的機櫃中,剩餘的104個機櫃中的主機均升級Cray XK6。系統內部連線(允許各節點的處理單元相互溝通的網路)也被升級,橡樹嶺國家實驗室的ESnet網路連線的頻寬也升級為100Gb/s,以便更快地從其它實驗室、大學和研究機構進行資料交換。系統記憶體容量也隨著Cray XK6主機平台的升級而翻倍擴增至600TB,其中有960台Cray XK6主機(佔用10個機櫃)還裝有以NVIDIA Fermi架構顯示核心(即用於NVIDIA GeForce 400/500系列顯示卡的圖形處理器)為基礎的NVIDIA Tesla運算加速卡。這960個節點作為泰坦日後硬體配置的參考,並用來為日後泰坦的完全升級測試程式源碼。美洲虎至泰坦的第一階段的升級使得這台超級電腦的峰值效能從2.3petaFLOPS提升至3.3petaFLOPS,這個階段下這台超級電腦仍稱為美洲虎。)裝進美洲虎超級電腦的Cray XK6平台主機中,每節點一塊,更換圖形處理器後Cray XK6平台更名為平台。中央處理器維持不變,仍為16核心的Opteron 6274處理器。同年10月底基本完工並且將這台超級電腦更名為泰坦。
測試驗收
「泰坦」在2013年初接受驗收測試,但只完成了92%的測試項目,低於原來通過95%的測試項目的要求。後來檢查發現,導致測試出現問題的是主機板的PCI-E插槽內的金手指連接器虛焊或焊接部位出現裂縫。對於這個問題,克雷公司按照合同要求承擔修復所需費用,並且以每星期12到16個機櫃的速度修復這個缺陷。2013年4月8日,橡樹嶺國家實驗室宣布修復工作已完成,預計2013年5月完成最後的驗收測試項目。6月12日,橡树岭实验室宣布泰坦已经完成了测试。
資金和建造
泰坦的升級建造仍由美洲虎的承建商克雷公司來負責進行,其主要資金來源是美國能源部下屬的橡樹嶺國家實驗室。當時實驗室的資金用來升級中央處理器的話是十分充足的,但剩下的資金就不足夠用來購置18,688塊通用圖形處理器(運算加速卡),因此美國國家海洋和大氣管理局也同意出資填補資金缺口,但需要以一定的使用權和使用時限作為回報。橡樹嶺實驗室的科學計算負責人傑夫·尼科爾斯(Jeff Nichols)表示「泰坦花了實驗室大約6千萬美元,後來國家海洋和大氣管理局的出資不足1千萬美元,但是具體數字則因為保密協議就不便公開了。」
2013年3月份,輝達發布了消費級市場最強單晶片顯示卡——GeForce GTX Titan,使用和泰坦超級電腦上使用的Tesla K20X運算卡相同的「GK110」圖形處理器。與超級電腦共用一個型號的顯示核心、保留完整的通用運算能力,是這款顯示卡的最大賣點之一,主要針對民間對遊戲圖形和科學運算都有需要的發燒級玩家。,隨後還陸續發布了GeForce GTX TITAN Black Edition以及單卡雙GPU的GeForce GTX TITAN Z。還有玩家用其來進行位元幣挖礦操作。
未來
原計劃泰坦將在2018年被新建造的超級電腦高峰(Summit)取代,或由泰坦改造升級,不過最終高峰因需要另建基礎設施而於另外的機房中建造,使得泰坦得以保留繼續服役。這台新的超級電腦由IBM承建,使用更少的運算節點,每個節點配備更強力的通用圖形處理器提供更強的運算能力;而且還配備固態非易失性存儲裝置,作為來自分散式檔案系統的檔案資料快取。
硬體配置
機架、電源供應
泰坦超級電腦使用和美洲虎超級電腦相同的200個機櫃的設計,佔地404平方米,基本上只是更換了機櫃和佈線。沿用改進自美洲虎超級電腦的電力供應系統和冷卻系統,節省了能源部/實驗室約兩千萬美元的經費。比美洲虎高出了1.2兆瓦,但是泰坦提供比美洲虎快了幾乎10倍的運算效能,特別是浮點運算方面。如果兩秒內電力供應沒有恢復,柴油發電機就會在大約7秒的時間內啟動,並一直驅動飛輪,所用的空氣冷卻器,可製冷質量為6,600噸(相當於23.2兆瓦的熱功率),以5.5攝氏度(約42華氏度)的低溫冷卻水作為空氣冷卻器的散熱介質,從機櫃中帶走熱量的熱空氣會流到至空氣冷卻器冷卻,再回流進入機櫃,如此往復循環。
運算主機
完整的泰坦超級電腦上有18,688個運算節點,每部刀鋒伺服器擁有四個運算節點,24部刀鋒主機為一個機櫃。
- 每個運算節點包含:
- 每兩個節點共用一個克雷公司研發的Gemini高速互連路由器
- 整台超級電腦共299,008個處理器核心和超過710TB的記憶體容量(包括顯示記憶體,全部記憶體開啟ECC功能後共693.6TB可用);),其有效傳送速率為240GB/s。
{{Quote box |width=200px |align=right |quoted=true |bgcolor=#FFFFF0 |salign=right
|quote =你根本不能從傳統的基於CPU的架構上獲得這個級別的效能、能源效率和成本效率。加速運算是未來十年使exascale效能級別得以達成的最好而且最現實的方式。|source =
英伟达首席架構設計師
效能、能效比表現
泰坦的理論峰值效能為每秒27×1015次浮點運算(27petaFLOPS),或者是每秒2.7千萬億次運算作業。2012年11月12日,泰坦通過LINPACK基準效能測試,最終成績為每秒17.59×1015次浮點運算,TOP500最後宣布了新的第一名由泰坦超級電腦奪得,取代前任第一IBM紅杉。儘管目前的實際峰值效能和理論峰值效能相比有較大落差,但能效比仍然要比眾多超級電腦優勝。Green500也是全球500強超級電腦的排名,但不同於TOP500的是Green500是根據效能功耗比來進行排名。不過在2013年6月Top500和Green500在天河二號登入效能成績更新排名以後,泰坦的排名降至Top500的第二名,在Green500上的排名也降至29名,而泰坦並沒有進行第二次成績測試,直至現在,在Top500上的排名並沒有變化。
軟體支援
作業系統、檔案系統
泰坦超級電腦使用克雷公司基於Linux核心開發的分佈式作業系統。Cary Linux Environment作業系統由以下兩部分組成:登入管理節點為全功能Linux核心的作業系統,運算節點則是為提升效能和效率而特別優化精簡的基於輕量級Linux核心CNL(Compute Node Linux)的作業系統。檔案系統使用Lustre分散式檔案系統,代號「Spider」。
程式編寫與編譯器
不同於以往以中央處理器作主要資料處理單元或以圖形處理器輔助處理資料的超級電腦,泰坦超級電腦以圖形處理器為主要的資料處理單元。在初期,不少專案的程式源碼一般重新編寫或編譯以方便泰坦的通用圖形處理器运行,而且還要求這些源碼能相容於以中央處理器為主的系統,以便專案可以不僅可以由泰坦進行處理,還能供其它仍使用傳統中央處理器架構的超級電腦运行。
CAAR目前已和輝達以及其它程式碼提供者合作開發新版編譯器,將指令整合到供通用圖形處理器使用的程式語言當中,在泰坦上適用的編譯器有PGI(Portland Group Compiler Suite,預設使用這個)、GCC、CCE(Cray Compiling Environment)以及英特爾提供的編譯器。
目前來說,對現有科學研究專案中的代碼重寫的部分主要是多線程化、增進並行性的部分,即所謂的多核多線程優化,只是更深入、更適合通用圖形處理器的架構特性(通用圖形處理器擁有比中央處理器多得多的執行緒和更好的運算並行性)。不過這樣的程式源碼優化也適用於傳統以中央處理器為基礎的機器上,這些機器也可以從中獲得效能提升。天體物理學家兼程式員Bronson Messer,表示「一個應用程式要將泰坦的效能發揮至極限,必須尋求方法來使通用圖形處理器滿負載運作,需要明確的是通用圖形處理器儘管處理速度很快,但靈活度顯然不如中央處理器。」NRDF的程式用CUDA Fortran寫成,CUDA Fortran是Fortran語言連結CUDA指令擴充庫(NVIDIA CUDA庫)給予圖形處理器使用的Fortran改進版本。
在泰坦正式啟用的當天,時任美國能源部長朱棣文發表聲明,表示「高效能計算領先之國家,在國防、科學、醫學、能源等一系列領域均將擁有比其它不具備超級電腦的國家更為巨大的優勢,泰坦將和能源部下屬的其它超級電腦一起,成為確保美利堅合眾國之創新優勢的有力工具。」
使用計劃安排
儘管泰坦可以用於幾乎任何類型的科學研究專案,但使用請求往往超出了許可時間,因此制定出專案優先級選擇標準,其標準是:根據專案計劃的重要度來決定執行時間的選擇,這裡面若有能力充分發揮混合架構運算能力,並且還能夠在其它超級電腦上運作的,則優先考慮(即不可只讓泰坦單獨處理)。2009年,OLCF收到了50個首先使用它們的超級電腦的專案,經筛选後剩下六個成功進入候選,這六個專案中不僅是重要的科學研究專案,還賦予它們完全使用並發揮混合運算的運算能力。這六個首先使用泰坦的專案中,大部分是關於新型納米材料、氣候變化模型的研究。不過,其它未入選的專案,仍然會進入泰坦的任務排程隊列,等待泰坦的執行處理。
科學研究專案
在泰坦上首先處理的六個專案分別是「S3D」、「WL-LSMS」、「Denovo」、「LAMMPS」、「CAM-SE」和「NRDF」:
- 「S3D」是一個研究燃燒模型的分子物理學專案,研究細顆粒周圍的燃燒的情形,以提升柴油和生物燃料的發動機的燃燒效率。2009年,泰坦的前身美洲虎,獲得了一個與烴類自燃火焰和直接燃油噴射柴油發動機燃燒效率提升相關的一個已完全解決的模擬過程;
- 「LAMMPS」專案,全稱「Large-scale Atomic/Molecular Massively Parallel Simulator」(大尺寸原子/分子大規模平行模擬器),是一個關於分子動力學的研究計劃,模擬微粒從原子的尺度跨越至相對論的尺度的情形,以提高材料科學的水平以及其在半導體、原生質/生物材料、聚合物等方面的應用;
- 「CAM-SE」是兩個專案合併組成,分別是「Community Atmosphere Model」(群落大氣模型)和「High Order Method Modeling Environment」(高階方法建模環境),前者是一個全球大氣模型,後者則是求解流體和熱力學方程。這兩個專案共同協作可以以更高的精確度模擬氣候變化;
- 「NRDF」專案,全稱「Non-Equilibrium Radiation Diffusion」(非均勻放射性分佈)通過模擬並描繪超新星產生的非帶電粒子,來研究其在鐳射核融合、流體動力學、醫學成像、核子反應爐、能量存儲以及燃燒過程的研究等方面的潛在應用價值。
「VERA」專案是一個輕水反應爐的仿真,在美洲虎超級電腦上的CASL(Consortium for Advanced Simulation of Light Water Reactors,聯合輕水反應爐進階仿真)編寫並運作。VERA允許工程師監視反應爐使用壽命裡反應爐核心任何部分的效能表現和狀態,以辨別找出有研究價值或改進反應爐設計等他們感興趣的研究點。儘管不是六個先鋒計劃中的一員,但VERA將會在CAAR的協助下進行充分優化並由泰坦的管理團隊進行測試後在泰坦上繼續運作。電腦科學家湯姆·埃文斯(Tom Evans)發現,相比於以往在傳統中央處理器為主的超級電腦之間进行程式碼適應性修改以及優化作業,為泰坦的混合架構修改及優化VERA的程式碼難度十分大。儘管如此,他們的目標是要將仿真整個反應爐燃料循環的时间,從以往需要18~36個月,在泰坦上縮短至只需一個星期。
註釋
參考來源
外部連結
*
- [http://news.mydrivers.com/1/245/245519_all.htm 推土机+开普勒的威力:海图尽览超级计算机“泰坦”]
评论 (0)