7月10日,河南鄭州,國家超算互聯網核心節點,一座全新的超級算力基礎設施正式揭開面紗。隨著中科曙光宣布中國首個全國產十萬卡AI超集群——曙光8000(登峰)正式落成并接入國家超算互聯網,我國AI基礎設施建設正式從萬卡級邁入十萬卡級部署階段。近日,記者實地探訪這一核心節點,試圖解碼這一“超級工程”背后的技術突破與產業變局。
系統級創新
步入國家超算互聯網核心節點的展廳,透過巨大的玻璃幕墻,高密度環形計算機柜單元依次排開,共同構建起國內首套十萬卡超大規模集群。清晰可見的是,機柜內部,芯片完全浸沒在無色透明的冷媒中,液體沸騰產生的氣泡不斷升騰,帶走芯片運作中產生的巨大熱量。
與萬卡級系統相比,十萬卡AI超集群的部署考驗的不只是計算卡數量和理論峰值性能,更包括系統架構、網絡互連、訪存效率、能效控制和強大的生態應用能力。中科曙光高級副總裁李斌告訴中國證券報記者:“從萬卡到十萬卡,確實有很多挑戰,不是簡單的乘以10。規模大了之后,最大的難點在于能否跑出應有的性能和效率,任何一個環節的短板都會導致性能折損。”
值得一提的是,曙光8000(登峰)采用了“原生超智融合”技術路線。據李斌介紹,這套系統摒棄了傳統分區方式,真正實現了全類型計算的原生一體化融合,“面向高精度科學計算和低精度智能計算的復合需求,支持FP64到INT8全精度運算,覆蓋科學計算、大模型訓練、AI推理、工業仿真等多類場景。”
產業鏈價值重估
十萬卡集群的運行,依賴于從芯片到網絡的“系統級能力”。在展廳現場,記者看到了全國產化的算力產業鏈條全景。
在核心芯片層面,李斌介紹,所應用的6款國產芯片支撐了整個系統研制,也都達到了國際先進水平。
在高速網絡方面,中科曙光研發了400G無損網絡scaleFabric,實現了國產高端原生RDMA技術的重大突破。該產品端到端通信時延低至0.9微秒,單子網可支持超11萬卡集群部署,性能比肩行業頂尖水平。
散熱是十萬卡集群面臨的核心挑戰之一。集群搭載的浸沒相變液冷技術,幫助集群PUE值降至1.04,實現了綠色高效運行。不僅如此,李斌強調,散熱系統對于營造恒定、穩定的運行環境,增強十萬卡集群中各項零部件的可靠性十分重要。
十萬卡集群時代的到來,也引發產業鏈價值分配的系統性重構。國泰海通證券計算機行業首席分析師楊林告訴記者,算力競爭的核心已從“單卡峰值”轉向“系統效率”,“互聯架構與系統交付能力取代單卡性能,成為決定集群效率的戰略控制點。”他指出,伴隨集群規模擴大,算力基礎設施的成本結構正在重塑,十萬卡集群中,網絡、液冷、電力、機柜等基建投入占比已首次超過GPU采購成本,運營側,能效與散熱正從輔助系統升級為核心競爭壁壘。
中信證券AI基礎設施行業首席分析師孫竟耀認為,GPU間交換芯片、液冷、柜內電源的確定性較強;GPU間交換芯片在Scale-up網絡下用量暴增,液冷和柜內電源在高算力密度下價值量攀升。建議密切關注國內GPU間交換芯片的自主可控及液冷與柜內電源的價值量提升機遇。
深化應用導向
算力基礎設施的持續高投入也一度引發外界對于“算力供給是否過剩”的擔憂。李斌告訴中國證券報記者:“從結構性來看,總體這幾年還是存在算力需求。特別是今年智能體應用起來之后,算力需求量非常大,雖然有些人可能夸大其詞,但至少目前看并不是一個泡沫。”
李斌同時坦言,十萬卡集群并非是所有場景的“標配”,首先還是要考慮“應用需求導向”以及算電融合等能源布局。“比較遺憾的是現在還沒有任何一個大模型能跑到十萬卡,確實還存在一些工程化的問題,即便給模型十萬卡,但模型性能也很難提上去,下一步我們還需要跟大模型團隊做更多聯合的算法優化。”李斌說。
李斌透露,在產業合作層面,曙光8000(登峰)已和中國頭部大模型企業完成最新的大語言模型、語義模型和世界模型在萬卡級完整的預訓練工作;在推理方面,已提供400多個主流模型的線上推理服務,“如果曙光8000全部算力用于推理,將是中國最大的Token工廠,可支撐當前中國5%-10%的Token訪問需求。”展望未來,中科曙光已與北京科學智能研究院達成戰略合作,啟動第二套全國產十萬卡超智融合算力系統的研制與建設。
國海證券計算機行業首席分析師劉熹告訴記者,國內首個十萬卡集群的落成意味著我國在超大規模的集群建設能力方面已經對標海外先進水平,將極大提振我國硬科技、人工智能等行業的信心,也將推動國產算力在互聯網、金融、運營商等行業客戶大規模應用,基于國產供應鏈的服務器、交換機、存儲等產品及產業鏈生態伙伴有望受益。(記者 楊潔)
轉自:中國證券報
【版權及免責聲明】凡本網所屬版權作品,轉載時須獲得授權并注明來源“中國產業經濟信息網”,違者本網將保留追究其相關法律責任的權力。凡轉載文章及企業宣傳資訊,僅代表作者個人觀點,不代表本網觀點和立場。版權事宜請聯系:010-65363056。
延伸閱讀