IT之家 3 月 12 日消息,中科曙光今日宣布實(shí)現(xiàn)國(guó)產(chǎn)高端原生 RDMA 技術(shù)重大突破,正式發(fā)布首款全棧自研 400G 無(wú)損高速網(wǎng)絡(luò) ——scaleFabric。
該產(chǎn)品基于原生 RDMA 架構(gòu),從底層的 112G SerDes IP、硬件設(shè)備到上層的管理軟件實(shí)現(xiàn) 100% 自主研發(fā),填補(bǔ)了國(guó)內(nèi)數(shù)據(jù)中心高速網(wǎng)絡(luò)領(lǐng)域的空白,以比肩國(guó)際頂尖同類產(chǎn)品的性能表現(xiàn)。

隨著 AI 大模型訓(xùn)練與高通量推理計(jì)算需求持續(xù)擴(kuò)大,萬(wàn)卡級(jí)乃至更大規(guī)模的算力集群正成為主流形態(tài)。在大規(guī)模智算集群領(lǐng)域,RDMA(遠(yuǎn)程直接內(nèi)存訪問(wèn))網(wǎng)絡(luò)已成為算力中心的基本需求,憑借零丟包、高帶寬、低延遲等特征,可極大提升通信效率。其中,InfiniBand 憑借低時(shí)延與原生無(wú)損傳輸能力,在全球頂級(jí)超算與 AI 集群中被廣泛采用。
長(zhǎng)期以來(lái),從高速 SerDes IP、核心芯片到 IB 網(wǎng)卡、IB 交換機(jī)等設(shè)備,InfiniBand 相關(guān)產(chǎn)業(yè)鏈基本被海外廠商壟斷。
scaleFabric 是國(guó)內(nèi)首款原生無(wú)損 RDMA 高速網(wǎng)絡(luò),面向超大規(guī)模智算集群設(shè)計(jì),從核心關(guān)鍵 IP、交換芯片、網(wǎng)卡到交換機(jī)、驅(qū)動(dòng)與管理軟件均實(shí)現(xiàn)自主研發(fā),構(gòu)建起從硬件到軟件的完整技術(shù)體系。
此次發(fā)布的 scaleFabric400 系列網(wǎng)絡(luò)產(chǎn)品技術(shù)規(guī)格全面對(duì)標(biāo)英偉達(dá) NDR,部分指標(biāo)實(shí)現(xiàn)趕超。性能方面,scaleFabric400 網(wǎng)卡基于 PCIe5.0 接口,端口帶寬達(dá) 400Gbps,端到端通信時(shí)延低至 0.9 微秒;scaleFabric400 交換機(jī)單端口帶寬達(dá) 800Gbps,整機(jī)交換容量可達(dá)雙向 64Tbps,交換時(shí)延約 260 納秒,支持 800G×40 或 400G×80 端口擴(kuò)展。
穩(wěn)定性與擴(kuò)展能力上,產(chǎn)品采用基于信用的無(wú)損流控機(jī)制,從根源規(guī)避擁塞丟包風(fēng)險(xiǎn),鏈路故障恢復(fù)時(shí)間小于 1 毫秒,已支撐近萬(wàn)卡集群持續(xù)穩(wěn)定運(yùn)行驗(yàn)證超 10 個(gè)月。與英偉達(dá) NDR 相比,交換機(jī)端口密度提升 25%,網(wǎng)卡最大 QP 數(shù)支持提升 100%,單子網(wǎng)互連規(guī)模是傳統(tǒng) IB 的 2.33 倍,可支持最大 11.4 萬(wàn)卡集群部署,同時(shí)網(wǎng)絡(luò)總成本可降低 30%。
IT之家從中科曙光官方公告獲悉,在實(shí)際應(yīng)用層面,scaleFabric 目前已部署于國(guó)家超算互聯(lián)網(wǎng)鄭州核心節(jié)點(diǎn),支撐三套萬(wàn)卡級(jí) scaleX 智算集群上線運(yùn)行,總規(guī)模達(dá) 3 萬(wàn)卡。