又過了二十分鐘,進度條走到100%,所有節點全亮了。
“併網成功!”運維組的人聲音裡帶了點激動,“所有節點通訊正常,時延符合預期,沒有丟包。”
張磊一拳砸在手掌上:“太好了!比我們預想的還快!”
陳序點了點頭,轉頭對旁邊的安保人員說:“通知老林,可以動手了。”
電話打過去不到十分鐘,老林的訊息就回來了:“人抓到了,三個,都是歌園駐滬辦事處的,車上搜出來三臺訊號干擾器,還有一套密碼破解裝置,身上搜出來一張列印的超算節點佈局圖,還沒傳出去。”
“帶回來,先關在安保室,等我們這邊測試完了再審。”陳序掛了電話,轉頭對張磊說,“接入風險排除了,啟動大模型訓練吧。”
張磊早就等著這句話了,當即跟運維組的人點頭:“把訓練資料集導進去,啟動百億引數大模型訓練任務。”
任務提交的瞬間,螢幕上的算力佔用率一下子跳了上去,各個節點的負載曲線穩穩往上走,沒有一點波動。
“你看這排程,”運維組的人指著螢幕笑,“比之前用進口晶片的時候順多了,之前一啟動大模型訓練,總有幾個節點負載突高,現在全是平的。”
陳序盯著算力曲線看了一會,確實穩。自研AI訓練晶片的並行排程優勢在這種大規模叢集上體現得淋漓盡致,冗餘資料少,快取呼叫快,能耗也比進口晶片低一截。
訓練進度條走得比預估的快,原本預計要36小時才能完成的首輪訓練,過了18小時就走到了頭。
天快亮的時候,運維組的人喊了一聲:“訓練完成!正在出核驗報告!”
所有人都湊了過去,螢幕上跳出一行行資料,張磊拿筆在本子上記,越記眼睛越亮。
“我靠,”他忍不住爆了句粗,“訓練效率比進口晶片叢集高了42%?比原定進度提前了18小時?”
“基礎效能核驗出來了,”運維組的人滑動滑鼠,聲音都在抖,“達到國際頂尖水平的97%!就差一點!”
機房裡靜了兩秒,接著爆出一陣低低的歡呼。有人拍了拍旁邊人的肩膀,有人攥著拳頭揮了揮。
陳序的嘴角也往上翹了點,他瞅著螢幕上的效能引數,開口道:“晶片的優勢終於落地了,咱們的通用大模型,馬上就能站到世界第一梯隊。”
張磊笑得合不攏嘴,拿著筆的手都有點抖:“這還只是首輪訓練,再調幾輪引數,超過國際水平根本不是問題!”
“先把核驗資料備份,”陳序轉頭對運維組的人說,“多存幾個地方,然後做一次全量複測,確認所有引數都沒難處。”
“好嘞!”
運維組的人立刻動起來,導資料的導資料,啟動複測的啟動複測。張磊拉著幾個研究員蹲在旁邊,對著核驗報告討論後續的最佳化方向。
過了大概半小時,負責複測的技術人員突然“咦”了一聲。
陳序看過去:“怎麼了?”
“陳組長,你過來看看,”那技術人員指著螢幕上的核心邏輯層引數,眉頭皺得緊緊的,“這裡好像有個異常引數,不是我們寫的,訓練日誌裡也沒記錄來源。”
陳序走過去,盯著螢幕上那串孤零零的紅色數值,眼神沉了下來。
窗外的天剛矇矇亮,機房的冷風吹得人後頸發涼,那串異常引數像根針,紮在滿屏的綠色達標資料裡,格外顯眼。








