在接下來的幾天裡,北大計算中心的GPU叢集再次滿負荷運轉。
十幾個不同版本的模型,在西張A100顯示卡上日夜不停地交叉訓練、驗證、迭代。
徐辰編寫了一個自動化的超引數搜尋指令碼,讓計算機自己去尋找那個最優的解。
螢幕上,十幾條Loss曲線像賽跑一樣交織在一起,有的早早收斂,有的半路崩盤,有的則還在頑強地掙扎。
最終,在燒掉了數千塊錢的電費後,一個名為“v4_final_best”的模型版本脫穎而出。
它在CLUTRR驗證集上的準確率穩定在了98.8%,比之前的Demo版本又提升了3.5個百分點。
這類預測模型,準確率理論上是到不了100%的,人類在這個資料集上的平均準確率,也不過是99%左右。畢竟,人也會犯錯,也會看花眼。
而且在AI評測中,為了防止模型“過擬合”或者“作弊”,有時候會故意在測試集中摻雜少量的噪聲資料。如果一個模型在這些明顯錯誤的題目上也答“對”了,即輸出了錯誤的標註答案,那就說明這個模型可能是在“背題”,而不是在“推理”。
所以98.8%算得上己經接近理論極限了。
看著這個數字,徐辰滿意地點了點頭。
“就是它了。”
……
隨後徐辰又看了下訓練的日誌。這才發現了這個演算法存在一些問題。
由於之前徐辰都是丟給計算機讓計算機自己迭代,然後就去做別的事了,所以徐辰並沒有太過關注這個模型的執行效率,但是看了日誌才發現,這個SLRM模型,太慢了。
徐辰看著那個令人咋舌的延遲資料:
Qwen-7B(原版):推理速度 45 tokens/s。
Qwen-7B + SLRM:推理速度 0.8 tokens/s。
“0.8 tokens/s……”
徐辰扶額。
這速度,跟便秘有什麼區別?
如果用這個速度去跟使用者聊天,使用者發一句“你好”,等它回一句“你好”,估計都能去泡杯茶回來了。
……
SLRM執行這麼慢,原因在於計算密度的爆炸。
傳統的Transformer,其核心計算是矩陣乘法(MatMul)。這玩意兒雖然計算量大,但在現代GPU上己經最佳化到了極致,那是為了平行計算而生的。
但SLRM不一樣。
它的核心是“幾何嵌入”。
每一個概念,都要被對映為一個高維空間中的“盒子”或者“流形”。
每一次邏輯推理,都要計算這些幾何體之間的“交集”、“並集”和“包含關係”。
。樣取佈分lebmuG的雜複及以,sulptfos、xam、nim如比,算運線非的量大到及涉這
。化片碎憶記訊視的量大致導會還,力算的eroC rosneT用利分充法無僅不們它。的效低其極是上UPG在,作些這
”!倍05的remrofsnarT模規等同是然竟,力算的耗消MRLS,論段三的單簡個一理推“
。念概學的名著個一出現浮中海腦,析分頸瓶能效的上幕螢著看辰徐
”。’票彩‘的別級書科教是就首簡這“
。語自喃喃辰徐
。它援支好恰否是構架流主的下當即——了”獎中“地運幸否是它於決取而,越優否是上學數在它於決取不往往,功否能法算演IA種一:點觀刻深個一的出提rekooH araS員究研elgooG是,”票彩“謂所
”。事的長擅最UPG是好恰這而,法乘陣矩是元算運心核的它。’彩頭‘了中它為因是更,好得計設制機”力意注自“為因是僅僅不,界世治統能以所之remrofsnarT“
。求需算運陣矩的路網經神了合契完好恰,構架行並的計設素畫量海理為本其——”柳心無“的UPG於源破突一這
”。’票彩‘場這了掉輸它但,remrofsnarT了碾上質本學數的理推輯邏在然雖,MRLS的我而“
”。使火燒當去槍擊狙的把一用是像就,時’算運集‘的我對面在法乘的裡eroC rosneT。的斥排然天是,輯邏線非的雜複和算運合集何幾於對,構架UPG的有現“,著析分地靜冷辰徐
。局僵了破打底徹才速加行並UPG引達恩吳到首,玩的用商法無為視被度一,下低率效,算計列序的UPC於困習學度深年當。似相的人驚是總史歷
”。’期空真‘的尬尷種這於正也MRLS的在現“
”。的計設法乘陣矩為是全卻層底,強發併然雖UPG的有現而;算計量海不帶量吐吞,太數心核但,強制控輯邏UPC“
”。樣一)元單理量張(UPT的計設算計陣矩為專了發研,能功形圖了離剝底徹,率效致極求追了為歌谷像就。的夠不是化佳最靠,地落正真MRLS讓想要“
”。’UPT‘的它於屬要需也MRLS“








