《我的系統能刷數學經驗》第167章 重啟SLRM研究 三(1)

作者:見習人類觀察員·6個月前

在接下來的幾天裡,北大計算中心的GPU叢集再次滿負荷運轉。

十幾個不同版本的模型,在西張A100顯示卡上日夜不停地交叉訓練、驗證、迭代。

徐辰編寫了一個自動化的超引數搜尋指令碼,讓計算機自己去尋找那個最優的解。

螢幕上,十幾條Loss曲線像賽跑一樣交織在一起,有的早早收斂,有的半路崩盤,有的則還在頑強地掙扎。

最終,在燒掉了數千塊錢的電費後,一個名為“v4_final_best”的模型版本脫穎而出。

它在CLUTRR驗證集上的準確率穩定在了98.8%,比之前的Demo版本又提升了3.5個百分點。

這類預測模型,準確率理論上是到不了100%的,人類在這個資料集上的平均準確率,也不過是99%左右。畢竟,人也會犯錯,也會看花眼。

而且在AI評測中,為了防止模型“過擬合”或者“作弊”,有時候會故意在測試集中摻雜少量的噪聲資料。如果一個模型在這些明顯錯誤的題目上也答“對”了,即輸出了錯誤的標註答案,那就說明這個模型可能是在“背題”,而不是在“推理”。

所以98.8%算得上己經接近理論極限了。

看著這個數字,徐辰滿意地點了點頭。

“就是它了。”

……

隨後徐辰又看了下訓練的日誌。這才發現了這個演算法存在一些問題。

由於之前徐辰都是丟給計算機讓計算機自己迭代,然後就去做別的事了,所以徐辰並沒有太過關注這個模型的執行效率,但是看了日誌才發現,這個SLRM模型,太慢了。

徐辰看著那個令人咋舌的延遲資料:

Qwen-7B(原版):推理速度 45 tokens/s。

Qwen-7B + SLRM:推理速度 0.8 tokens/s。

“0.8 tokens/s……”

徐辰扶額。

這速度,跟便秘有什麼區別?

如果用這個速度去跟使用者聊天,使用者發一句“你好”,等它回一句“你好”,估計都能去泡杯茶回來了。

……

SLRM執行這麼慢,原因在於計算密度的爆炸。

傳統的Transformer,其核心計算是矩陣乘法(MatMul)。這玩意兒雖然計算量大,但在現代GPU上己經最佳化到了極致,那是為了平行計算而生的。

但SLRM不一樣。

它的核心是“幾何嵌入”。

每一個概念,都要被對映為一個高維空間中的“盒子”或者“流形”。

每一次邏輯推理,都要計算這些幾何體之間的“交集”、“並集”和“包含關係”。

。樣取佈分lebmuG的雜複及以,sulptfos、xam、nim如比,算運線非的量大到及涉這

。化片碎憶記訊視的量大致導會還,力算的eroC rosneT用利分充法無僅不們它。的效低其極是上UPG在,作些這

”!倍05的remrofsnarT模規等同是然竟,力算的耗消MRLS,論段三的單簡個一理推“

。念概學的名著個一出現浮中海腦,析分頸瓶能效的上幕螢著看辰徐

”。’票彩‘的別級書科教是就首簡這“

。語自喃喃辰徐

。它援支好恰否是構架流主的下當即——了”獎中“地運幸否是它於決取而,越優否是上學數在它於決取不往往,功否能法算演IA種一:點觀刻深個一的出提rekooH araS員究研elgooG是,”票彩“謂所

”。事的長擅最UPG是好恰這而,法乘陣矩是元算運心核的它。’彩頭‘了中它為因是更,好得計設制機”力意注自“為因是僅僅不,界世治統能以所之remrofsnarT“

。求需算運陣矩的路網經神了合契完好恰,構架行並的計設素畫量海理為本其——”柳心無“的UPG於源破突一這

”。’票彩‘場這了掉輸它但,remrofsnarT了碾上質本學數的理推輯邏在然雖,MRLS的我而“

”。使火燒當去槍擊狙的把一用是像就,時’算運集‘的我對面在法乘的裡eroC rosneT。的斥排然天是,輯邏線非的雜複和算運合集何幾於對,構架UPG的有現“,著析分地靜冷辰徐

。局僵了破打底徹才速加行並UPG引達恩吳到首,玩的用商法無為視被度一,下低率效,算計列序的UPC於困習學度深年當。似相的人驚是總史歷

”。’期空真‘的尬尷種這於正也MRLS的在現“

”。的計設法乘陣矩為是全卻層底,強發併然雖UPG的有現而;算計量海不帶量吐吞,太數心核但,強制控輯邏UPC“

”。樣一)元單理量張(UPT的計設算計陣矩為專了發研,能功形圖了離剝底徹,率效致極求追了為歌谷像就。的夠不是化佳最靠,地落正真MRLS讓想要“

”。’UPT‘的它於屬要需也MRLS“

猜你喜歡

同題材或同分類的其他作品。