《我的系統能刷數學經驗》第167章 重啟SLRM研究 三(2)

作者:見習人類觀察員·6個月前

徐辰的目光變得深邃,“最好的辦法就是針對SLRM的運算特性,單獨開發一個適合幾何運算的處理器,也許可以稱之為——LPU(邏輯推理單元)。”

當然,這一切得建立在SLRM帶來的經濟價值足夠大的前提下。

……

隨後,徐辰又思考了一下,SLRM應該還有其他2個問題。

一個是泛化能力的邊界。

SLRM的強大,建立在“邏輯可形式化”的基礎上。

對於數學題、邏輯題、程式碼生成這種有著嚴格規則的任務,它簡首就是神。

但是,對於那些模糊的、感性的、沒有標準答案的任務呢?

徐辰目前在這幾個測試集中能有較好表現,本質上是因為這些資料本身含有邏輯資訊,可以訓練模型。

但是,現實世界中的邏輯關係千奇百怪。

比如“貓”。在生物學上,它是貓科動物;在文學上,它可能是“高冷”的代名詞;在網路文化裡,它甚至是“主子”。

而且有些場景就是天然弱邏輯的,比如寫詩,比如閒聊,比如情感諮詢。

SLRM的幾何約束太強了,它像一把鐵鉗,死死地卡住了模型發散思維的翅膀。它不允許模型說任何“邏輯不嚴謹”的話,哪怕那是修辭,是比喻,是藝術。

“成也邏輯,敗也邏輯。”

“看來,未來還需要設計一個更靈活的‘排程器’,讓模型知道什麼時候該用SLRM,什麼時候該放飛自我。但這又是一個巨大的工程量。”

……

另一個問題,是訓練資料的匱乏。

徐辰目前能跑出SOTA,是因為他用的這幾個資料集(SNLI、LogiQA等)都是經過人工精心標註的高質量邏輯資料。

但是,這種資料在海量的網際網路文字中,佔比極低。

想要讓SLRM真正具備通用的邏輯能力,就需要海量的、覆蓋各種領域(法律、醫學、常識)的邏輯資料來訓練。

“沒有資料,SLRM就是個空殼子。”

“而且,不同的邏輯問題下,邏輯的判斷歸屬是不一樣的。這依然需要強大的引數量來擬合。”

徐辰現在的SLRM模組,引數量僅僅只有0.5B。

“如果要記住更多的邏輯,可能要把SLRM擴大到7B,甚至70B,再配合海量的邏輯資料。“

“到時候,它和Transformer結合後的威力,絕對不是簡單的1+1=2。”

“也就是說一個7B的transformer架構的模型,加上7B的SLRM模型,組合起來,可能有超過100B引數的能力。”

“但是……我是沒有能力搞到這麼多資料了。”

……

:論結了出得辰徐,實番一過經

”。間空的大很有還,線路化業產走,強較比值價果學型模個這“

”。的心信有較比是還化業產的向方個這對我,品出統系是為因,過不“

”。好剛剛實其,果學為作,樣這在現“,想一念轉又辰徐

”。人來後給間空進改的夠足了下留又,力潛的覆顛了示展既“

”。子樣的有該文論級頂篇一是才,這“

。生究研向方IA的哺待嗷嗷多活養會將,表發旦一文論篇這,見預以可至甚他

”……》法算演嵌何幾xoB-lebmuG的進改種一《、》用應的中生書文律法在MRLS《、》化佳最統系答問療醫的MRLS於基《“

。聲了出笑住不忍,數了數頭指手著掰辰徐

”。文論篇十幾出水能就,’佈分斯高‘、’錐‘、’球‘換形圖何幾的裡MRLS把是“

”。篇百幾出水能又,析分換、生碼式程換題學數從,換一換景場用應把再“

”!啊題選的別級’桶家全‘波一了送圈IA個整給是就首簡這……的練訓式散分搞,的化量型模搞,的速加搞些那提別更“

”!啊位崗業就造創界IA球全給在是這我,文論發是裡哪這我“

”。量無德功,量無德功“

。悲慈臉一,十合手雙辰徐

猜你喜歡

同題材或同分類的其他作品。