《我的系統能刷數學經驗》第168章 重啟SLRM研究 四(2)

作者:見習人類觀察員·6個月前

但現在,每當Qwen-7B生成一個推理步驟,SLRM就會在後臺的高維幾何空間裡構建一個“邏輯盒子”。如果下一步的推理超出了這個盒子的範圍,SLRM會立刻施加懲罰梯度,強迫它修正邏輯。

測試開始。

進度條走動。

最終分數定格:94.5%。

“嘶……”徐辰自己都吸了口涼氣。

原始水平:~75%。

加持後:94.5%。

GPT-4水平:~92%。

“在NLI這種基礎任務上,首接超越了SOTA(當前最佳)!”

……

第二戰:LogiQA。

這是一個硬骨頭。題目全是類似“如果A去,B就不去;如果B不去,C必須去……”這種繞口令。

Qwen-7B原始水平大約是38%,這個水平基本就是蒙的。

GPT-4的水平大約是76%。

徐辰載入模型,執行測試。

十分鐘後。

最終分數:81.2%。

翻倍!首接翻倍!

在這個榜單上,即便是千億引數的LLaMA-3-70B,也還在65%左右徘徊。徐辰用7B的模型,跑出了比GPT-4還高5個點的成績!

……

第三戰:ProofWriter。

這是終極考驗。不僅要對,還要對得有理有據。

Qwen-7B原始水平大約是45%,會經常胡編亂造證明過程)。

LAART (Qwen-7B + SLRM):98.4%。

“98.4%……”

徐辰看著這個數字,忍不住感嘆SLRM的邏輯能力確實夠強。

“雖然推理速度慢得像蝸牛,泛化能力也有限,但在‘邏輯嚴謹性’這一塊,它就是當之無愧的王者。”

“有了這些資料,這篇論文,穩了。”

……

。了震給”X“的秘神個那被次再,界IA個整,draobredaeL的ecaF gnigguH到傳上果結試測份份一將辰徐著隨

。件事立孤的單榜個一RRTULC是再不,次一這

……retirWfoorP、AQigoL、ILNS

!了洗給”X“母字的單簡個那被部全,間之夜一在,單榜理推輯邏的啃難最認公、的流主有所乎幾

!碾的式層斷是而,先領的弱微是不數分,且而

!點分百個5整整了出高名二第比至甚型模的X,上單榜”試測商智“種這AQigoL在

。睛眼的頭巨IA有所了痛刺,燈虹霓的爍閃排排一是像就,誌標”ATOS weN“的綠串連一那

。謎個是然依,誰是底到”X“個那連至甚,碼式程行一有沒,重權型模何任開公有沒然依,後背的績些這,是的怕可更

……

猜你喜歡

同題材或同分類的其他作品。