但現在,每當Qwen-7B生成一個推理步驟,SLRM就會在後臺的高維幾何空間裡構建一個“邏輯盒子”。如果下一步的推理超出了這個盒子的範圍,SLRM會立刻施加懲罰梯度,強迫它修正邏輯。
測試開始。
進度條走動。
最終分數定格:94.5%。
“嘶……”徐辰自己都吸了口涼氣。
原始水平:~75%。
加持後:94.5%。
GPT-4水平:~92%。
“在NLI這種基礎任務上,首接超越了SOTA(當前最佳)!”
……
第二戰:LogiQA。
這是一個硬骨頭。題目全是類似“如果A去,B就不去;如果B不去,C必須去……”這種繞口令。
Qwen-7B原始水平大約是38%,這個水平基本就是蒙的。
GPT-4的水平大約是76%。
徐辰載入模型,執行測試。
十分鐘後。
最終分數:81.2%。
翻倍!首接翻倍!
在這個榜單上,即便是千億引數的LLaMA-3-70B,也還在65%左右徘徊。徐辰用7B的模型,跑出了比GPT-4還高5個點的成績!
……
第三戰:ProofWriter。
這是終極考驗。不僅要對,還要對得有理有據。
Qwen-7B原始水平大約是45%,會經常胡編亂造證明過程)。
LAART (Qwen-7B + SLRM):98.4%。
“98.4%……”
徐辰看著這個數字,忍不住感嘆SLRM的邏輯能力確實夠強。
“雖然推理速度慢得像蝸牛,泛化能力也有限,但在‘邏輯嚴謹性’這一塊,它就是當之無愧的王者。”
“有了這些資料,這篇論文,穩了。”
……
。了震給”X“的秘神個那被次再,界IA個整,draobredaeL的ecaF gnigguH到傳上果結試測份份一將辰徐著隨
。件事立孤的單榜個一RRTULC是再不,次一這
……retirWfoorP、AQigoL、ILNS
!了洗給”X“母字的單簡個那被部全,間之夜一在,單榜理推輯邏的啃難最認公、的流主有所乎幾
!碾的式層斷是而,先領的弱微是不數分,且而
!點分百個5整整了出高名二第比至甚型模的X,上單榜”試測商智“種這AQigoL在
。睛眼的頭巨IA有所了痛刺,燈虹霓的爍閃排排一是像就,誌標”ATOS weN“的綠串連一那
。謎個是然依,誰是底到”X“個那連至甚,碼式程行一有沒,重權型模何任開公有沒然依,後背的績些這,是的怕可更
……








