《我的學習群里全是真大佬》第421章 未央(2)

作者:胖胖的小橘·1個月前

最開始,沒人把這個數字當真。

跑分榜上鬧烏龍,又不是頭一回的事。

多半是哪個新模型鑽了題庫的空子,要不就是評測指令碼出了岔子,再不然,就是有人在背後刷榜……

技術論壇裡清一色全是這類的猜測。

於是有好事者,拿著公開的那部分題目,自己動手復了一遍盤。

結果這個資料居然是真的!

緊接著,又有人在另外幾張榜單上,看見了未央這個名字。

PutnamBench,那六百七十二道用Lean形式化寫就的普特南競賽題,排在最前面的,從來都是那幾個燒錢燒到上千美元一道題的傢伙。

而未央掛上去的成績,是六百七十二道,全解。

一道不落,且每一道題後面,都有一份機器當場就能驗過的完整證明。

然後在大家吃驚的時候……

miniF2F上的四百多道奧賽級的形式化題目,也被它清了個乾乾淨淨。

這兩張榜,向來是機器證明這一脈的試金石。

它們的題目雖是公開的,證明卻必須一步一步由機器親自驗過,才算數。

在這種地方,你糊弄不了任何人,蒙也蒙不過去。

所以訊息很快就在AI圈和數學圈裡,一同傳開了。

誰也不知道這“未央”是打哪兒冒出來的,更想不通它憑什麼能在這幾張榜上,把所有人都甩出這麼遠。

不過這種公開的跑分的大模型到底是哪家的總是有辦法查到的。

所以很快就有人把它給扒了出來……這模型出自燕大。

燕大?

要知道,上一個從華夏的大學裡走出來還在國際上闖出過名號的大模型,還是智譜。

可如今這個未央看起來好像比智譜還要兇的樣子。

不過很快就有眼尖的人注意到,未央並非張張榜單都拔尖。

在那張衡量綜合智力的Artificial Analysis指數上,在比拼對話偏好的Chatbot Arena上,在考較程式設計的SWE-bench、考較多模態的那一類專案裡,這個未央要麼名次平平,要麼乾脆連個影子都找不著。

很顯然,這壓根就不是一個什麼都會的通用大模型。

它更像是一個專為數學而生的大模型。

所以很快所有人都第一時間跑去燕大的官網,想看看燕大有沒有什麼訊息。

果然……

。前面家大了在現出知通頂置條一面上網的大燕

】知通的測公放開型模大學數”央未“於關【

】:友朋界各、仁同位各【

】。生而”htaM rof IA“為,型模大用專的究研學數向面款一是,”央未“【

】。手助靠可的寫書明證與化式形理定為作以可也,證驗確的式等恆模規大長擅,索檢的導引有做中間空料資與號符的大龐在長擅它,明證的驗核步逐機由可有附均,論結的出給所,基為理推號符的確以央未,型模用通的長見合擬以於同不【

】。算演的得不容都錯差點半、苛嚴而重繁些那擔分位諸替,工的手趁件一邊手者作工學數為能它,希們我【

】。驗來前界各邀誠,測公放開現【

】等生先姚穩文高剛田:問顧案專學大京燕【

?啥時這,呀過聽沒本們他”基為理推號符的確以“為因,了震被是然自圈IA知通則這

。了大更就應反的圈學數,候時的懵們他在就

。生陌不並實其們家學數,法說個這”htaM rof IA“

。錯出準保那,深了到真,活的等初最做做能隻多大,西東些那可,型模的號旗這著打過現出沒是不也年些前

。信敢太不又卻,用想,很得擰都,度態的IA對們家學數,來以直一以所

。子膽個那沒也誰,上西東的道八說胡能可就口張個一在押,心的年幾己自把,竟畢

猜你喜歡

同題材或同分類的其他作品。