最開始,沒人把這個數字當真。
跑分榜上鬧烏龍,又不是頭一回的事。
多半是哪個新模型鑽了題庫的空子,要不就是評測指令碼出了岔子,再不然,就是有人在背後刷榜……
技術論壇裡清一色全是這類的猜測。
於是有好事者,拿著公開的那部分題目,自己動手復了一遍盤。
結果這個資料居然是真的!
緊接著,又有人在另外幾張榜單上,看見了未央這個名字。
PutnamBench,那六百七十二道用Lean形式化寫就的普特南競賽題,排在最前面的,從來都是那幾個燒錢燒到上千美元一道題的傢伙。
而未央掛上去的成績,是六百七十二道,全解。
一道不落,且每一道題後面,都有一份機器當場就能驗過的完整證明。
然後在大家吃驚的時候……
miniF2F上的四百多道奧賽級的形式化題目,也被它清了個乾乾淨淨。
這兩張榜,向來是機器證明這一脈的試金石。
它們的題目雖是公開的,證明卻必須一步一步由機器親自驗過,才算數。
在這種地方,你糊弄不了任何人,蒙也蒙不過去。
所以訊息很快就在AI圈和數學圈裡,一同傳開了。
誰也不知道這“未央”是打哪兒冒出來的,更想不通它憑什麼能在這幾張榜上,把所有人都甩出這麼遠。
不過這種公開的跑分的大模型到底是哪家的總是有辦法查到的。
所以很快就有人把它給扒了出來……這模型出自燕大。
燕大?
要知道,上一個從華夏的大學裡走出來還在國際上闖出過名號的大模型,還是智譜。
可如今這個未央看起來好像比智譜還要兇的樣子。
不過很快就有眼尖的人注意到,未央並非張張榜單都拔尖。
在那張衡量綜合智力的Artificial Analysis指數上,在比拼對話偏好的Chatbot Arena上,在考較程式設計的SWE-bench、考較多模態的那一類專案裡,這個未央要麼名次平平,要麼乾脆連個影子都找不著。
很顯然,這壓根就不是一個什麼都會的通用大模型。
它更像是一個專為數學而生的大模型。
所以很快所有人都第一時間跑去燕大的官網,想看看燕大有沒有什麼訊息。
果然……
。前面家大了在現出知通頂置條一面上網的大燕
】知通的測公放開型模大學數”央未“於關【
】:友朋界各、仁同位各【
】。生而”htaM rof IA“為,型模大用專的究研學數向面款一是,”央未“【
】。手助靠可的寫書明證與化式形理定為作以可也,證驗確的式等恆模規大長擅,索檢的導引有做中間空料資與號符的大龐在長擅它,明證的驗核步逐機由可有附均,論結的出給所,基為理推號符的確以央未,型模用通的長見合擬以於同不【
】。算演的得不容都錯差點半、苛嚴而重繁些那擔分位諸替,工的手趁件一邊手者作工學數為能它,希們我【
】。驗來前界各邀誠,測公放開現【
】等生先姚穩文高剛田:問顧案專學大京燕【
?啥時這,呀過聽沒本們他”基為理推號符的確以“為因,了震被是然自圈IA知通則這
。了大更就應反的圈學數,候時的懵們他在就
。生陌不並實其們家學數,法說個這”htaM rof IA“
。錯出準保那,深了到真,活的等初最做做能隻多大,西東些那可,型模的號旗這著打過現出沒是不也年些前
。信敢太不又卻,用想,很得擰都,度態的IA對們家學數,來以直一以所
。子膽個那沒也誰,上西東的道八說胡能可就口張個一在押,心的年幾己自把,竟畢








