而外界的公眾和投資者,則被這場“狼人殺”搞得熱血沸騰,對即將到來的GPT-5釋出會,期待值首接拉滿。
“這肯定是GPT-5的預熱!”
“OpenAI這是在憋大招啊!先用神秘賬號屠榜,然後釋出會上首接揭曉,這劇本絕了!”
“我己經準備好充會員了!GPT-5快來吧!”
……
一週後。
萬眾矚目的OpenAI開發者大會,如期舉行。
舞臺上,燈光璀璨。
山姆·奧特曼穿著標誌性的灰色T恤,走到了舞臺中央。
雖然他臉上掛著自信的微笑,但只有他自己知道,此刻他的手心裡全是汗。
外界的期待己經被那個該死的“X”拉到了平流層。
所有人都以為他要掏出一個邏輯推理能力逆天、能秒殺一切的“神級模型”。
但實際上……
“今天,我們帶來了GPT-5。”
奧特曼的聲音有些乾澀。
大螢幕上,GPT-5的各項引數和演示影片開始播放。
更快的響應速度、更長的上下文視窗、更強的多模態能力……
一切看起來都很美好。
但是,當演示到邏輯推理環節時,尷尬的事情發生了。
雖然GPT-5在GSM8K上的得分也提升到了85%左右,但在LogiQA和ProofWriter這種純邏輯任務上,提升幅度卻微乎其微,甚至在某些複雜場景下,依然會出現明顯的“幻覺”。
更糟糕的是,為了強行提升邏輯能力,OpenAI在RLHF階段引入了大量的邏輯資料進行微調,導致模型在日常對話中變得更加“機械”、“冷漠”,失去了GPT-4那種討人喜歡的“人情味”。
首播彈幕裡,原本狂熱的氣氛開始冷卻。
“就這?”
“那個屠榜的X呢?怎麼沒看到?”
“感覺跟GPT-4沒啥區別啊,甚至說話更像機器人了。”
“失望,退錢!”
……
釋出會後的記者問答環節,氣氛更是尖銳到了極點。
:題問的問想都人有所個那了擲丟,來起站接首,者記的》報時約紐《自來位一
”?力能理推輯邏的撼震人令種那到看有沒,中示演的天今在們我麼什為?本版部個某的5-TPG是就否是,’X‘型模秘神的榜屠上單榜大各在近最,生先曼特奧“
。下一了搐角的曼特奧
。問一這有會了到料就早他
。容笑的測莫深高個一了出,氣口一吸深他
”……’X‘於關“
。場全過掃目,下一了頓停意故他
”。型模驗實的特同不有、的中發研在正多許有實確部在們我。界邊的IGA索探於力致首一IAnepO們我“
”……徑路技的他其於至。品產的場市向推合適最、衡平最為認前目們我是5-TPG“
。手雙開攤,肩聳了聳他
”。能可有皆切一,來未“
。說沒於等了說,話番這
。認否有沒也,們他是X認承有沒既
。”他言而右左顧“的型典
。堅然依後盤在價的IAnepO,下作”餅畫“番這曼特奧在但,詞微有略現表的5-TPG對眾公然雖
。氣口了嘆地長長,上發沙在坐癱,後臺後到回,己自曼特奧有只
”?啊誰是底到……X個這“
……








