《再青春!你好,2010》第403章 子彈還在飛(1)

作者:兔子六·3小時前

北京時間6月30日晚上11點半,美東時間上午11點半。

國內的熱搜還在發酵,外網也開始動了。

最先動的是Reddit的r/chineLearning板塊。一個叫“throwaway_ai_2016”的使用者發了一個帖子,標題是《DPX1.5 froChina: I ran the standard benchrks and Inot sure what to think》。

帖子內容不長,但資訊密度很高:

“我透過一箇中國朋友搞到了邀請碼。在HunEval上跑了完整測試,DPX1.5得分71.8%。在GSK數學推理上,得分64.3%。在LU上,得分58.7%。對比:GPT-3在HunEval上是48.1%,GSK是34.2%,LU是43.9%。要麼中國人做出了真正的突破,要麼他們找到了某種取巧的評測方法。但我在三個不同的benchrk上跑了三遍,結果一致。如果這是取巧,那這個取巧本身就是一個突破。”

帖子發出來之後,前二十分鐘的評論基本是同一個調子。有人問“資料給我看看”,有人說“又是中國的PR專案吧”,有人直接甩了一個“lol”就走了。前二十條回覆裡,十五條在質疑,三條在嘲諷,兩條在要原始資料。

但到了美東時間下午一點,風向開始變。

一個ID叫“yann_lecun_fan”的使用者發了一條長回覆。這人後來的身份被扒出來是某大廠AI Lab的研究員,在圈子裡有點名氣,平時不太發帖,但一開口就很有分量。

“我拿到了邀請碼。跑了五個維度:程式碼生成、數學推理、邏輯推理、中文理解、英文寫作。結論是——DPX1.5在程式碼生成和數學推理上確實超過了GPT-3。不是一點點,是代際差距。它的注意力機制明顯經過了最佳化,長文字依賴處理得非常好。我在一個兩千token的上下文裡測試了程式碼補全,它沒有丟任何關鍵資訊。GPT-3在這個長度上已經開始胡言亂語了。”

這條回覆下面很快有人追問:“是不是用了什麼新的架構?”

“不知道。但從行為上看,它不像純粹的Transforr。它的推理鏈更短,更直接。可能是某種混合架構。”

這條回覆的點贊數在半小時內衝到了三百多。質疑的聲音沒有消失,但開始有人轉向“我需要邀請碼”和“有人能分享一下體驗嗎”。

美東時間下午三點,一個更重磅的人出現了。

Richard Rashid,微軟前首席研究官,微軟研究院創始人之一。他在自己的Twitter上發了一條:

“我透過一個學術渠道拿到了DPX1.5的訪問許可權。花了四個小時測試。結論:如果這個模型是中國人自己做的,那我們必須重新評估中國在AI領域的真實水平。它在程式碼生成和數學推理上的表現,超過了我們目前公開的最優模型。不是追平,是超過。我建議微軟研究院立即組織團隊進行對標分析。”

這條推文發出去之後,評論區瞬間熱鬧起來。有人問“Richard,你確定不是套殼?”Rashid回覆得很乾脆:“我確定。套殼不可能在延遲和吞吐上做到這個水平。它的推理速度比GPT-3快至少三倍。”

這條推文到凌晨三點,轉發超過一萬。

緊接著,英特爾的AI產品部門官方賬號在北京時間凌晨五點五十二分發了一條宣告。措辭很官方,但能看出是臨時發的:

“我們注意到了DPX1.5的釋出。我們正在組織團隊進行技術評估。英特爾在AI領域有深厚的積累,我們歡迎競爭,也相信競爭會推動行業進步。”

這條宣告的評論區裡,有人問“你們是不是慌了”,有人回“Intel在AI上有什麼積累?”。但更多人注意到的是——英特爾用了“歡迎競爭”這個詞。在2016年,這個措辭從一個美國半導體巨頭嘴裡說出來,指向一家中國公司,本身就說明了一些問題。

輝達的AI研究團隊負責人也在Twitter上發了一條,比英特爾的宣告更具體:

“DPX1.5的推理效率讓人印象深刻。我們初步分析,它的GPU利用率非常高,可能是針對某種特定硬體做了深度最佳化。如果這個最佳化是在中國國產硬體上完成的,那意義更大。”

底下有人追問:“你意思是他們可能用了國產晶片?”他回覆:“我不知道。但如果他們用了,那說明國產晶片的軟體生態已經能支撐這種級別的模型。這是一個訊號。”

這條推文被轉發了六千多次。評論區裡有技術分析,有政治猜測,也有人單純在問“什麼時候能開放註冊”。但輝達那位負責人說的“國產晶片的軟體生態”這句話,在幾個小時內被反覆引用,甚至傳到了國內幾個半導體行業的微信群裡。有人把截圖發給了華為海思的一位中層,對方的回覆只有四個字:“不太可能。”

美國東部時間晚上七點,一個叫Dario Adei的使用者——Anthropic的聯合創始人——發了一條長推:

“我讀了很多關於DPX1.5的測評。我通常對‘中國AI突破’這種標題持懷疑態度,因為過去很多所謂的突破最後都被證明是套殼或者過度宣傳。但這次的證據不一樣。多個獨立信源、多個benchrk、多個維度。DPX1.5可能真的是一個分水嶺。”

他在這條推文下面補了一句:“我需要強調的是,我還沒有親自測試。但根據我信任的幾位研究者的反饋,它的表現至少達到了GPT-3的水平,在某些維度上超過了GPT-3。如果這是真的,那麼全球AI的競爭格局需要重新評估。”

這條推文發出去之後,評論區裡有人問了一個尖銳的問題:“Dario,你說‘重新評估’,是指技術層面還是地緣政治層面?”

”。有都“:句一了回是只,答回接直有沒iedA

。ks nolE了@接直人有,”兒會一飛彈子讓先“說人有,”刻時kintupS的IA國中“是說人有,開可不得吵裡區論評。答回比對的上題問個一同在3-TPG跟它了出人有,詩古文中的寫它了出人有,碼式程的生5.1XPD了出人有。千五了破突裡時小個兩在數論評,》3-TPG staeb taht led IA na deppord tsuj anihC《是題標,子帖個一了現出塊板ygolonhcet/r上tiddeR。圍範的廣更了到延蔓圈技從經已論討的網外,晨凌間時京北了到

猜你喜歡

同題材或同分類的其他作品。