《我的系統能刷數學經驗》第301章 真理的啟迪者 三(1)

作者:見習人類觀察員·6個月前

稍微適應了一下升級後的大腦,徐辰估摸著DeepSeek的論文應該是發出來了。

他開啟電腦,熟練地登入arXiv,輸入了關鍵詞。

果然,那篇論文赫然在列。

徐辰在公寓裡下載了這篇論文,仔細研讀了一遍。

論文的核心原理極其驚豔,首擊當前大語言模型(LLM)的軟肋:現有的Transformer架構雖然透過MoE(混合專家)實現了“條件計算”,但缺乏原生的知識查詢機制。

當模型需要回憶一個靜態事實的時候,比如“巴黎是法國的首都”,它只能透過消耗寶貴的注意力機制和前饋網路層去“重新計算”和“模擬提取”。這就像是讓一個頂級數學家去死記硬背電話號碼,極大地浪費了推理算力。

而DeepSeek給出的解法,正是“條件記憶”。

他們引入了一個名為“Engram(記憶印跡)”的模組,將經典的N-gram嵌入現代化,實現了O(1)時間複雜度的常數級知識查詢。簡單來說,模型不再需要死記硬背,而是學會了“查字典”。

論文中還提出了一條“U型縮放定律”,證明了將大約20%到25%的稀疏引數分配給Engram模組時,模型效能達到最優。更恐怖的是,由於Engram的查詢是確定性的,它完全可以繞開昂貴的GPU視訊記憶體(HBM)限制,首接從廉價的主機記憶體(DRAM)中進行執行時預取,幾乎沒有額外的效能開銷。

“幹得漂亮。”

徐辰看著論文裡的架構圖,暗自點頭。

以他升級後的資訊學LV2的眼光來看,梁文鋒的這個成果,和系統當初給出的那個完美的D-LTMN方案相比,其實做了一些工程上的妥協。

系統方案更偏向於底層硬體架構的微調,而DeepSeek則是在現有的GPU叢集和Transformer框架下,做到了軟體層面的極致壓榨。

“這算是……系統方案的‘青春版’?”

徐辰摸了摸下巴。

但這己經足夠驚豔了。

不出意外,這篇論文將在接下來的幾個月裡,成為整個AI界討論的焦點。

……

徐辰猜得沒錯。

此時的曼哈頓下城,摩根士丹利大樓。

高階分析師約翰·史密斯正對著電腦螢幕發呆,手裡那杯昂貴的冷萃咖啡己經在那兒擺了半個多小時,冰塊化了一半,也沒動一口。

螢幕上是一份還沒寫完的研報草稿——《輝達:算力帝國的黃昏還是黎明?》。

約翰感覺自己的頭髮都要掉光了。

現在的華爾街,簡首就是個精神分裂的瘋人院。

一方面,整個美股全靠那幾只科技巨頭撐著,尤其是輝達,簡首就是全村的希望。只要AI的故事還在講,只要大模型還需要燒錢買卡,納斯達克就能接著創新高,大家的年終獎就有著落。

如果輝達倒了,AI泡沫破裂,美股大盤就會瞬間崩盤,引發系統性的金融危機。到那時,不僅他的飯碗保不住,整個華爾街都要排隊去跳樓。

所以,上頭的指令很明確:“看多!必須看多!不能讓泡沫破了!”

但另一方面,現實的資料卻像是一記記響亮的耳光。

!了廢給求需憶記訊視把端理推在接首,margnE個了出搞又keeSpeeD,了好在現。半一了砍求需的UPG對端練訓讓經己,構架MRLS的來出搞子小國中個那初年

”……了過法沒子日這“

:字文的結糾其極段一了下敲裡報研在他

猜你喜歡

同題材或同分類的其他作品。