2025年1月,還有一件事對徐辰影響很大。
這個月,發生了一件科技界的大事。
各大國內主流新聞APP的頭版頭條都在推送一條訊息:
標題,充滿了科技感與衝擊力。
【“中國AI的‘GPT-4時刻’?DeepSeek-R1橫空出世,效能全面超越,並宣佈開源!”】
“DeepSeek-R1?”徐辰的眉毛,微微一挑。
在過去的幾個月裡,以ChatGPT為代表的大語言模型(LLM),如同平地驚雷,在全球範圍內,掀起了一場前所未有的科技革命。
【大語言模型……AI……】
徐辰的心中,泛起了一絲好奇。
他雖然主攻的是純粹數學,但對於這些代表著人類科技最前沿的“時髦”玩意兒,也並非一無所知。
他開啟電腦,搜尋到了DeepSeek-R1的開源論文。
他饒有興致地,開始閱讀起來。
論文的前半部分,是關於模型訓練所使用的數學理論。
“……我們採用了改進的‘注意力機制’(Attention Meism),其核心,是將輸入序列中的每一個詞向量,都對映到‘查詢(Query)’、‘鍵(Key)’、‘值(Value)’這三個向量空間中。透過計算Query與所有Key的點積相似度,並進行Softmax歸一化,來得到每個Value的權重……”
【嗯,有點意思。】徐辰的眼中,閃過一絲瞭然。
【這個思路,本質上是線性代數中‘投影’與‘加權平均’思想的一種精妙應用。它透過點積來衡量向量間的‘相關性’,再用Softmax函式將這種相關性轉化為機率權重,從而讓模型能夠動態地聚焦於輸入序列中最關鍵的部分。】
“……在最佳化器(Optimizer)的選擇上,我們採用了Adam演算法,它結合了‘動量法’(Momentum)和‘RMSProp’的優點,能夠自適應地,為不同引數,調整學習率……”
【原來如此。】徐辰點了點頭。
【這可以看作是常微分方程中‘梯度下降法’的一種高階變體。它引入了‘動量’這個物理概念,模擬一個在損失函式曲面上滾動的小球,利用慣性衝過平坦區域和區域性極小值點,從而加速收斂。而自適應學習率,則相當於為這個小球,在不同陡峭程度的路面上,配備了智慧的剎車和油門系統。】
論文中那些在AI工程師看來,極其高深複雜的數學原理,在徐辰這個LV.2級別的“數學家”眼中,卻如同庖丁解牛,每一個結構,每一處關節,都清晰可見。
他只花了不到半個小時,就將論文中所有的數學部分,全部吃透,甚至還能舉一反三地,思考出幾種可能的改進方向。
【整個大語言模型,從數學上看,可以被視為一個極其高維的、非線性的函式逼近器。它的訓練過程,就是在數十億甚至數千億個引數構成的空間中,透過梯度下降,尋找一個能最小化‘損失函式’的最優解。而‘注意力機制’,則為這個龐大的函式,提供了高效的‘剪枝’策略,使其能夠專注於處理長距離的依賴關係。】
然而,當他看到論文的後半部分,關於“神經網路架構”和“模型訓練”的內容時,他的眉頭,卻漸漸地,鎖了起來。
“Transformer架構”、“多頭注意力”、“殘差連線”、“層歸一化”……
這些屬於計算機科學和人工智慧領域的專業術語,對他而言,就如同一個個陌生的路標,指向一片他從未踏足過的未知領域。
如果不瞭解神經網路為什麼能擬合任何函式(萬能逼近定理),對後續的深層神經網路乃至於Transformer架構就更加不知道具體的工作機制了。
【對於AI,確實還存在著巨大的‘盲區’。】
他沒有氣餒,反而燃起了一股強烈的求知慾。
。識知礎基的”型模言語大“於關著尋搜,地狂瘋,上網在始開,腦電啟開他
。”remrofsnarT“——心核的型模大今當是才,後最,”)MTSL(路網憶記期短長“和”)NNR(路網經神圈迴“到再,”路網經神度深“到,型模”機知“的礎基最從
。時半一到看,》deeN uoY llA sI noitnettA《——文論典經的構架心核”remrofsnarT“於關篇一將他在就
!來起了響,地兆徵無毫,音示提統系的冷冰那,中海腦他
】……展拓界邊知認,識知關相’路網經神工人‘習學在正主宿到測檢!叮【
】!2+值驗經學訊資【
】!1+值驗經學理【
】!1+值驗經學化生【
”!?嗯“
!頓一地猛,作的辰徐
。板面統系的己自了出調,地信置以難些有他
。疇範的學訊資於屬然自識知的關相機算計,的現實來機算計過是就IA為因,解理好很,2+值驗經學訊資
!”1+“的小小個一了現出都,面後條驗經的白空是還乎几條兩那”學化生“和”學理“在,是但
】!?況麼什【
】!?驗經的化生和理了加會麼怎,IA和機算計學在是明明我【
】?了GUB出是不是你,統系【
。思沉了陷,即隨,愣一是先他
】。解理夠能強勉還倒……個這,1+驗經學化生【
】。通得說是也倒,分部一的造構生解瞭是算這。造構的腦大生解理,地接間去,度角的學訊資、的象個一從在是,於等就,理原作工的它習學我。擬模學生仿的構結元經神腦人對是就本,詞個這’路網經神‘,竟畢【








