《再青春!你好,2010》第289章 DPY-0.5(2)

作者:兔子六·6小時前

“你們是怎麼解決的?”李東陽問。

徐若辰笑了一下,轉身在白板上畫了另一個圖。這次是一個稀疏連線的示意圖,每個節點只跟少數幾個節點有連線,而不是跟所有節點。

“傳統的注意力機制,每個token都要和所有其他token做互動。我們透過一種新的動態路由機制,讓每個token只跟最關鍵的那百分之五到百分之十的token做深度互動,其餘的部分用輕量級的近似計算替代。”

他停頓了一下,加重了語氣:“計算量直接從O(n2)降到了O(n log n)。一萬字的文字,互動次數從一億降到了不到兩百萬。”

會議室裡安靜了一下。

李東陽看著白板上的圖,腦子裡過了一遍這個數字的變化。

五十倍的差距。

“驗證過了?”他問。

“驗證了。”徐若辰點頭,“我們用多個數據集做了壓力測試,結論一致。在保證準確率不降的前提下,計算效率提升了一個數量級以上。”

“準確率不降?”

“準確率還有提升。”旁邊一個年輕研究員接話,“因為動態路由機制去掉了噪音資訊,模型反而更聚焦了。相當於你讓一個學生在複習考試的時候,只複習重點,不復習那些不考的東西。”

李東陽靠在椅背上,看著白板上那個稀疏連線的圖,沉默了幾秒。

“跟我詳細說說。”他說。

徐若辰的眼睛一下子亮了。

他轉身開啟投影儀,把電腦接上去。螢幕上出現了密密麻麻的資料表格和模型架構圖。

“我按時間線來梳理一下。”徐若辰站在投影幕前,拿遙控器翻了第一頁。

“去年十二月,我們完成了DPY-0.5的基礎版本。引數量七十二億,訓練資料總量一點二萬億token,涵蓋中英文雙語。這個規模,坦白說,放在全球範圍內不算最大的。谷歌的BERT最大版本才三億引數量,但他們走的是雙向編碼路線,跟我們的技術路徑不太一樣。OpenAI的GPT-2是十五億引數,比我們大。”

他翻到下一頁,是一張評測對比表。

“但是在中文語義理解的深度上,根據我們內部重新設計的評估體系,DPY-0.5已經超越了目前市面上所有開源模型的同等規模版本。C-Eval中文綜合評測,我們十二月的版本得分是六十二點七分。”

李東陽看了一眼表格裡其他模型的分數。谷歌的一個模型,五十八點一分。另一個模型,五十六點三分。

“六十二點七分,已經是最高了。”李東陽說。

“對。但這不是重點。”徐若辰翻到下一頁,臉上那種興奮的表情又回來了,“大年三十那天晚上,我們對注意力機制做了一次徹底的重新設計。新的稀疏注意力架構,我剛才已經介紹了大概。評測結果——C-Eval直接跳到了八十九點四分。”

會議室裡安靜了。

李東陽看著螢幕上那個數字,八十九點四分,比之前的六十二點七分,高了將近二十七分。

“這個分數意味著什麼?”他問。

徐若辰沉默了兩秒,像是在組織語言。

“我打個比方。一般的大語言模型,在處理複雜中文文字的時候,能夠識別字面意思,但難以捕捉深層的語義和情感。比如說——‘這個東西不貴,但是我不太想買。’大多數模型會理解成‘價格是唯一影響因素,使用者因為價格低而有購買意願,但因為某種原因沒有購買’。但這句話背後的真實情感是——‘價格不是問題,問題是我對這個東西本身沒有興趣,我只是在找一個不買的藉口。’”

他停了一下,看著李東陽。

”。的略忽以可是詞些哪,的鍵關是詞些哪道知它。明聰更制機力意注的它為因是而,大更量數引的它為因是不。態狀理心的’豫猶帶略、無可有可‘種那解理能它。個這到捉捕能5.0-YPD“

。下兩了敲輕輕上面桌在指手,上子椅在靠東李

。說他”。文中“

”。言語的境語高種這理合適然天制機由路態的5.0-YPD但,力吃很候時的文中理型模統傳。裡氣語和文下上在而,上面字在不訊資多很——是點特的文中。好友別特言語境語高種這文中對上計設在制機力意注的們我且而,主為文中以料資練訓的們我為因是這。文英於好遠遠,現表的上文中在型模的們我“,頭點辰若徐”。文中,對“

猜你喜歡

同題材或同分類的其他作品。