《再青春!你好,2010》第290章 GPU問題(1)

作者:兔子六·4小時前

“英文呢?”

“英文也不差,但沒有中文這麼好。”徐若辰翻到下一頁,是一張英文評測表,“在英文的SuperGLUE基準測試上,我們的模型得分是八十五點三分。GPT-2的得分是八十二點一分。我們高了三到四個點,但沒有中文那種碾壓級別的優勢。”

李東陽點了點頭,又追問:“訓練成本呢?”

陳銘宇接過了話:“十二月的版本,訓練成本大約是一千兩百萬美元。大年三十的迭代版本,因為注意力機制的效率大幅提升,訓練成本降到了不到六百萬美元。後續如果再訓練,成本還會進一步降低。”

“推理成本呢?”

“推理成本的降幅更明顯。”徐若辰說,“因為推理的時候,自注意力機制的計算量佔了絕對大頭。我們把O(n2)降到O(n log n)之後,推理速度提升了將近二十倍。同樣的硬體配置,以前處理一條一萬字文字需要十秒鐘,現在只需要零點五秒。”

“零點五秒。”李東陽重複了一遍。

“對。而且成本也相應降下來了。以前處理一條長文字的成本大概是兩分錢人民幣,現在不到一分錢。如果量大的話,這個差距非常可觀。”

李東陽沉默了。

會議室裡所有人都在看他。

“下一步的計劃是什麼?”他問。

徐若辰翻到最後一頁,上面列了一個時間線。

“我們計劃在三月底之前完成DPY-1.0的正式版本。引數量會從七十二億擴充到一百二十億到一百五十億之間。訓練資料總量擴充到兩萬億token以上。預計C-Eval得分可以進一步提升到九十五分以上。”

“應用層呢?”李東陽看向陳銘宇。

陳銘宇接過話:“我們已經在規劃了。目前考慮三個方向。第一,智慧客服。這個是最直接的,海鑫二手回收和京東轉轉那邊的客服需求量很大,如果能用大語言模型替代一部分人工,降本增效的效果會很顯著。第二,內容生成。舊石頭那邊需要大量的劇本、文案、營銷內容,大語言模型可以輔助生成初稿,人工再潤色。第三,程式碼輔助。我們內部的技術團隊已經在用DPY-0.5的預覽版輔助寫程式碼了,效率提升大概在百分之三十左右。”

李東陽聽完,站起來,走到白板前。

他看著那個稀疏連線的示意圖,看了好一會兒。

“徐博士。”他轉過頭。

“李總。”

“你現在有多大的把握,這條路是對的?”

徐若辰想了想,說:“技術路線已經驗證了。從理論到實驗,我們都反覆推演過了。剩下的問題是工程化——把模型做大,把推理做快,把成本做低。這些問題,我認為都可以解決。”

“時間呢?”

“一到兩年之內,做到可以大規模商用。”

李東陽點了點頭,轉身看著會議室裡的人。

這五十八個人,來自世界各地,放棄了谷歌、微軟、臉書的高薪,跑到凌波這個他們之前可能都沒聽說過的地方,在一個還在建設中的研究院裡,沒日沒夜地寫程式碼、調模型、跑資料。

好在這裡老外多,沒啥過年的執念。

“我說幾句。”李東陽開口了。

所有人都坐直了。

”。苦辛很得追們我。累積技有,人有,錢有們他,微、IAnepO、歌谷。早們我比步起國,域領個這“,頓了頓他”。過到做人有沒,前之們你在為因是而,錢多賺能為因是不。要重很,事的做們你“

。來下停,步兩了走裡室議會在他

”。的來出調數引個一數引個一是,的來出寫碼式程行一行一們你是,的來下掉上天是不先領個這。的先領是們我,上道賽分細個這在。們他了過超經已,上解理義語文中在們我,我訴告們你天今但“

。人個一每的場在看了看,宇銘陳看了看,辰若徐看了看他

”。了苦辛——句一說只我。話面場說會太不我“

。下一了靜安裡室議會

。拍在的真是,聲掌的衍敷、的套客種那是不。來起了拍著跟都人有所,掌了鼓頭帶誰是道知不後然

。了住忍他但,紅點有眶眼,兒那在坐辰若徐

”。料史當以可後以,來下記家大,話多麼這說得難總李“:句一了說著笑,來起站宇銘陳

猜你喜歡

同題材或同分類的其他作品。