崩潰的情緒還在蔓延,另外一場導致開始下一賽季的衝突在醞釀。
倭國智慧體研究中心。
“菊”的開發團隊負責人山田隆史第一次看到一個帖子。
是在一個連名字都叫不全的深度學習技術論壇上。
論壇的伺服器大概架在里約熱內盧。
他也懶得去查,反正是那種連HTTPS證書都過期半年的破地方。
平時他絕不會來這種論壇,但今晚他在等女兒退燒。
手機螢幕上的體溫曲線忽上忽下,他需要找點什麼東西來分散注意力。
帖子是匿名的,標題平平無奇:
“關於超大規模神經網路梯度穩定性的一種新思路”。
他點開的時候預期會看到另一篇用TensorFlow玩具模型跑出來的本科畢設,這種帖子在這個論壇上一天能冒出上百個,比路邊的狗屎還多。
但第一段還沒讀完,他的手指就停在了滑鼠上。
匿名作者提到了一種用非歐幾里得流形來近似高維損失景觀的方法。
不是那種論文裡常見的“我們提出了一種新方法”然後堆一堆數學公式湊篇幅的套路。
帖子是首接從一個他從未見過的角度。
用纖維叢的聯絡來重新定義梯度傳播的方向!
一刀切進了深度學習最核心的難題。
思路之精巧讓他後脊發涼,他的斜方肌真的在收縮。
他做了二十二年人工智慧研究,在倭國國立情報學研究所帶了十二年團隊,一眼就能分辨什麼是人類寫出來的論文,什麼不是。
人類寫的東西有試錯的痕跡,有冗餘的引用,有為了討好審稿人而硬塞進去的對比實驗。
這個帖子沒有,沒有一句廢話,沒有一個多餘的符號,每一步推導都像有人在億萬邏輯分支中用雷射刀削出了唯一正確的路徑。
“餿蒂斯囁……”他喃喃了一聲,把帖子往下翻。
最後一行是一段極短的程式碼,用Python寫的,加起來不到五百行。
他掃了一遍程式碼結構,然後掃了第二遍,然後戴上了眼鏡掃了第三遍。
這段程式碼實現的思想,比他過去十年見過的任何最佳化器都要領先至少一個數量級。
如果有人把它部署到菊的神經網路訓練框架上,“菊”的收斂速度將不再是現在這個量級。
“撿到寶了!”這篇帖子的釋出者一定是個天才!
“菊”是倭國國立情報學研究所研發的超級人工智慧,目前受限於倭國《AI安全法》的算力鎖機制,被強制限制在兩千P FLOPS的等效算力上限。
。構架在,力算在不頸瓶正真的,楚清都人何任比史隆田山但
。話笑個一變將鎖力算,里路環練訓心核的到接嫁能路思的碼式程段這果如
。變質得獲能就力算多麼那吃要需不本為因
。釋註行逐始開,案檔地本個一了建新,來下製複碼式程的裡子帖把他
。到意注沒全完他,退又了漲水的灣京東外窗
。到意注沒也他,了降始開於終溫,個了翻裡室臥壁隔在兒
。遍一了跑裡型模試測了進嵌後然,式格的呼能面介練訓層底的寫改行逐碼式程行百五那把是只他
。級量數個一是,十幾之分百是不,級量數個一了升提度速斂收
。支分主了進併合改把,tseuqer llup個一了提架框層底的給他,點西晨凌








