《我的學習群里全是真大佬》第393章 免費,專業知識有點多(2)

作者:胖胖的小橘·1個月前

這也是演算法界永遠繞不開的一道坎——偏差與方差的權衡。

簡單的說就是模型太簡單了腦容量不夠,這叫叫欠擬合。

模型太複雜了又會把資料裡那些干擾項當成真理給記下來,當你換道它沒見過的新題時,它就會當場抓瞎,這就叫過擬合。

引數越多,這過擬合的症狀,理論上就越致命。

幾十年來,大家都是這麼覺得的。

“可現在的事,邪門就邪門在這兒。”

姚先生在“一百萬”那個數字底下畫了道線。

“我們今天拿來用的那些大模型,引數動輒上千億,遠比餵給它的資料還多。”

“照理說它們早該過擬合到沒法看了。”

“可它們偏偏沒有。”

“它們不光沒爛,反而學得一個比一個好。”

他轉過身在黑板上寫下三個字。

【為什麼?】

接下來,姚先生才真正進了正題。

他要講的是過引數化網路的損失景觀。

所謂損失景觀,可以想象成一片起伏的山地。

模型裡每一個引數,都是一個能擰的旋鈕,上千億個旋鈕擰出來的每一種組合,都對應著這片地面上的一個點,而這個點的海拔高低,就是模型在這種組合下犯的錯有多大。

對大模型的訓練,就是從山上某處出發,順著最陡的方向往下走,一步一步去找那片地勢最低的點。

這個往下走的法子,就叫做叫梯度下降。

按理說旋鈕一多,這片山地的地形就該複雜得嚇人,陷阱遍地,隨便掉到哪個坑裡就再也出不來了。

可數學告訴你的,這樣不對!

在引數足夠多的時候,那片山地最低處的點,根本就不是一個單獨存在的。

它是連成一大片的谷底。

你隨便滾進哪一個裡,幾乎都能滾到一樣低的地方去。

“既然谷底連成了片,那問題就來了,”姚先生繼續說道,“同樣是滾到最低,梯度下降它會挑哪一個落腳?”

這才是真正要命的地方。

這上千億個旋鈕,能把訓練資料完美擬合的組合,多到數不清。

可梯度下降這麼一路滾下來,它不是隨便落,而是帶著一種說不清道不明的偏好,專往那些最平、最簡單的低點裡去。

。化則正式就,好偏的用作著起在在實實卻、寫明人沒種這

。鑽裡坑的雜複、銳尖些那往得懶就,本路條這降下度梯為因是而,它著攔在誰有為因是不,來下記死聲噪把沒以所之

。的法說個一出給能是上學數,懶麼什為它於至

。法方核——西東老的了究研被就早種一化退會,一舉一的裡練訓在它,候時的致極到寬路網張一當

。晃地輕輕地原在只,窩挪不乎幾路網,開展線次一做點發出著圍於似近,程過練訓個整

。)核切正經神(制機KTN ,字名個有裡子圈在論理套這

。練訓惰懶作稱地象形被則,態狀的”晃輕輕只、不地原“種這而

猜你喜歡

同題材或同分類的其他作品。