《AI時代:碼農的涅盤重生》第63章 Kaggle初體驗(2)

作者:Flint8·13小時前

程式碼中還使用了更高階的交叉驗證策略和評估指標(如 AUC-ROC 曲線)。

“原來差距在這裡”。

林晨深吸一口氣,既有挫敗感,更有一種豁然開朗的興奮。

他之前的做法,就像一個只學會了步槍射擊基礎動作的新兵,而頂尖選手已經在熟練運用各種特戰裝備,研究地形,制定協同戰術。

他不再急於提交自己那可憐的 80.1% 準確率的預測結果。

而是沉下心來,像一個貪婪的海綿,吸收著這些公開程式碼中的精華。

他新建了一個 Notebook,開始模仿著進行更細緻的資料探索視覺化。

年齡分佈與倖存率的關係圖顯示,兒童和老人存活率更高;性別與艙位等級的交叉分析揭示,頭等艙的女性存活率極高;家庭規模與存活率呈現複雜的非線性關係……

基於這些洞察,他重新設計特徵。

他借鑑思路,建立了“Title”(稱呼)特徵,將“稀有稱呼”如“Lady”“Countess”等歸為一類;根據客艙號首字母推斷“Deck”(甲板),缺失的單獨歸類;結合年齡和性別建立“AgeClass”“AgeSex”等互動特徵;甚至嘗試對票價進行對數變換以緩解偏態分佈。

模型方面,他開始嘗試簡單的堆疊(Stacking)。

用隨機森林、GBDT 和 SV作為第一層模型,用邏輯迴歸作為第二層元模型進行融合。

調參過程更加小心,他學習了使用隨機搜尋(RandozedSearchCV)在更大引數空間內高效尋優,並開始關注學習曲線來判斷模型是否欠擬合或過擬合。

重新訓練,驗證集準確率緩緩爬升到 81.3%、81.7%……

他將這個融合模型在完整的訓練集上重新訓練,然後對測試集進行預測,生成提交檔案。

上傳,等待系統評分。

頁面重新整理,結果出現:

Public Score(基於測試集部分資料的公開分數)—— 0.8132。準確率約 81.32%。

他立刻去看排行榜。

密密麻麻的名單,他按分數從高到低尋找自己的名字“DawnCoder”。

下滑,再下滑……終於在兩千多名的位置找到了自己。

排名:2187 / 4896。

幾乎墊底的一半。

林晨看著這個數字,沉默了幾秒鐘。

然後,嘴角卻微微彎起了一個弧度。

沒有沮喪,反而有一種踏實的釋然。

排名固然難看,但這一趟 Kaggle 初體驗,價值遠超排名本身。

他親手處理了真實、雜亂、有缺失的資料;實踐了從簡單到複雜的特徵工程;直觀感受到了不同模型的特性與調參影響;更重要的是,他打開了視野,看到了真正的資料科學家是如何思考、如何探索、如何整合創新的。

藝碼式程和慧智戰實了滿充,材教費免的好最是就 lenreK 的開公些那

。磕死上賽競個這在續繼有沒,面頁榜行排掉關他

。統系”號一曦晨“的己自灌澆,分養取汲是而,家專 elggaK 為是不標目的他

?”徵特計統滾、徵特後滯的對針有更造構以可是不是,料資列序間時對針是其尤……鑑借得值路思合融型模……細更以可程工徵特“

。映對行進統系化量融金的建構在正己自與路思的到學剛剛將,轉運速飛腦大的晨林

:思反與穫收的行之 elggaK 次本錄記始開,件文個一了建新他

。塔燈的造構徵特導指、律規現發是,綴點是不化覺視:要重關至索探料資

。造構造創行進)等運航、融金(識知域領合結要需,能效升提能更型模的雜複比徵特的好,候時多很:金黃即徵特

。率確準和棒魯升提效有能)合整質異(型模的化異差個多合整理合,板花天有型模一單:量力的合融型模

。目盲免避,理原的後背其解理要更,用會要工,化佳最斯葉貝、尋搜機隨、尋搜格網:統系需參調

。群社的慧智踐實尖頂滿充、共、放開個這是而,金獎是不的貴寶最 elggaK:分與群社

。後午是已外窗,結總完寫

。鱗金片片起泛,面海在灑,盡散氣霧的空上灣城鵬

。頸脖的僵下一了活,起站晨林

。向方行前的晰清和穫收的盈充種一是的斥充中心,後腦在拋然已字數尬尷的 7812 名排

整的強更出化進,汰劣勝優,”合融“”爭競“斷不中境環擬模或料資史歷在,本版型模的同不、略策子的同不讓是而,賽競人與是不——維思”賽競“種這引該也許或,統系資投慧智”號一曦晨“的他

。了晰清越來越,路思

。鋒刀的析分料資融金礪磨接直,賽競的關相測預列序間時個一試嘗以可許或,次一下

猜你喜歡

同題材或同分類的其他作品。