《天才操盤,從助理到資本掌舵人》第503章 量化困局(2)

作者:望雲不見山·8天前

覃思琪答道:“目前主要是日線級別的價量資料和基礎財務資料,分鐘線資料已經接進來了,但還在做清洗。Tick級資料成本太高,我們暫時沒碰。”

“特徵工程呢?”林深繼續問,“是直接把原始資料喂進去,還是做了預處理?”

徐嘉偉接過話:“會做預處理,先標準化,再做一定程度的維度壓縮,然後提取滾動統計特徵,比如過去二十日的動量、波動率、換手率這些,每一個特徵都會在驗證集上看貢獻度。”

林深點了點頭,又看向徐嘉偉和高達:“模型架構呢?你們目前用的什麼?”

高達說:“主模型是XGBoost,另外跑了一版輕量級的LST對比。實盤上用的是XGBoost為主,LST時沒有納入正式組合,因為它在實盤裡的勝率表現不如回測穩定。”

“有沒有做驗證?”林深問。

“做了時間序列交叉驗證,還有樣本外驗證。”徐嘉偉說,“回測階段做的是滾動訓練,不是拿全量資料一次性喂進去,這點我們一開始就考慮到了。”

鄭啟銘也補了一句:“資料我們做了多重清洗,行情資料和財務資料分別對齊了時間戳,避免未來函式。”

林深聽他們說得這麼具體,心裡已經大概有了底。這個團隊,至少在基本流程和風控意識上,比很多市場上的量化工作室要規範得多,目前來看他們的流程和框架是沒問題的。

演示結束後,覃思琪把投影關掉,表情認真起來“學長,這就是我們目前的一代模型。實盤和回測都做了,但年化收益一直卡在5.5%附近,怎麼調都上不去。”

林深沒有急著開口,會議室裡也安靜下來,幾個年輕人都在等他說話。

覃思琪又說:“我們翻了很多文獻,也試過不少方法,但效果都不明顯,所以想請你幫我們看看。”

林深靠在椅背上,腦子裡快速把前面看到的內容過了一遍。

一時間,他也說不出問題具體出在哪裡。量化本來就不是他最擅長的方向,當初他自己做的那套模型,主要是針對期貨市場。期貨做的人少,策略同質化還沒那麼嚴重,所以能跑出比較高的收益。後來用的人多了,收益率一路下滑,最終自動休眠。

覃思琪她們現在做的是股票策略,難度比他當年那套大得多。

5.5%的年化,放在機構裡已經不算差了。但機構做量化規模大,策略容量高,大幾千億的量化機構在裡面市場卷,5.5的收益乘以幾十億本金,絕對利潤依然屬於可觀的。

而她們的模型目前最多隻跑過一百萬,離大規模實盤還差得遠,真拿幾十個億的資金去跑,滑點和衝擊成本會把那點收益全部吃掉,甚至可能整個模型直接崩掉。

他朝覃思琪伸出手:“電腦給我看一下。”

覃思琪把筆記型電腦轉過去,螢幕上還停留在剛才演示的策略框架圖上,林深把頁面拉回去,從頭開始,一段一段看。

幾個年輕人誰也沒說話,會議室裡只剩電腦風扇細細的轉動聲。

他看得很慢,從最上層的資料管道,到中段的特徵工程,再到模型訓練和回測輸出,每個模組都點開掃了幾眼。偶爾開啟一個程式碼檔案,跳到關鍵函式那裡看幾十秒。

旁邊的人看不清他到底在看哪一行,只覺得會議室裡的空氣越來越緊。

大約過了十來分鐘,林深重新抬起頭。

“這套模型,已經做得很不錯了。”

這話不是安慰,資料清洗、滾動訓練、交叉驗證、實盤和回測的差異處理,全都算得上規範。哪怕換成他親自上手,也未必能搭得比這更好。

問題到底出在哪呢。

他腦子裡快速把整個框架又過了一遍,他們的思路有沒有問題?沒有。從因子挖掘到機器學習組合,再到風控和實盤,每一步都踩在正道上。

資料有問題嗎?從剛才的介紹看,至少基本的對齊和防未來函式都做了,說明他們不是亂來,是懂行的。模型架構呢?XGBoost加滾動驗證,談不上激進,但也足夠主流。這些環節,該做的都做了,不該犯的錯也沒犯。

猜你喜歡

同題材或同分類的其他作品。