《開局一個屬性面板,肝成無雙國士》第213章 兩天!我只需要兩天!(1)

作者:北冥有鯤鵬·2個月前

趙陽沒有立刻給出答覆,他表情嚴肅地看著幕布上的基因表達調控網路圖,此時他的大腦正在飛速運轉。

在179智商的推演下,結合他LV5的數學和資訊學等級,很快,他腦海中構建出了幾種處理這種高維度生物資料的數學模型。

“常規的負二項分佈模型處理這種帶有大量重複序列的資料,必然會導致方差估計不準。”

沉默了一會兒之後,趙陽看著顧明教授和周圍的眾人,緩緩說出了自己的分析。

“這種農作物本身的基因組過於龐大,市面上現成的商業生信分析軟體,底層的統計算法大多是基於普通的二項分佈或者泊松分佈。在面對海量重複序列和測序深度不均時,極其容易將背景噪音放大,這就是你們得出幾萬個假陽性差異基因的根本原因。”

會議室裡的眾人都安靜地聽著。兩個研二的學長連連點頭,他們這幾天被這些假陽性資料折磨得痛不欲生。

“我來吧,教授。你把測序的原始資料檔案全部複製給我。”

趙陽看著顧明教授,首接給出了最終的解決方案。

“我回去重新寫一個比對和定量演算法。不用現成的軟體,我首接在底層用隱馬爾可夫模型(HMM)和多維主成分分析(PCA)結合的方式,對你們的表達量矩陣進行重新聚類。”

趙陽的語氣裡帶著絕對的自信。

“隱馬爾可夫模型可以透過觀察到的測序序列序列狀態,推斷出隱藏的真實基因表達狀態,最大程度濾除測序儀產生的物理噪音。然後用PCA降維,剝離次要因素。”

“我會盡可能地將假陽性的範圍壓縮到一百個基因以內。然後結合加權基因共表達網路分析,找出連線度最高的Hub基因。最多兩天時間,我給你們一個個位數的候選基因列表。你們首接拿去打抗體或者做qPCR驗證就行了。”

會議室裡安靜了下來。

周圍眾人眼神之中都帶著不可思議的目光看著趙陽。

兩天?

那兩個學長面面相覷,都從對方的眼裡看到了震驚。

這裡面的原始測序資料可是以TB來計算的!光是把這幾個TB的FASTQ檔案在電腦裡解壓讀取一遍,普通的伺服器都需要十幾個小時。

自己寫底層演算法?還要在兩天內跑完資料,輸出最終的個位數靶點列表?

兩天時間也太短了。這在傳統的生物資訊學分析流程裡,是絕對不可能完成的任務。

“兩天時間夠嗎?”

顧明教授也有些遲疑地看著趙陽。他知道趙陽在數學和計算機上極強,但這畢竟是龐大的資料。

“我們這個實驗倒也是沒有那麼急,距離結題還有一段時間,你可以多花點時間穩妥處理……”

“夠了。”

趙陽笑著搖了搖手,打斷了顧明教授的話。

“不過就是洗資料改演算法的事情。底層的數學邏輯我剛才己經在腦子裡建構完了,剩下的只是敲程式碼和讓CPU跑運算的物理時間。兩天時間足夠了。”

“真不愧是數學天才!計算機天才!真厲害啊!”

顧明教授興奮地說道,雙手用力搓了搓。

猜你喜歡

同題材或同分類的其他作品。