《法師歸來,速通地球!》第4章 你來自哪?(2)

作者:沒想好吃啥·1個月前

不到兩分鐘,回覆出現了。

“ast距離捕捉的是程式如何被寫出來。

執行軌跡捕捉的是程式在取樣輸入上的行為。

我說的是稍微不同的東西:推斷是哪一類反例生成器殺死了哪些候選程式。

如果兩個程式需要同一種對抗性輸入才會失敗,那麼即便它們的語法和普通執行軌跡不同,它們也屬於同一個潛在解法家族。”

伊戈爾端著咖啡回到桌前,想了想,又問:

“這需要知道反例分佈。在程式設計競賽裡,隱藏測試是不可見的。你怎麼避免只是發明出一套帶有自己偏差的基準測試?”

這次light_沒有馬上回復。

過了大約五分鐘,他發來一段更長的回答。

“我們只需要用一組根據題目描述和候選程式行為生成的探針。

對每個候選程式,提取它隱含的假設,然後生成小規模的對抗性探針族,專門攻擊這些假設。

在最終過濾之前,估計候選解的多樣性是否真實存在。如果80%的候選程式都死在同一類探針族上,那麼就可以順利掩蓋一個已經坍縮的策略空間。”

伊戈爾開始認真起來。

他回覆:“假設我們接受這個觀點。那麼指標應該長什麼樣?原始聚類數量?失敗家族上的熵?還是別的什麼?”

“我會定義三個數字。

原始取樣數:生成了多少個程式。

行為倖存數:有多少程式通過了可見測試或樣例測試。

語義有效樣本量:在自適應探針下,還剩下多少個不同的失敗吸引域。

有用的比率增加語義有效樣本量/原始取樣數和語義有效樣本量/行為倖存數。

如果第一個比率很小,說明模型取樣到的只是風格。

如果第二個比率很小,說明過濾器選出來的只是同一個想法的不同變體。

如果兩個比率都會隨著規模提高而提高,那麼模型確實在學習真正的策略多樣性。”

伊戈爾靠在椅背上,仔細一想,臥槽大佬啊,對方給的策略有點可行性。

他看出價值了,沒有再繼續在推特上繼續和對方聊天,而是選擇切換到推特私信裡。

先給light_點了個關注,然後接著問道:“你認為這是程式碼生成特有的問題,還是語言模型的一般性限制?”

“一般性限制,但程式碼把它暴露出來。”

“在語言裡,表面多樣性甚至更具有欺騙性。十個答案看起來可以完全不同,卻共享同一個隱藏框架。”

“程式碼有用,是因為失敗可以被執行給判斷出來。”

”。法方的統系理推斷診泛廣更種一到得能就,間空略策的坍量測裡碼式程在何如到做能們我果如“

”?點一這試測麼怎你,權可許問訪部的edocahpla有沒果如“:題問的銳尖點有個了問,想了想爾戈伊

。法方證驗似近出計設下況的權可許部的edocahpla有沒在能不能方對看看想他

:覆回_thgil,兒會一了過

”。查檢理合次一做夠足例樣開公的裡目題示演用使“

”。目題的釋解或法解生個多了示展中示演些那擇選“

”。族家法解構重手“

”。變抗對生數變不的能可繞圍“

”。敗失起一會否是法解的同不些這較比“

”。大放得值否是法方量測個這斷判以足也,子例個01到5有只怕哪“

。了掌鼓方對為在經已心爾戈伊

”?室驗實慧智工人的atem者或?微是還,作工ianepo在你“

。了法想的人挖要想出冒經已他

。要重最才人是然當?要重最麼什紀世12

。好越去起一人的多越帶麼那,鳴難掌孤人個一,作工克斯馬為要能可有己自

。難點有人群一除開,了易容太人個一除開

。團抱在都家大,團抱在也人國華,團抱在人度印,谷矽在,麼什為是也這

。串一來就個兩了來,兩來就個一了來

。轉運能不能還務業的你,了走們我,量掂量掂先,我除開想你

”。學上在還我“

”?tim是還福坦斯,哦“

”。學大城江“

猜你喜歡

同題材或同分類的其他作品。