1997年3月的第一個星期一,蘇雨桐抱來一隻裝滿軟盤的鐵盒。
三所高校的小範圍測試已經執行四個月,累計查詢越過一萬次。早先那一百零五張評分表還能逐頁裝訂,如今僅列印查詢文字就要幾百張紙,更別說其中夾著撥號來源、點選時間和可能指向具體學生的內容。
她沒有把鐵盒交給兼職學生,先在馬飛面前封掉原始日誌的複製口。
蘇雨桐提出把它們做成第一份真實基線。
“先去掉能識別人的東西。”她說。
日誌裡原本儲存了撥號來源、訪問時間、完整查詢和點選記錄。它們對復現問題有用,也可能暴露某個學生在查什麼。
馬飛同意只保留按日打亂後的查詢文字、結果位置和是否開啟來源頁。原始撥號標識在生成統計後刪除,問題工單需要回訪的樣本則單獨徵得報告人同意。
刪除前,周成要求保留一份“以防以後有用”。蘇雨桐讓他具體寫出用途和儲存期限。他寫了三行,又全部劃掉——除了模糊的“也許”,沒有一項是當前專案需要。
三個人守著資料轉換完成。馬飛核對記錄數,蘇雨桐抽查打亂結果,周成親手執行刪除。螢幕提示釋放了十一兆空間,他盯著那個數字說:“原來不要的資料也會越攢越重。”
“硬碟滿了會響,人被看透不會響。”蘇雨桐把刪除日誌列印簽字。
周成不理解:“我們自己儲存,誰會看?”
“以後人多了,就不只我們看。”蘇雨桐說,“規則要在資料不值錢的時候定。”
一萬零四百三十七次查詢被分成七類。
分類不是程式自動做的。前三百條由馬飛和蘇雨桐分別標,分歧最多的是“機構或人名”與“概念解釋”。有人只輸入“錢學森”,可能找人物,也可能找某篇文章作者。兩人爭到晚上,最後加上“無法判斷”,不再強迫每條資料符合漂亮分類。
半地下室的牆不夠貼,五金店老闆借來兩塊貨架背板。查詢分佈圖掛上去以後,進門的人都得側著走。老闆看見“錯別字與拼音”佔了一欄,試著輸入自己公司被寫錯的名字,系統竟然真找到了庫存介紹。他第二天便把兩個經常寫錯的貨號整理給周成,要求客戶系統也加上別名。
明確題名。
作者加主題。
只記得一句話。
概念解釋。
機構或人名。
錯別字與拼音。
無法判斷。
結果很快推翻了他們的直覺。
演示時最常用的專業主題詞,只佔不到兩成。更多人輸入殘缺題名、作者姓氏、年份,或者一句記得並不準確的話。拼音查詢很少,卻不是零。最長的一條查詢有四十六個字,像使用者把整段問題都塞進了輸入框。
馬飛曾以為,搜尋的核心是把網頁按重要性排好。
真實日誌卻告訴他,第一步常常是猜出使用者到底在找什麼。
蘇雨桐把“複合材料疲勞”與XC-0002放到同一組,建立連續詞、題名欄位和作者欄位的對照測試。她沒有為每種查詢單獨寫規則,而是先規定評價方法。
每條查詢由兩個人獨立判斷前十條結果。
。分兩記關相全完
。分一記關相分部
。分零記關無








