第1745章一句話點醒了賈瀞雯
辦公室裡安靜得能聽見服務器風扇轉動的聲音。
李明盯著屏幕,右手放在鼠標上。
他點了一下,屏幕中央的小沙漏開始轉。
一秒,兩秒,三秒……十秒過去了。
屏幕終於刷新,顯示出一列結果。
“還是慢。”他歎了口氣。
賈瀞雯站在他身後,看著那些搜索結果。
李明剛才輸入的是“電腦價格”,出來的結果有七八條,但隻有兩條真正和電腦價格有關。
一條是電腦公司的介紹,另一條是去年的舊新聞。
剩下的,有一條是“電影《電腦奇俠》”,還有幾條是其他完全不相關的內容。
“準確率多少?”賈瀞雯問。
張濤在另一臺電腦前算了一下:“剛測了五十個關鍵詞,隻有十五個返回了有用結果。
準確率……百分之三十左右。”
會議室裡一片沉默。
五個年輕人都在,臉上的表情都差不多——疲憊,還有點沮喪。
他們已經連續工作了兩個月,做出了這個能跑起來的搜索引擎。
可效果實在不理想。
“速度呢?”賈瀞雯又問。
“平均響應時間十二秒。”王磊說,“最慢的一次等了半分鐘。
這還隻是在我們內網測試,如果放到真實的網絡上,有延遲,有帶寬限製,可能更慢。”
賈瀞雯點點頭。
她走到白板前,看著上麵密密麻麻的架構圖。
爬蟲、索引、分詞、排序……每個模塊都做了,每個模塊都能工作,可組合起來就是這個結果。
“問題出在哪兒?”她問。
李明站起來,走到白板前:“首先是索引結構。
我們現在用的是最簡單的倒排索引,但數據量一大,查詢效率就低。
需要優化數據結構。”
張濤補充:“分詞也有問題。
基於詞典的方法太死板,很多新詞、專業詞切分不準。
比如‘奔騰處理器’,我們的詞典裡冇有這個詞,就切成‘奔騰’和‘處理器’,但用戶可能搜‘奔騰處理器’整個詞。”
“排名算法也不夠聰明。”王磊說,“現在基本是按關鍵詞出現次數排序,但這樣很容易被垃圾頁麵鑽空子。
一個頁麵堆滿關鍵詞,就能排到前麵,可內容根本冇價值。”
賈瀞雯聽著,一條條記在本子上。
她知道這些技術問題,但她更知道另一個問題——時間。
錢花得比預期快。
服務器托管費、帶寬費、團隊工資……五百萬已經用掉一百多萬。
如果遲遲做不出像樣的產品,後續資金壓力會很大。
更關鍵的是信心。
團隊的熱情需要正反饋來維持,如果總是失敗,再好的願景也會磨滅。
“今天先到這裡。”賈瀞雯合上本子,“大家回去休息吧,明天再想辦法。”
年輕人們默默收拾東西離開。
賈瀞雯最後一個走,關了燈,鎖了門。
回到租的公寓,已經是晚上十一點。
她冇開燈,直接倒在沙發上。
窗外是北京的夜景,遠處有霓虹燈閃爍。
她拿出手機,翻到陳浩的號碼,猶豫了很久才撥出去。
電話響了七八聲才接通。
“喂?”陳浩的聲音帶著睡意,“瀞雯?這麼晚了。”
“浩哥,我……”賈瀞雯開口,聲音有點啞,“我們今天測試了搜索引擎。”
“怎麼樣?”
“不太好。”賈瀞雯實話實說,“速度慢,平均要十幾秒才有結果。
準確率低,隻有百分之三十。
(本章未完,請點擊下一頁繼續閱讀)第1745章一句話點醒了賈瀞雯(第2/2頁)
團隊有點……泄氣。”
她停頓了一下,繼續說:“我也……壓力有點大。
錢花得比預期快,效果卻出不來。
我有時候想,是不是我能力不夠,是不是換個懂技術的人來管會更好。”
電話那頭安靜了一會兒。
“瀞雯,”陳浩的聲音清醒了一些,“你聽我說。
首先,你做得很好。
從零到有,你們已經做出了能工作的搜索引擎,這本身就是突破。”
他的聲音很溫和:“速度慢,準確率低,這太正常了。
知道穀歌的第一版準確率多少嗎?也差不多這個水平。
所有新技術都是從粗糙開始的。”
“可是……”賈瀞雯想說些什麼。
“冇有可是。”陳浩打斷她,“你現在需要做的不是自責,是調整策略。”
賈瀞雯坐直身體:“怎麼調整?”
“分階段解決。”陳浩說,“速度和準確率是兩個問題,不能同時解決。
我建議,先不管準確率,全力擴大收錄量。”
“什麼意思?”
“你們現在收錄了多少網頁?”陳浩問。
“一萬左右。”
“太少了。”陳浩說,“一萬個網頁的搜索引擎,就像隻有一百本書的圖書館,再好的檢索係統也冇用。
用戶搜什麼,你都可能冇有。
所以第一要務,把收錄量做上去。
十萬,一百萬,越多越好。”
賈瀞雯思考著:“可是收錄量大了,速度不是更慢嗎?”
“那是下一個階段要解決的問題。”陳浩解釋,“你先讓用戶能搜到東西,哪怕準確率隻有百分之三十,但如果網頁基數大,用戶總能找到一些有用的。
有了這個基礎,我們再優化算法,提高準確率。”
他頓了頓:“瀞雯,做產品不能追求完美。
尤其是創業階段,先做出能用的東西,讓用戶先用上,再慢慢改進。
如果總想一步到位,可能永遠走不出實驗室。”
這句話點醒了賈瀞雯。
她想起陳浩之前說的——第一版可以粗糙,但要快。
“我懂了。”她說,“先解決有冇有,再解決好不好的問題。”
“對。”陳浩笑了,“明天就這樣跟團隊說。
集中力量擴大爬蟲規模,優化抓取效率,把收錄量做上去。
至於速度和準確率,暫時放一放。”
電話打了半個多小時。
掛斷時,賈瀞雯覺得心裡踏實了很多。
她打開燈,拿出筆記本,開始寫新的工作計劃。
第二天開會,她把陳浩的策略傳達給團隊。
“陳總說,我們現階段的目標是收錄量。”賈瀞雯在白板上寫下“十萬網頁”四個字,“三周時間,把收錄量從一萬做到十萬。”
李明眼睛一亮:“這個思路對!現在我們總是糾結算法優化,但數據量太小,優化了也看不出效果。
先把數據堆上去,再談怎麼用好這些數據。”
張濤也點頭:“爬蟲部分其實可以改進。
我們現在是單線程抓取,太慢。
可以改多線程,同時抓多個頁麵。
還可以優化去重算法,減少重複抓取。”
“索引結構也要調整。”王磊說,“數據量大了,現在的結構肯定撐不住。
得設計新的存儲方案。”
團隊重新有了方向。
當天下午,他們就開始分工:李明負責優化爬蟲,張濤改進索引結構,王磊和其他兩人處理數據存儲和服務器擴展。
【跪求禮物,免費的為愛發電也行!】