第1104章你說的這些,叫做大模型
“哈哈,今年的春招,甘總幾乎把國內相關領域的應屆生,碩士生,博士生都給招來了,不少人已經開始辦入職手續了。”
“就是春招的質量不如秋招的,不過你放心,今年秋招規模比春招更大。”
成文飛笑了一下,這個陳總看來投入的決心真的不小,竟然敢把國內相關專業的學生全都打包。
國內的情況再差,那一口氣全招來起碼也得有個千八百人呢。
“哦對了,還有一個沈天行教授,是當年沈老的表侄,不出意外的話今年可能也會入職咱們紅星,到時候你們可以多交流一下,他在斯坦福就是專攻gpu架構層以及視覺加速的。”
“誰?”
“沈天行?”聽到沈天行的名字,成文飛明顯愣了一下,“斯坦福會放人?”
“當年他們放走一個沈永健,可是被cia各種電,就差在他們學校建設一個核電站了。”
作為行業內的人,成文飛也知道當年那個能手搓芯片的沈老,也自從他以後,斯坦福就成了微電子的聖地,現在陳星說把沈老的表侄給招了過來。
那斯坦福能放人?
萬一這位沈天行也值五個師呢?
“哈哈,放不放人我不操心,這是甘總應該操心的事情。”
“行了,成教授,你具體的項目,方向,等你安頓下來,可以起草一份報告給我,我來審批你的項目。”
陳星想的很清楚,字研,字研。
那得先有項目不是。
所以他需要成文飛先立項,看看先做哪方麵,是計算框架,還是其他方麵的。
當然,現在基礎太薄,陳星想讓他做神經網絡推理引擎,也就是側端推理庫也冇辦法。
訓練都還冇開始有呢,怎麼讓模型在推理引擎上跑?
成文飛組織了一下語言,這個問題他在答應入職紅星以後就一直在想,紅星在這方麵冇有任何的基礎,隻有陳星的一個決心而已。
自己就必須從最基礎的做起,先做一個深度學習計算框架,然後是分布式訓練調度子係統,最後才是神經網絡引擎。
其中分布式訓練調度子係統是最重要的,搞定了單機多卡、多機集群調度,梯度分片、梯度聚合,任務分配後,自己才有充足的理由讓陳總建設更多,更大的算力中心。
有了算力中心以後,是吧……
“陳總,我是這麼想的,首先要搭建一個框架,這是所有模型的基礎,項目名字叫做大規模時序神經網絡仿真底座,然後分布式調度、推理引擎、時序信號工具鏈、數據流水線、硬件適配層,層層展開。”
“具體的內容稍後我會整理出來給到您。”
陳星對成文飛的狀態非常滿意,這就是大牛的厲害之處。
他能總攬整個項目,不同的項目,不同的分工,不同的方向,都是由他進行分配。
也可以稱之為總工程師。
說到這裡,成文飛猶豫了一下,看了一眼陳星。
陳星也看出他似乎有什麼話要說,主動問道:“成教授,你加入紅星,那麼咱們就是一家人,有什麼話都可以暢所欲言的。”
“是方向有問題還是說其他的?”
聽到陳星這麼說,成文飛深吸一口氣,鼓起勇氣說道:“陳總,過去幾年我一直在想一個問題,目前大家都在做窄模型,也就是語音一套,做圖像另一套網絡,模型不能互相複用。”
(本章未完,請點擊下一頁繼續閱讀)第1104章你說的這些,叫做大模型(第2/2頁)
“做的都是大規模神經網絡、大型深度網絡、無監督預訓練網絡,準確的來說是先用大量無標註數據學通用特征,再拿少量標註數據適配具體任務,bengio、hinton都做過相關研究。”
“我就在想,那麼可不可以做一套巨型神經網絡底座,在海量無標註公開數據上做無監督預訓練,學習通用世界知識,之後不需要完整重訓,簡單適配,就可以處理語言、對話、圖像推理等大量不同任務。”
“它可以擁有巨大參數量、海量訓練語料、足夠強悍的並行算力,或者說我們這個模型不是為某一個單一功能寫死,而是先學常識,再去解決任務。”
“最後實現能自然對話、邏輯推理,接近人的認知。”
說完以後,成文飛觀察著陳星的表情,結果發現這位新老板臉上充滿了驚訝,於是趕緊補充道,“陳總,我知道現在不可能直接實現成品,這也隻是我的一個想法,但我們可以提前把所有底層基礎設施全部搭建完成。”
“這是我們長遠目標,目標。”
“現在可以為這個目標做好地基。”
陳星此時此刻內心處在狂喜之中,成文飛不愧是成文飛。
他說的是大規模神經網絡,大型深度網絡。
這些詞在未來有一個更加準確的稱呼。
叫做大模型!
2013年啊,成教授就已經有大模型的概念,通用模型的模糊概念了!
“不不不,成教授,你說的也是我想說的,我的設想就是構建一個規模足夠大的神經網絡,先用海量無標註數據預訓練,學習世界的通用表征,之後不需要全部重訓,隻做少量調整,就可以處理語言、對話、甚至圖像等多種任務。它不是agi完整的通用人工智能,但它是通向agi的一塊核心基石。”
“為了擁有這塊基石,我才邀請成教授你到紅星來的。”
“而你說的這些,可以稱之為大模型。”
成文飛此時也產生了一種異樣的感覺。
陳總好懂啊。
陳總好懂我啊。
這套理論他之前在賓夕法尼亞的時候也和業內人士說過,隻不過他們都說自己異想天開。
還大型深度學習網絡,現在的cpu算力集群怎麼可能處理得了海量數據。
更彆提訓練了。
所以那時候成文飛就知道,cpu算力集群,一定會被淘汰掉,效率太低太低了。
想實現真正的模型訓練,必須要有效率更高的方式,黴國那邊目前大家都在嘗試用圖形計算卡來實現,隻不過還冇有廠商有成果和論文在學術界出現。
不過成文飛覺得,用分布式的gpu進行訓練,絕對是未來的方向,所以半個月前聽到甘良才說紅星在自研gpu和計算卡的時候,就明白一件事。
紅星的在一些方向上,是確定的,是開始行動的,是走在黴國很多機構和公司前麵的。
“那麼陳總,要實現你所謂的大模型,我口中的大型深度網絡,就必須要有足夠的算力,現在的cpu計算到了一定瓶頸,大家準備轉向gpu並行計算,那我想問一下,這方麵咱們紅星是怎麼打算的?”
陳星不語,走到自己辦公桌前,並示意成文飛也過來。
然後拿出了無冬大師給自己的那份報告。
“成教授,你先看看這個。”