長錦小說網 > 都市言情 > 學霸的征途是星辰大海 > 第108章意外的物理學經驗

2025年1月,還有一件事對徐辰影響很大。

這個月,發生了一件科技界的大事。

各大國內主流新聞app的頭版頭條都在推送一條消息:

標題,充滿了科技感與衝擊力。

【「中國ai的『gpt-4時刻』?deepseek-r1橫空出世,性能全麵超越,並宣布開源!」】

「deepseek-r1?」徐辰的眉毛,微微一挑。

(請記住看臺灣小說就上臺灣小說網,?????.???隨時看網站,觀看最快的章節更新)

在過去的幾個月裡,以chatgpt為代表的大語言模型(llm),如同平地驚雷,在全球範圍內,掀起了一場前所未有的科技革命。

【大語言模型……ai……】

徐辰的心中,泛起了一絲好奇。

他雖然主攻的是純粹數學,但對於這些代表著人類科技最前沿的「時髦」玩意兒,也並非一無所知。

他打開電腦,搜索到了deepseek-r1的開源論文。

他饒有興致地,開始閱讀起來。

論文的前半部分,是關於模型訓練所使用的數學理論。

「……我們采用了改進的『註意力機製』(attentionmechanism),其核心,是將輸入序列中的每一個詞向量,都映射到『查詢(query)』丶『鍵(key)』丶『值(value)』這三個向量空間中。通過計算query與所有key的點積相似度,並進行softmax歸一化,來得到每個value的權重……」

【嗯,有點意思。】徐辰的眼中,閃過一絲了然。

【這個思路,本質上是線性代數中『投影』與『加權平均』思想的一種精妙應用。它通過點積來衡量向量間的『相關性』,再用softmax函數將這種相關性轉化為概率權重,從而讓模型能夠動態地聚焦於輸入序列中最關鍵的部分。】

「……在優化器(optimizer)的選擇上,我們采用了adam算法,它結合了『動量法』(momentum)和『rmsprop』的優點,能夠自適應地,為不同參數,調整學習率……」

【原來如此。】徐辰點了點頭。

【這可以看作是常微分方程中『梯度下降法』的一種高級變體。它引入了『動量』這個物理概念,模擬一個在損失函數曲麵上滾動的小球,利用慣性衝過平坦區域和局部極小值點,從而加速收斂。而自適應學習率,則相當於為這個小球,在不同陡峭程度的路麵上,配備了智能的刹車和油門係統。】

論文中那些在ai工程師看來,極其高深複雜的數學原理,在徐辰這個lv.2級彆的「數學家」眼中,卻如同庖丁解牛,每一個結構,每一處關節,都清晰可見。

他隻花了不到半個小時,就將論文中所有的數學部分,全部吃透,甚至還能舉一反三地,思考出幾種可能的改進方向。

【整個大語言模型,從數學上看,可以被視為一個極其高維的丶非線性的函數逼近器。它的訓練過程,就是在數十億甚至數千億個參數構成的空間中,通過梯度下降,尋找一個能最小化『損失函數』的最優解。而『註意力機製』,則為這個龐大的函數,提供了高效的『剪枝』策略,使其能夠專註於處理長距離的依賴關係。】

然而,當他看到論文的後半部分,關於「神經網絡架構」和「模型訓練」的內容時,他的眉頭,卻漸漸地,鎖了起來。

「transformer架構」丶「多頭註意力」丶「殘差連接」丶「層歸一化」……

這些屬於計算機科學和人工智慧領域的專業術語,對他而言,就如同一個個陌生的路標,指向一片他從未踏足過的未知領域。

如果不了解神經網絡為什麽能擬合任何函數(萬能逼近定理),對後續的深層神經網絡乃至於transformer架構就更加不知道具體的工作機製了。

【對於ai,確實還存在著巨大的『盲區』。】

他冇有氣餒,反而燃起了一股強烈的求知欲。

他打開電腦,開始在網上,瘋狂地,搜索著關於「大語言模型」的基礎知識。

從最基礎的「感知機」模型,到「深度神經網絡」,再到「循環神經網絡(rnn)」和「長短期記憶網絡(lstm)」,最後,才是當今大模型的核心——「transformer」。

就在他將一篇關於「transformer」核心架構的經典論文——《attentionisallyouneed》,看到一半時。

他腦海中,那冰冷的係統提示音,毫無徵兆地,響了起來!

【叮!檢測到宿主正在學習『人工神經網絡』相關知識,認知邊界拓展……】

【信息學經驗值+2!】

【物理學經驗值+1!】

【生化學經驗值+1!】

「嗯?!」

徐辰的動作,猛地一頓!

他有些難以置信地,調出了自己的係統麵板。

信息學經驗值+2,很好理解,因為ai就是通過計算機來實現的,計算機相關的知識自然屬於信息學的範疇。

但是,在「物理學」和「生化學」那兩條幾乎還是空白的經驗條後麵,都出現了一個小小的「+1」!

【什麽情況?!】

【我明明是在學計算機和ai,怎麽會加了物理和生化的經驗?!】

【係統,你是不是出bug了?】

他先是一愣,隨即,陷入了沉思。

【生化學經驗+1,這個……倒還勉強能夠理解。】

【畢竟,『神經網絡』這個詞,本身就是對人腦神經元結構的仿生學模擬。我學習它的工作原理,就等於,是在從一個抽象的丶信息學的角度,去間接地,理解生物大腦的構造。這算是了解生物構造的一部分,倒也是說得通。】

【但……物理學經驗+1,又是怎麽回事?】

【ai和物理,感覺八竿子都打不著啊!】

他百思不得其解。

他繼續向下閱讀那篇論文,試圖從更深層次的理論中,尋找答案。

當他看到「hopfield網絡」與「ising模型」之間的深刻聯係,看到「深度學習」的訓練過程,如何可以被類比為「模擬退火」這個源自於統計物理學的算法時,他才恍然大悟。

【原來如此!】

【一個由數十億丶甚至數千億個參數構成的巨大網絡,其整體行為,已經無法再用單個神經元的簡單邏輯來描述。它呈現出的,是一種『集體效應』,是一種『湧現』現象!】

【而研究這種由海量個體構成的複雜係統的宏觀規律,恰恰是『統計物理學』最擅長的事情!】

他又搜索了一些ai與物理學的相關信息,搜索結果的第一條,就是一條剛剛過去幾個月丶還帶著熱度的重磅新聞。

【「2024年諾貝爾物理學獎揭曉!授予約翰·霍普菲爾德與傑弗裡·辛頓,以表彰他們為機器學習,特彆是人工神經網絡所做出的奠基性發現!」】

「諾貝爾物理學獎……頒給了ai方向?」

頒獎是在10月,剛好是徐辰進入拔尖計劃冇多久的時候。那會他每天忙的都冇時間吃飯,自然冇時間關註外界這些新聞。

當時,這個結果,在全球範圍內,都引起了巨大的爭議。

許多人質疑:「ai是計算機科學,憑什麽拿物理學獎?」

但徐辰此刻,卻瞬間,理解了諾貝爾獎委員會那超越時代的深刻用意!

【我明白了……】

他看著屏幕上,關於「hopfield網絡」的介紹,心中思索:

【霍普菲爾德,他天才般地,將神經網絡中的神經元狀態(激活或抑製),與統計物理學中的『自旋玻璃』模型(spinglass)中的磁矩朝向(向上或向下),進行了類比!】

【他定義了一個『能量函數』,使得網絡的每一個可能狀態,都對應一個能量值。而網絡的『學習』和『記憶』過程,就等同於,這個物理係統,自發地,向著能量最低的丶最穩定的狀態演化的過程!】

【他用物理學的語言,為『記憶』這個看似屬於生物學和心理學的概念,賦予了一個清晰丶可計算的數學模型!這是一種石破天驚的丶跨學科的偉大洞見!】

【而辛頓,則在此基礎上,發展出了『玻爾茲曼機』,引入了『溫度』和『概率』的概念,讓神經網絡,能夠跳出『局部最優解』的陷阱,去尋找全局的丶更優的解!這,不就是『模擬退火』算法的核心思想嗎?!】

【他們兩人,不是在『發明』ai,他們是在『發現』ai背後,那與宇宙運行規律如出一轍的丶更深層次的『物理法則』!】

【諾貝爾獎委員會,不是在獎勵一個『計算機算法』,他們是在獎勵一種『世界觀』!一種將信息丶智能丶與物質丶能量,統一起來的丶全新的世界觀!】

想通了這一點,徐辰的心中,掀起了滔天巨浪!

他第一次,如此清晰地,感受到了不同學科之間,那隱藏在最底層丶相通的深刻聯係!

【看來,係統是對的。】

【數學丶物理丶化學丶生物丶信息……這些,從來都不是孤立的學科。它們隻是人類,為了方便理解,而從不同角度,對同一個『宇宙真理』,進行的『管中窺豹』而已。】

這個發現,讓他對整個科學大廈的認知,再次,躍遷到了一個新的維度!

他也對ai這個領域,產生了更加濃厚的興趣。

……

【如果,我能有一個足夠強大的ai助手,來幫我處理那些繁瑣的丶重複性的工作,比如,查閱文獻丶整理資料丶回複常規郵件,甚至……幫我進行一些大規模的數值計算和猜想驗證……】

【那我的研究效率,豈不是能得到指數級的提升?】

這個念頭一起,便如同燎原的野火,再也無法熄滅。

但他同樣清楚,目前市麵上所有的大語言模型,包括這個最新的deepseek-r1,都存在一個致命的丶源於其底層原理的缺陷——「幻覺」。

它們的本質,不是「理解」,而是「預測」。

它們隻是在根據海量的語料庫,去計算出下一個詞語出現的「最大概率」。

這種機製,決定了它們在處理事實性丶邏輯性要求極高的任務時,偶爾,會一本正經地,胡說八道。

對於日常生活來說,這種小錯誤,無傷大雅。

但對於要求100%精確的數學研究來說,任何一個微小的錯誤,都可能是致命的。

【看來,想要一個真正可靠的丶能用於嚴肅科研的ai助手,還得靠自己啊。】

他心中暗道。

【不過,這個領域,太複雜了。它是一個融合了數學丶計算機丶物理學丶神經科學的『交叉學科』。以我現在的知識儲備,還遠遠不夠。】

【等我的數學等級,提升到lv.3,或許,可以花點時間,係統地,研究一下這個方向。】

他為自己,又立下了一個長期的「小目標」。

然後,他關掉了手機,站起身,伸了個懶腰。

……