第386章,專業知識有點多
ps:這一堂課我是從姚先生的公開課視頻上扒下來的,也是李東後續搭建大模型的基礎,所以沒辦法一句話帶過。
進來的老人,正是姚先生。
姚先生的背,有些彎可看著卻不佝僂。
圖靈獎,這座計算機行業的諾貝爾獎就是他捧回華夏的。
二十年前,他把美國的房子賣了,終身教職也辭了,一個人回到了水木。
回來的第一件事,不是先去搭自己的實驗室,而是給本科生開了一門當時國內壓根沒人開過的課。
後來就有了姚班,又有了眼前這間教室所在的智班。
這條路上能數得出名字的好苗子,十個里有八九,都是從他手底下走出來的。
姚先生進了教室,就感覺今天班上的氛圍有點不太對勁。
底下的學生還在議論,不少人時不時回過頭,往教室後排那個角落裡看。
他順著那些目光看了過去。
然後,就看見了李東。 李東也正看著他。
四目相對,姚先生臉上的皺紋舒展開來,沖他不動聲色地點了點頭。
李東也笑著,點了點頭。
此時站在一旁的助教,已經把課件投到了智慧黑板上。
屏幕一亮,大家這才把目光從李東身上收了回去。
今天這節課,姚先生講的是《人工智慧應用數學》。
這門課是從他當年那門《計算機應用數學》里拓展出來的。
說起來這門課和田鋼手裡那個「ai for math」,其實是反著來的。
田鋼琢磨的是讓ai去替數學家打工,是拿ai去做數學。
而姚先生這門課是拿數學把ai本身講清楚。
它憑什麼能學會東西,它訓練的時候腦子裡到底在發生了什麼,它為什麼又時靈時不靈的。
而這些對眼下的李東來說,正是他需要的。 ……
姚先生在黑板上畫了一道曲線,上面稀稀拉拉點了七八個點。
「我先問你們一個特別外行的問題,」他轉過身帶著點笑意,「七個點,我要拿一條曲線把它們全串起來,按你們高中學的幾次的多項式夠用?」
底下有人小聲答:「六次。」
「對,六次就夠,七個點七個係數,嚴絲合縫。」
姚先生點了點頭。
「那我要是給它配上一百萬個係數呢?」
本書首發 讀小說就上 TW 看書網,𝗌𝗁𝗎.𝗍𝗐超順暢 ,提供給你無錯章節,無亂序章節的閱讀體驗
這下教室里安靜了下來。
姚先生這裡其實就是在說ai模型了。
如果模型的參數比已知的數據點還要多,為了死死踩中這七個點,這條曲線就勢必會在空隙處劇烈震盪,把真實的走勢扯得稀爛。
這也是算法界永遠繞不開的一道坎——偏差與方差的權衡。
簡單的說就是模型太簡單了腦容量不夠,這叫叫欠擬合。 模型太複雜了又會把數據里那些干擾項當成真理給記下來,當你換道它沒見過的新題時,它就會當場抓瞎,這就叫過擬合。
參數越多,這過擬合的症狀,理論上就越致命。
幾十年來,大家都是這麼覺得的。
「可現在的事,邪門就邪門在這兒。」
姚先生在「一百萬」那個數字底下畫了道線。
「我們今天拿來用的那些大模型,參數動輒上千億,遠比餵給它的數據還多。」
「照理說它們早該過擬合到沒法看了。」
「可它們偏偏沒有。」
「它們不光沒爛,反而學得一個比一個好。」
他轉過身在黑板上寫下三個字。
【為什麼?】
接下來,姚先生才真正進了正題。 他要講的是過參數化網絡的損失景觀。
所謂損失景觀,可以想像成一片起伏的山地。
模型里每一個參數,都是一個能擰的旋鈕,上千億個旋鈕擰出來的每一種組合,都對應著這片地面上的一個點,而這個點的海拔高低,就是模型在這種組合下犯的錯有多大。
對大模型的訓練,就是從山上某處出發,順著最陡的方向往下走,一步一步去找那片地勢最低的點。
這個往下走的法子,就叫做叫梯度下降。
按理說旋鈕一多,這片山地的地形就該複雜得嚇人,陷阱遍地,隨便掉到哪個坑裡就再也出不來了。
可數學告訴你的,這樣不對!
在參數足夠多的時候,那片山地最低處的點,根本就不是一個單獨存在的。
它是連成一大片的谷底。
你隨便滾進哪一個里,幾乎都能滾到一樣低的地方去。
「既然谷底連成了片,那問題就來了,」姚先生繼續說道,「同樣是滾到最低,梯度下降它會挑哪一個落腳?」
這才是真正要命的地方。 這上千億個旋鈕,能把訓練數據完美擬合的組合,多到數不清。
可梯度下降這麼一路滾下來,它不是隨便落,而是帶著一種說不清道不明的偏好,專往那些最平、最簡單的低點裡去。
這種沒人明寫、卻實實在在起著作用的偏好,就叫隱式正則化。
機器之所以沒把噪聲死記下來,不是因為有誰在攔著它,而是因為梯度下降這條路本身,就懶得往那些尖銳、複雜的坑裡鑽。
至於它為什麼懶,數學上是能給出一個說法的。
當一張網絡寬到極致的時候,它在訓練里的一舉一動,會退化成一種早就被研究透了的老東西——核方法。
整個訓練過程,近似於圍著出發點做一次線性展開,網絡幾乎不挪窩,只在原地輕輕地晃。
這套理論在圈子裡有個名字,叫 ntk機制(神經正切核)。
而這種「原地不動、只輕輕晃」的狀態,則被形象地稱作懶惰訓練。
進來的老人,正是姚先生。
姚先生的背,有些彎可看著卻不佝僂。
圖靈獎,這座計算機行業的諾貝爾獎就是他捧回華夏的。
二十年前,他把美國的房子賣了,終身教職也辭了,一個人回到了水木。
回來的第一件事,不是先去搭自己的實驗室,而是給本科生開了一門當時國內壓根沒人開過的課。
後來就有了姚班,又有了眼前這間教室所在的智班。
這條路上能數得出名字的好苗子,十個里有八九,都是從他手底下走出來的。
姚先生進了教室,就感覺今天班上的氛圍有點不太對勁。
底下的學生還在議論,不少人時不時回過頭,往教室後排那個角落裡看。
他順著那些目光看了過去。
然後,就看見了李東。 李東也正看著他。
四目相對,姚先生臉上的皺紋舒展開來,沖他不動聲色地點了點頭。
李東也笑著,點了點頭。
此時站在一旁的助教,已經把課件投到了智慧黑板上。
屏幕一亮,大家這才把目光從李東身上收了回去。
今天這節課,姚先生講的是《人工智慧應用數學》。
這門課是從他當年那門《計算機應用數學》里拓展出來的。
說起來這門課和田鋼手裡那個「ai for math」,其實是反著來的。
田鋼琢磨的是讓ai去替數學家打工,是拿ai去做數學。
而姚先生這門課是拿數學把ai本身講清楚。
它憑什麼能學會東西,它訓練的時候腦子裡到底在發生了什麼,它為什麼又時靈時不靈的。
而這些對眼下的李東來說,正是他需要的。 ……
姚先生在黑板上畫了一道曲線,上面稀稀拉拉點了七八個點。
「我先問你們一個特別外行的問題,」他轉過身帶著點笑意,「七個點,我要拿一條曲線把它們全串起來,按你們高中學的幾次的多項式夠用?」
底下有人小聲答:「六次。」
「對,六次就夠,七個點七個係數,嚴絲合縫。」
姚先生點了點頭。
「那我要是給它配上一百萬個係數呢?」
本書首發 讀小說就上 TW 看書網,𝗌𝗁𝗎.𝗍𝗐超順暢 ,提供給你無錯章節,無亂序章節的閱讀體驗
這下教室里安靜了下來。
姚先生這裡其實就是在說ai模型了。
如果模型的參數比已知的數據點還要多,為了死死踩中這七個點,這條曲線就勢必會在空隙處劇烈震盪,把真實的走勢扯得稀爛。
這也是算法界永遠繞不開的一道坎——偏差與方差的權衡。
簡單的說就是模型太簡單了腦容量不夠,這叫叫欠擬合。 模型太複雜了又會把數據里那些干擾項當成真理給記下來,當你換道它沒見過的新題時,它就會當場抓瞎,這就叫過擬合。
參數越多,這過擬合的症狀,理論上就越致命。
幾十年來,大家都是這麼覺得的。
「可現在的事,邪門就邪門在這兒。」
姚先生在「一百萬」那個數字底下畫了道線。
「我們今天拿來用的那些大模型,參數動輒上千億,遠比餵給它的數據還多。」
「照理說它們早該過擬合到沒法看了。」
「可它們偏偏沒有。」
「它們不光沒爛,反而學得一個比一個好。」
他轉過身在黑板上寫下三個字。
【為什麼?】
接下來,姚先生才真正進了正題。 他要講的是過參數化網絡的損失景觀。
所謂損失景觀,可以想像成一片起伏的山地。
模型里每一個參數,都是一個能擰的旋鈕,上千億個旋鈕擰出來的每一種組合,都對應著這片地面上的一個點,而這個點的海拔高低,就是模型在這種組合下犯的錯有多大。
對大模型的訓練,就是從山上某處出發,順著最陡的方向往下走,一步一步去找那片地勢最低的點。
這個往下走的法子,就叫做叫梯度下降。
按理說旋鈕一多,這片山地的地形就該複雜得嚇人,陷阱遍地,隨便掉到哪個坑裡就再也出不來了。
可數學告訴你的,這樣不對!
在參數足夠多的時候,那片山地最低處的點,根本就不是一個單獨存在的。
它是連成一大片的谷底。
你隨便滾進哪一個里,幾乎都能滾到一樣低的地方去。
「既然谷底連成了片,那問題就來了,」姚先生繼續說道,「同樣是滾到最低,梯度下降它會挑哪一個落腳?」
這才是真正要命的地方。 這上千億個旋鈕,能把訓練數據完美擬合的組合,多到數不清。
可梯度下降這麼一路滾下來,它不是隨便落,而是帶著一種說不清道不明的偏好,專往那些最平、最簡單的低點裡去。
這種沒人明寫、卻實實在在起著作用的偏好,就叫隱式正則化。
機器之所以沒把噪聲死記下來,不是因為有誰在攔著它,而是因為梯度下降這條路本身,就懶得往那些尖銳、複雜的坑裡鑽。
至於它為什麼懶,數學上是能給出一個說法的。
當一張網絡寬到極致的時候,它在訓練里的一舉一動,會退化成一種早就被研究透了的老東西——核方法。
整個訓練過程,近似於圍著出發點做一次線性展開,網絡幾乎不挪窩,只在原地輕輕地晃。
這套理論在圈子裡有個名字,叫 ntk機制(神經正切核)。
而這種「原地不動、只輕輕晃」的狀態,則被形象地稱作懶惰訓練。