第380章 匯報怎麼做啊?
測試數據是完全基於現在上線的湯圓0.9版本和新訓練完成的湯圓1.0版本之間進行對比的。
0.9已經很強了,從四月一日發布之後,到現在快兩個月了,隨著各家發布新模型,湯圓雖然不再是全榜單最強,但在意圖理解、低幻覺率等幾個方向還在霸榜。
這在模型疊代飛快,榜單天天輪換的現在可不多見。
質疑湯圓刷榜的聲音也越來越少。
而剛訓練完成的1.0和0.9最大的區別,就是加入了更多、邏輯鏈更長、質量更高的標註數據。
這種數據再次提升了湯圓模型的邏輯能力。
和0.9相比,1.0在複雜意圖理解、長程任務完成率方面再次提高。
這些本來就是湯圓模型的強項。
換句話說,0.9到1.0的變化,並不是補齊了0.9的短板,而是把它原本就長的長板變得更長了。
除了剛才說的那些以外,其實湯圓和其他海外一線模型相比最強的是中文能力。
這當然是因為湯圓後訓練中的大量標註數據都是以中文為主的,預訓練中的中文語料占比也比其他的模型更多。
很多模型雖然號稱是多語言支持,但他們往往在運算和思考過程中使用的是英語,直到最後的輸出層才翻譯成中文,這種邏輯當然會導致很多中文語境的隱藏語義的缺失。 韓路一看了看測評結果,問道:「長程任務的提升有這麼多?」
「我們在推理側也用了異步新框架。」趙文淵說道,他沒展開解釋,反正一會兒也要講。
趙文淵打開一個長程任務示例,展示給韓路一。
這個任務的輸入提示有多簡單呢?
裡面只有一句話:「寫一個minecraft。」
minecraft,中文名我的世界,一個瑞典程式設計師自己開發的獨立遊戲,後來以十億美元的價格賣給了微軟。
它一度是世界上銷量最高的遊戲,全球賣出三億多份。
這個遊戲的有趣之處就在於,它的畫面極為簡陋,但是系統極為複雜。
如果你和任何一個ai模型說,「給我寫一個minecraft」,模型都能給你輸出點兒什麼。
一個能移動、能放置、能破壞的像素遊戲?還行。
又加上了生存系統,遊戲人物有飢餓度、健康度,會掉血還會死?複雜了一點兒,湯圓0.9就能做到這種程度。
再加上生物系統,遊戲裡有狼、狗、羊、豬,每個動物都有自己的特性和用途?到這已經基本超過一般模型能做到的範疇了。 至於最複雜的紅石系統,靠現在的模型能力還做不到——至少不能一句話做到。
這個測試任務能分成兩半看,一句話的提示詞,既考驗了意圖理解、信息收集的能力,這個任務的複雜程度本身又挑戰了模型上下文所能承載的編程極限。
趙文淵在桌面上雙擊了一個可執行文件。
一個遊戲窗口跳了出來。
【寫到這裡我希望讀者記一下我們域名 TW 看書網解無聊,𝕤𝕙𝕦.𝕥𝕨超靠譜 】
然後趙文淵示意韓路一自己玩一下。
韓路一操作著遊戲中的像素小人探索了一會,用手擼了幾棵樹,收集了一些木材,然後碰見了一個會射箭的野怪,被追著射了幾箭,死了。
韓路一回頭看了一眼趙文淵,問道:
「完全是用湯圓寫出來的?」
「完全是用湯圓寫出來的。」趙文淵回道。
「花了多長時間?」
「御風接入模型,從昨天下午輸入指令,大概疊代了五六個小時吧。」
自運行五六個小時的長程任務,不跑偏,能輸出完成度這麼高的產品。 而且韓路一體驗下來,這個遊戲demo雖然能看到minecraft的影子,但是它本身有很多創新設計,並不是完全照抄的,如果直接上傳到遊戲商城,人們最多會以為這是一個獨立遊戲仿品,絕對不會想到是使用大模型一句話生成的,甚至連設計方案都沒有。
這意味著湯圓1.0在規劃任務時,能夠兼具發散性和方向約束,對生產級的應用意義重大。
「進化的真快啊。」體驗完之後,韓路一感慨了一句。
趙文淵明白他是什麼意思。
模型進化的太快了。
曾經人們認為ai大模型只能做些簡單的事,但是隨著模型不斷疊代,它正在吃掉越來越多更難的任務。
不同模型的能力差別,有的時候並不是多生成幾輪和少生成幾輪、多花些詞元和少花些詞元的區別。
這中間是做得到和做不到的鴻溝。
韓路一不太確定,湯圓1.0現在能做到的事,到底有多少模型能做到。
不過,等到新加坡人工智慧大會的鬥獸場打完,就能找到湯圓1.0所在的位置了。
「怎麼訓練的這麼快的?」韓路一好奇地問道,他印象里,1.0的訓練時間還是非常緊張的。
「說到這個,章博士您還記得吧?」 「章聞鐸?」韓路一回想了一下,那個有點兒直有點兒倔的水木博士,他有印象。
「對,多虧了他。」趙文淵說道,「我們按照他的想法做了一套新的訓練框架,基於異步的強化學習,把訓練時間縮短到了一半。」
韓路一欣慰地點頭,人才濟濟啊。
「不過——」趙文淵突然說道,「我當時許諾他給他二百五十六張l100去做世界模型的研究。」
韓路一疑惑的看向他:「我記得研究院一共才一百多張吧?」
趙文淵嘿嘿一笑:「我這不是找您了嗎?這個成績值不值得那麼多卡?」
好傢夥,老趙都會畫空氣餅了,這管理不得到a了?
韓路一搖了搖頭:「最近臨港那邊的算力富裕出來了一些,張家口這邊再撥一個五百卡的集群給研究院。」
不是不想多給,用戶太多,推理流量的壓力大,地主家也沒有餘糧啊。
看完了湯圓1.0的成果,兩人又到趙文淵的院長辦公室里,把明天要做的專項匯報的材料過了一遍。
國家重大專項的整體流程比較長,源智做的這個方向是算力國產化,具體的名字是《面向千億級參數模型推理的國產ai加速集群關鍵技術攻關》。
從源智入選擬立項名單到現在一個多月,按照成長流程,這段時間是給研究單位寫計劃、整理材料、申請補助預算的時間,還不用出成果。 明天的匯報會嘛,也就是匯報匯報計劃。
湯圓本身是萬億級參數的底子,後訓練對顯存的要求沒有那麼高,千卡集群就能完成。
想要做萬億級參數大模型的預訓練的話,還要在訓練集群的規模上再做突破才行。源智現在的總算力有限,要保證大量的推理需求的情況下,還沒有餘力支持下一輪的預訓練。
現在的問題是,如果只看千億級參數的話,源智已經把訓練側的工作在l100集群上跑通了。
攻關已經完成了。
明天的會上直接就可以展示成果。
「所以韓總,咱們這個匯報該怎麼做啊?」趙文淵問道。
0.9已經很強了,從四月一日發布之後,到現在快兩個月了,隨著各家發布新模型,湯圓雖然不再是全榜單最強,但在意圖理解、低幻覺率等幾個方向還在霸榜。
這在模型疊代飛快,榜單天天輪換的現在可不多見。
質疑湯圓刷榜的聲音也越來越少。
而剛訓練完成的1.0和0.9最大的區別,就是加入了更多、邏輯鏈更長、質量更高的標註數據。
這種數據再次提升了湯圓模型的邏輯能力。
和0.9相比,1.0在複雜意圖理解、長程任務完成率方面再次提高。
這些本來就是湯圓模型的強項。
換句話說,0.9到1.0的變化,並不是補齊了0.9的短板,而是把它原本就長的長板變得更長了。
除了剛才說的那些以外,其實湯圓和其他海外一線模型相比最強的是中文能力。
這當然是因為湯圓後訓練中的大量標註數據都是以中文為主的,預訓練中的中文語料占比也比其他的模型更多。
很多模型雖然號稱是多語言支持,但他們往往在運算和思考過程中使用的是英語,直到最後的輸出層才翻譯成中文,這種邏輯當然會導致很多中文語境的隱藏語義的缺失。 韓路一看了看測評結果,問道:「長程任務的提升有這麼多?」
「我們在推理側也用了異步新框架。」趙文淵說道,他沒展開解釋,反正一會兒也要講。
趙文淵打開一個長程任務示例,展示給韓路一。
這個任務的輸入提示有多簡單呢?
裡面只有一句話:「寫一個minecraft。」
minecraft,中文名我的世界,一個瑞典程式設計師自己開發的獨立遊戲,後來以十億美元的價格賣給了微軟。
它一度是世界上銷量最高的遊戲,全球賣出三億多份。
這個遊戲的有趣之處就在於,它的畫面極為簡陋,但是系統極為複雜。
如果你和任何一個ai模型說,「給我寫一個minecraft」,模型都能給你輸出點兒什麼。
一個能移動、能放置、能破壞的像素遊戲?還行。
又加上了生存系統,遊戲人物有飢餓度、健康度,會掉血還會死?複雜了一點兒,湯圓0.9就能做到這種程度。
再加上生物系統,遊戲裡有狼、狗、羊、豬,每個動物都有自己的特性和用途?到這已經基本超過一般模型能做到的範疇了。 至於最複雜的紅石系統,靠現在的模型能力還做不到——至少不能一句話做到。
這個測試任務能分成兩半看,一句話的提示詞,既考驗了意圖理解、信息收集的能力,這個任務的複雜程度本身又挑戰了模型上下文所能承載的編程極限。
趙文淵在桌面上雙擊了一個可執行文件。
一個遊戲窗口跳了出來。
【寫到這裡我希望讀者記一下我們域名 TW 看書網解無聊,𝕤𝕙𝕦.𝕥𝕨超靠譜 】
然後趙文淵示意韓路一自己玩一下。
韓路一操作著遊戲中的像素小人探索了一會,用手擼了幾棵樹,收集了一些木材,然後碰見了一個會射箭的野怪,被追著射了幾箭,死了。
韓路一回頭看了一眼趙文淵,問道:
「完全是用湯圓寫出來的?」
「完全是用湯圓寫出來的。」趙文淵回道。
「花了多長時間?」
「御風接入模型,從昨天下午輸入指令,大概疊代了五六個小時吧。」
自運行五六個小時的長程任務,不跑偏,能輸出完成度這麼高的產品。 而且韓路一體驗下來,這個遊戲demo雖然能看到minecraft的影子,但是它本身有很多創新設計,並不是完全照抄的,如果直接上傳到遊戲商城,人們最多會以為這是一個獨立遊戲仿品,絕對不會想到是使用大模型一句話生成的,甚至連設計方案都沒有。
這意味著湯圓1.0在規劃任務時,能夠兼具發散性和方向約束,對生產級的應用意義重大。
「進化的真快啊。」體驗完之後,韓路一感慨了一句。
趙文淵明白他是什麼意思。
模型進化的太快了。
曾經人們認為ai大模型只能做些簡單的事,但是隨著模型不斷疊代,它正在吃掉越來越多更難的任務。
不同模型的能力差別,有的時候並不是多生成幾輪和少生成幾輪、多花些詞元和少花些詞元的區別。
這中間是做得到和做不到的鴻溝。
韓路一不太確定,湯圓1.0現在能做到的事,到底有多少模型能做到。
不過,等到新加坡人工智慧大會的鬥獸場打完,就能找到湯圓1.0所在的位置了。
「怎麼訓練的這麼快的?」韓路一好奇地問道,他印象里,1.0的訓練時間還是非常緊張的。
「說到這個,章博士您還記得吧?」 「章聞鐸?」韓路一回想了一下,那個有點兒直有點兒倔的水木博士,他有印象。
「對,多虧了他。」趙文淵說道,「我們按照他的想法做了一套新的訓練框架,基於異步的強化學習,把訓練時間縮短到了一半。」
韓路一欣慰地點頭,人才濟濟啊。
「不過——」趙文淵突然說道,「我當時許諾他給他二百五十六張l100去做世界模型的研究。」
韓路一疑惑的看向他:「我記得研究院一共才一百多張吧?」
趙文淵嘿嘿一笑:「我這不是找您了嗎?這個成績值不值得那麼多卡?」
好傢夥,老趙都會畫空氣餅了,這管理不得到a了?
韓路一搖了搖頭:「最近臨港那邊的算力富裕出來了一些,張家口這邊再撥一個五百卡的集群給研究院。」
不是不想多給,用戶太多,推理流量的壓力大,地主家也沒有餘糧啊。
看完了湯圓1.0的成果,兩人又到趙文淵的院長辦公室里,把明天要做的專項匯報的材料過了一遍。
國家重大專項的整體流程比較長,源智做的這個方向是算力國產化,具體的名字是《面向千億級參數模型推理的國產ai加速集群關鍵技術攻關》。
從源智入選擬立項名單到現在一個多月,按照成長流程,這段時間是給研究單位寫計劃、整理材料、申請補助預算的時間,還不用出成果。 明天的匯報會嘛,也就是匯報匯報計劃。
湯圓本身是萬億級參數的底子,後訓練對顯存的要求沒有那麼高,千卡集群就能完成。
想要做萬億級參數大模型的預訓練的話,還要在訓練集群的規模上再做突破才行。源智現在的總算力有限,要保證大量的推理需求的情況下,還沒有餘力支持下一輪的預訓練。
現在的問題是,如果只看千億級參數的話,源智已經把訓練側的工作在l100集群上跑通了。
攻關已經完成了。
明天的會上直接就可以展示成果。
「所以韓總,咱們這個匯報該怎麼做啊?」趙文淵問道。