第389章 什麼湯圓1.0?我沒聽說過啊
第二天上午,韓路一和趙文淵幾人匯合之後,直接走到位於酒店二樓的簽到處。
人工智慧大會新加坡站的開幕式將於九點在會議主會場進行,此時簽到處已經擠滿了來自世界各地的參會人員,大家一邊排隊,一邊操著各種口音的英語互相交流。
源智作為被邀請的演講嘉賓是有單獨的簽到處的,幾人很快就進入了會場。
很快他們就看到面前各個公司的宣傳展牌,其中尤其以nexus ai的為多,其他做算力平台、數據監控、網絡安全的公司也不少。
作為一個專講ai的會議,來這裡的企業不會少,這些展牌的廣告是精準投放,裡面的商機可不少。
趙文淵忍不住吐槽:「不是說商業中立,不接受贊助嗎?」
劉彧在旁邊解釋道:「是不接受我們的贊助。」
趙文淵看了劉彧一眼,解釋的很好,下次別解釋了。
韓路一自己看了看,出現的滾動視頻和廣告立牌里都是歐美的廠商,連鼎盛和巨量都沒有。
以韓路一對鼎盛的了解,這一定不是他們不想投放。
會議委員會對贊助商的篩選條件里,非常明顯有廠商來自哪個國家這一項。
幾人在展區逛了一圈,在前面的vip區找了空座坐下來,趙文淵臉色古怪地對韓路一說:「韓總,您不覺怪嗎?他們這麼刻意的打壓我們,故意把湯圓除名在測試結果之外,那為什麼還要邀請我們來參加呢?」 韓路一倒不覺怪。
「這些人,總覺得自己是老大,就想要展示他們的公平公正,如果不邀請我們,以源智和湯圓現在的名聲,就是他們不包容了。」韓路一說道,「可是請我們來了,又害怕我們。這就是他們的擰巴之處。」
幾人坐下不久,進場的人越來越多。
一個熟悉的聲音響了起來。
「誒呀媽呀,趙總,這巧呢。」
趙文淵回頭一看,是鼎盛的劉大海。
劉大海在趙文淵身邊坐下,趙文淵驚奇地問道:「我記得鼎盛來不少人啊,劉博士不用和團隊在一起嗎?」
劉大海笑眯眯地點點頭:「看學術會議就像看電影,肯定還是和懂的人一起看有意思,咱倆一會兒嘮嘮。」
韓路一順著劉大海來的方向看過去,果然看見鄭曉波領著鼎盛的團隊坐在vip區的另一個方向。
鼎盛這次雖然沒有被邀請做講座,但是待遇還是比較高的。
到了九點過幾分,主會場的人已經坐得很滿了,韓路一沒看到御三家的人,猜測除了現場的vip座席之外還有vvip的貴賓休息室?
先是由新加坡的坡長上台致辭,以顯示當地政府對這個活動的重視,除了講了一些新加坡開放支持創新之類的老生常談之外,還格外提了淡馬錫主權基金正在積極尋找投資項目,希望有興趣的ai創業項目主動聯繫。 坡長下去之後,主辦方輪值主席理察走上台,整個會場沉悶的氣氛才重新被帶到了起來。
因為此時議程進入了ai foundations年度模型封閉測評的結果發布環節。
大屏幕上的內容切換成一排排名,但是模型的名字卻是隱藏的。
理察這才緩緩開口,吊足了觀眾的胃口。
「相信大家都注意到了最近人工智慧發展的新趨勢。我們已經擺脫了一問一答的初級階段,如何運用模型的能力,使智能體成為能夠獨立完成任務的生產力工具,才是這個時代的新課題。」
理察扶了扶眼鏡。
「所以我們聯合全球十七家最頂尖的研究機構,設計了一套面向下一代人工智慧的綜合評測,它不考慮公司的規模、不考慮任何國家和地區政策的影響,只看模型本身的表現。」
台下響起熱烈的掌聲。
【寫到這裡我希望讀者記一下我們域名𝑇𝑊看書📕𝑠ℎ𝑢.𝑡𝑤】
韓路一沒鼓掌。
他只覺得好笑。
十七家「最頂尖」的研究機構里,一家中國的公司和研究機構都沒有。
「不考慮公司的規模、不考慮任何國家和地區政策的影響」,但是湯圓1.0卻被剔除在外。 劉大海坐在另一側,本來準備鼓掌的,結果看到這邊源智的人都沒鼓掌,又訕訕地把手收了回去。
隨後,理察介紹了這套測評集、以及對應的評價體系新增加的關於長程任務、工具調用、多步驟規劃等能力的側重考察。
然後他開始公布結果。
前三名之後的結果是依次出現的,湯圓0.9的名字很顯眼地擺在了第四名的位置。
台下已經有人開始鼓掌了,從中國來的那些代表們鼓掌鼓得格外用力一些。
雖然在國內的時候大家也希望能讓自己的模型超過湯圓,但是在這種國際場合,湯圓0.9長達近兩個月的霸榜、在今天還能出現在第四名的位置,確實很讓人提氣。
而且看名字就知道,0.9,還不是正式版,他們也期待湯圓的後續模型能出現在前三名的位置里。
理察開始依次公布排名前三的模型。
第三名,谷歌的gemini-x-pro模型,70.8分。
台下的掌聲更劇烈了一些。
第二名,openai的gpt-v-ii模型,71.7分。
劉大海低聲說了一句:「老山姆這下子難受嘍。」 趙文淵回頭看了他一眼,才想起來這位劉博士以前也在openai工作過。
在公布第一名之前,理察刻意停頓了一會兒,等全場的掌聲都安靜下來。
有不少源智和湯圓有所了解的人都在偷瞄韓路一這邊。
幻燈片上的第一名顯現出來——
72.3分,金星2.0模型。
全場的掌聲再次響起,伴隨著討論聲。
劉大海愕然地回過頭,看向趙文淵:「趙總,你們沒整新模型啊?連我們鼎盛都整了啊。」
劉大海領導研發的坤元2.0,全面吸取了從當初湯圓的數據那得到的經驗,狠砸了資源和錢在數據質量上面,這次排名在第七名,已經比坤元1.1進步太多了。
但讓他沒想到的是,源智竟然沒有在這期間疊代新模型。
是研發遇到困難了?沒錢了?
劉大海越過趙文淵朝著韓路一看去,只見這位年輕的董事長正面帶微笑的看著大屏幕。
只是不知怎麼的,這個微笑看起來沒什麼溫度。 此時,大屏幕上的模型能力排名已經淡去,取而代之的是nexus ai白底黑字的logo,理察說道:「接下來我們請nexus ai的創始人、ceo,米勒先生來為我們介紹他們的最新模型——金星2.0。」
瑞恩從後台走了出來,西裝革履,意氣風發。
他先上台與理察握手,然後朝四周點頭致意。
「非常感謝會議主辦方,也非常感謝所有參與測評工作的研究人員。」瑞恩聲音激昂,「這不是我一個人的成績,也不是nexus ai一家公司的成績,我們能取得這樣的進步,離不開在座所有人工智慧從業者的共同努力!」
底下的媒體區快門聲不斷。
觀眾們都不覺怪,他們自己也在發x呢。
nexus ai再次摘冠,拿下智能體時代的sota模型地位,這絕對是值得今天科技版頭版的新聞。
但是他們不知道的是,媒體的記者們之所以這麼積極地在這拍照,完全是為了一會兒來個大的。
趙文淵回頭看了看韓路一,見他的表情還是那麼淡定,竟然還跟著別人鼓掌的節奏一起輕輕拍了兩下手,忍不住說道:「韓總,您還給他鼓掌?」
韓路一點了點頭:「讓他珍惜這段時間吧,還好他們加了媒體問答環節,這樣我就不用現在打斷他了。」
瑞恩還在上面介紹著金星2.0模型突破性的能力——尤其是在長程任務方面的能力,以及nexus ai的團隊付出了多少努力才能達到這樣的成績。
當然,具體使用了什麼樣的方法和訓練策略肯定是保密的。 並且瑞恩還強調了ai的安全有多麼重要,強大的能力需要更高的安全監管,金星2.0模型已經不可避免的成為了國家戰略級的武器,吧啦吧啦。
當講話轉向這些宏大敘事的時候,觀眾們的反應明顯分成了兩種。有些美國專家明顯沾了點技術狂熱,而世界各地來的其他地方的學者和從業者們則對美國佬這種無處不在的傲慢感到無奈。
終於,瑞恩的演講結束,進入到了公開問答的環節。
所有的記者們都爭相舉起了手。
瑞恩有點兒猶豫,第一個問題,他想給一個關係好一點兒的媒體。
但其實不管他點誰都一樣。
無論哪個媒體提問,都只會問同一個問題,一個能讓他們拿到今天的頭版新聞的問題。
因為就在剛才,所有媒體記者的手機里都收到了同一份資料,裡面的內容是兩封郵件的截圖。
另外一封,則是處理通知,宣布將代號為1042、實際是湯圓1.0的模型測評成績作廢,卻沒有解釋原因。
截圖從哪來,沒人能查到,但是這截圖就這麼出現在了他們的手機里。
視界出馬,他們當然查不到。 現在這些記者們就只想第一個問出那個問題——
湯圓1.0去哪了?
終於,瑞恩點名了《紐約時報》的記者,他曾經接受過對方的深度採訪,合作還算愉快。
金髮碧眼的女記者從工作人員手裡接過話筒,沒有任何寒暄的意思,直接問道:「米勒先生,我們收到資料,顯示在ai foundations本次封閉測評的匿名階段,湯圓1.0模型以93.5的得分排在第一位,遠高於金星2.0的72.3分,現在,它卻沒有出現在最終的榜單上。你知道這是為什麼嗎?」
附近的記者看到這個問題被別人先問出來了,都懊惱地嘆了口氣。
瑞恩站在台上有點兒懵逼。
什麼湯圓1.0?我沒聽說過啊?
他甚至回頭看了一下大屏幕,想看看裡面有沒有湯圓1.0,雖然排名榜單早就已經不在上面了。
我得第一不是應該的嗎?我們花了那麼多錢,那麼多算力,還進行了針對性的訓練。
93分又是什麼鬼?怎麼可能?那不是比金星領先了二十多分嗎?
瑞恩在台上愣了幾秒鐘沒有動作,但他畢竟是明星公司的ceo,見過大場面,很快就反應了過來:「不好意思,這個問題和金星、和nexus ai都沒有關係。我懷疑你收到的資料是假的,但這應該是主辦方來回答的問題。好了,有請下一位記者。」
瑞恩指了指另一個媒體的記者,話筒幾乎是工作人員從女記者的手裡搶了過來遞到了下一個記者的手上。 第二個記者馬上提問:「你覺得湯圓1.0真的有這樣的能力嗎?它比金星2.0高出20分的原因是什麼?你是通過什麼手段讓他下架的?」
瑞恩對第二個記者怒目圓瞪,什麼叫我是通過什麼手段讓他下架的?
我都沒聽說過什麼湯圓1.0!
此時,輪值主席理察看出來事情已經壓不住了,所有的媒體都只會追著這一個問題問。
不得已,他站了出來,走到瑞恩身邊接過他手裡的話筒,說道:「記者朋友們,不管你們是從哪裡聽到的謠言,請相信我,那都是不準確的。組委會確實收到過一款名為湯圓1.0的模型,但是因為它的成績異常,成績已經被取消了,這是遵循程序的。」
現場已經有點兒混亂了,第二個記者還拿著話筒,接著問道:「什麼叫做成績異常?異常的原因是什麼?這次封閉測評的結果還可信嗎?」
雖然會場的冷氣開得很足,但是此時理察的額頭已經開始冒汗了。
如果不能好好地解釋這件事,那對這次封閉測評,甚至對ai foundations舉辦的人工智慧大會都是一次公信力的巨大打擊。
但理察根本沒有什麼證據能拿出來,他們當時大概調查了一下,沒發現什麼異常,只是分數太高,就不了了之了。
理察一邊斟酌一邊開口:「當然,測評標準是經過我們周密設計的,絕對可信——這個模型可能只是一個例外,也許有人——」
說到這他停了下來。
在這個場合下,沒有證據就提出指責太容易被人駁倒了。 突然,一個聲音接過了他的話。
「有人把題偷了出來,讓這家公司提前進行了針對性的訓練?」說話的人正是林偉倫。
作為新加坡國立大學的合作方負責人,連場地都是他聯繫的,拿到一個話筒自然是輕而易舉。
他一邊說話一邊走上台,站在理察和瑞恩的對面,停了下來。
「科爾曼教授,你剛才提出的,真的是非常嚴重的指控。」林偉倫轉身看向台下,說道,「訓練湯圓1.0的廠商——源智科技——的代表們此時此刻就在現場,請你們上台和科爾曼教授現場對峙吧。」
早在這場風波剛剛開始的時候,就已經有人注意韓路一這邊的狀況了,林偉倫這一番話說完,更多的人看向了這邊。
在眾多目光的注視下,韓路一站起身。
今天為了這次活動——這場和理察、瑞恩之間的活動,韓路一特意穿上了顧司玥送給他的一身淺灰色西裝,配上他高大帥氣的建模和那種寵辱不驚的逼王氣質,視覺衝擊力很強。
他不疾不徐,一步一步走到了台上。
周圍越來越多的目光集中在了韓路一的身上,直到他從林偉倫的手中接過話筒。
「作為被ai foundations主動邀請來參加這次會議的人,我感到非常困惑。」韓路一緩緩說道,「測試是主辦方邀請我們參加的,我們只是正常提交了模型的接口,現在卻受到了這樣的指責。」
「從我們接到邀請到最終提交,只有幾個星期的時間,如果大家對模型訓練有所了解的話,就應該知道,即使有參考答案,要做訓練也來不及。」韓路一轉向理察,說道,「不知道科爾曼教說我們偷了測試集,有什麼證據嗎?」 理察沒有回答韓路一的問題,而是向現場的觀眾解釋道:「這次封閉測試之所以有效,很大的原因是我們進行了隔離式的沙盒環境,模型不能自己根據考題進行疊代。但是鑑於湯圓1.0已經進行過一次測試,如果用同一套測試集讓它再做一次,我們就很難保證結果的公平和公正了。」
他其實已經在給自己找台階下了,如果湯圓1.0現在再做出90多的高分,那也不是因為模型強,而是因為在上一輪測試中他們已經知道了考題,現在可能已經針對性的調整過了。
韓路一站在台上笑了笑。
「我們都知道,想要證明自己的清白有多難,我也不是來自證清白的。」
韓路一看了看台下的觀眾,說道:「我想,大家之所以來參加人工智慧會議,是想看到人工智慧有真正解決問題的能力,而不是為了看看幾個模型的分數。既然如此,倒不如就在今天,就在現場——」
「讓大家體驗一下最新一代模型所具有的能力。」
話音剛落,台下就已經響起了掌聲、尖叫聲、起鬨聲。
兩家頂尖模型公司現場battle,這不比聽瑞恩講什麼安全性重要、戰略級武器有意思?
理察站在原地,進退兩難。
大會的議程是早就定好的,後面還有主會場和各個分會場的演講,現在橫叉一個現場體驗來,怎麼安排,不是全亂套了嗎?
倒是瑞恩,看到現在這個場面之後,信心滿滿的向前一步。
「韓先生,只是開放接口,讓人們現場體驗,怎麼能直觀的分出好壞?」瑞恩說道,「我看倒不如就用之前搭建的沙盒環境,讓所有的模型都接入,再由所有現場的觀眾們投票選出一個複雜任務,同樣的提示詞給所有的模型,看看誰的完成度最高,如何?」 韓路一看向瑞恩。
雖然兩人之前郵件交流過、視頻過,更在各種會議中談論過對方。
但這還是兩人第一次在現實中見面。
視界打開。
【瑞恩·米勒】
【職位:nexus ai創始人、ceo】
【情緒:自信、激昂】
【核心動機:金星2.0模型能力內部驗證極為優秀,一定能在現場測試中取勝】
韓路一心下瞭然,不管是理察還是瑞恩,他們是真的不相信湯圓1.0的能力超過了金星2.0,之前測試中93.5的得分不是真實的成績。
「好。」韓路一答應了下來。
林偉倫帶著幾名同事迅速把之前測評中心機房裡的沙盒環境拉了過來,讓想要參與實時測試的廠商現場就能接入。
而韓路一則把電腦接入了大屏幕,現場用御風寫了一個投票程序,github開源,然後部署在鼎盛雲上,再把寫好的程序運行在大屏幕上。 前後花了不到五分鐘。
這是一場給御風智能體工具和鼎盛雲的活廣告,所有的開發者都能看見完成這樣一個需求的效率有多高。
很快,觀眾們自主發起的複雜任務提示詞被一個一個添加,然後根據點讚數排序。
最終得贊最高的那個提示詞就將成為今天的唯一測試題。
瑞恩拿著話筒,繼續細化流程。
「長程任務可能會長達幾個小時,為了讓大家都能在今天就能查看到結果,我們將在提示詞中添加最長可以運行的時間——」說到這,他抬手看了看表,此時已經是上午十一點多了,「五個小時,到下午五點,必須停止運行,然後運行的結果開放給大家自由查看。」
瑞恩沒說評判標準是什麼。
在這一點上,他和韓路一不謀而合。
榜單上的分數並不重要,真正重要的是讓潛在用戶們了解到模型所具有的解決問題的能力。
如果你是最強模型這件事已經能夠深入人心,那什麼榜單都沒有必要了。
韓路一聽完之後在旁邊點了點頭,瑞恩提出來的賽制其實還挺公平的。
更像是一場針對模型的黑客松比賽,統一出題、限制時間,最後的結果由觀眾們決定。 時間臨近十二點,觀眾們投票選出來的複雜任務此時也已經確定了。
任務只有短短的一句話。
趙文淵看到的時候不禁一笑。
那句話是——
「build me a minecraft(給我寫一個《我的世界》)。」
人工智慧大會新加坡站的開幕式將於九點在會議主會場進行,此時簽到處已經擠滿了來自世界各地的參會人員,大家一邊排隊,一邊操著各種口音的英語互相交流。
源智作為被邀請的演講嘉賓是有單獨的簽到處的,幾人很快就進入了會場。
很快他們就看到面前各個公司的宣傳展牌,其中尤其以nexus ai的為多,其他做算力平台、數據監控、網絡安全的公司也不少。
作為一個專講ai的會議,來這裡的企業不會少,這些展牌的廣告是精準投放,裡面的商機可不少。
趙文淵忍不住吐槽:「不是說商業中立,不接受贊助嗎?」
劉彧在旁邊解釋道:「是不接受我們的贊助。」
趙文淵看了劉彧一眼,解釋的很好,下次別解釋了。
韓路一自己看了看,出現的滾動視頻和廣告立牌里都是歐美的廠商,連鼎盛和巨量都沒有。
以韓路一對鼎盛的了解,這一定不是他們不想投放。
會議委員會對贊助商的篩選條件里,非常明顯有廠商來自哪個國家這一項。
幾人在展區逛了一圈,在前面的vip區找了空座坐下來,趙文淵臉色古怪地對韓路一說:「韓總,您不覺怪嗎?他們這麼刻意的打壓我們,故意把湯圓除名在測試結果之外,那為什麼還要邀請我們來參加呢?」 韓路一倒不覺怪。
「這些人,總覺得自己是老大,就想要展示他們的公平公正,如果不邀請我們,以源智和湯圓現在的名聲,就是他們不包容了。」韓路一說道,「可是請我們來了,又害怕我們。這就是他們的擰巴之處。」
幾人坐下不久,進場的人越來越多。
一個熟悉的聲音響了起來。
「誒呀媽呀,趙總,這巧呢。」
趙文淵回頭一看,是鼎盛的劉大海。
劉大海在趙文淵身邊坐下,趙文淵驚奇地問道:「我記得鼎盛來不少人啊,劉博士不用和團隊在一起嗎?」
劉大海笑眯眯地點點頭:「看學術會議就像看電影,肯定還是和懂的人一起看有意思,咱倆一會兒嘮嘮。」
韓路一順著劉大海來的方向看過去,果然看見鄭曉波領著鼎盛的團隊坐在vip區的另一個方向。
鼎盛這次雖然沒有被邀請做講座,但是待遇還是比較高的。
到了九點過幾分,主會場的人已經坐得很滿了,韓路一沒看到御三家的人,猜測除了現場的vip座席之外還有vvip的貴賓休息室?
先是由新加坡的坡長上台致辭,以顯示當地政府對這個活動的重視,除了講了一些新加坡開放支持創新之類的老生常談之外,還格外提了淡馬錫主權基金正在積極尋找投資項目,希望有興趣的ai創業項目主動聯繫。 坡長下去之後,主辦方輪值主席理察走上台,整個會場沉悶的氣氛才重新被帶到了起來。
因為此時議程進入了ai foundations年度模型封閉測評的結果發布環節。
大屏幕上的內容切換成一排排名,但是模型的名字卻是隱藏的。
理察這才緩緩開口,吊足了觀眾的胃口。
「相信大家都注意到了最近人工智慧發展的新趨勢。我們已經擺脫了一問一答的初級階段,如何運用模型的能力,使智能體成為能夠獨立完成任務的生產力工具,才是這個時代的新課題。」
理察扶了扶眼鏡。
「所以我們聯合全球十七家最頂尖的研究機構,設計了一套面向下一代人工智慧的綜合評測,它不考慮公司的規模、不考慮任何國家和地區政策的影響,只看模型本身的表現。」
台下響起熱烈的掌聲。
【寫到這裡我希望讀者記一下我們域名𝑇𝑊看書📕𝑠ℎ𝑢.𝑡𝑤】
韓路一沒鼓掌。
他只覺得好笑。
十七家「最頂尖」的研究機構里,一家中國的公司和研究機構都沒有。
「不考慮公司的規模、不考慮任何國家和地區政策的影響」,但是湯圓1.0卻被剔除在外。 劉大海坐在另一側,本來準備鼓掌的,結果看到這邊源智的人都沒鼓掌,又訕訕地把手收了回去。
隨後,理察介紹了這套測評集、以及對應的評價體系新增加的關於長程任務、工具調用、多步驟規劃等能力的側重考察。
然後他開始公布結果。
前三名之後的結果是依次出現的,湯圓0.9的名字很顯眼地擺在了第四名的位置。
台下已經有人開始鼓掌了,從中國來的那些代表們鼓掌鼓得格外用力一些。
雖然在國內的時候大家也希望能讓自己的模型超過湯圓,但是在這種國際場合,湯圓0.9長達近兩個月的霸榜、在今天還能出現在第四名的位置,確實很讓人提氣。
而且看名字就知道,0.9,還不是正式版,他們也期待湯圓的後續模型能出現在前三名的位置里。
理察開始依次公布排名前三的模型。
第三名,谷歌的gemini-x-pro模型,70.8分。
台下的掌聲更劇烈了一些。
第二名,openai的gpt-v-ii模型,71.7分。
劉大海低聲說了一句:「老山姆這下子難受嘍。」 趙文淵回頭看了他一眼,才想起來這位劉博士以前也在openai工作過。
在公布第一名之前,理察刻意停頓了一會兒,等全場的掌聲都安靜下來。
有不少源智和湯圓有所了解的人都在偷瞄韓路一這邊。
幻燈片上的第一名顯現出來——
72.3分,金星2.0模型。
全場的掌聲再次響起,伴隨著討論聲。
劉大海愕然地回過頭,看向趙文淵:「趙總,你們沒整新模型啊?連我們鼎盛都整了啊。」
劉大海領導研發的坤元2.0,全面吸取了從當初湯圓的數據那得到的經驗,狠砸了資源和錢在數據質量上面,這次排名在第七名,已經比坤元1.1進步太多了。
但讓他沒想到的是,源智竟然沒有在這期間疊代新模型。
是研發遇到困難了?沒錢了?
劉大海越過趙文淵朝著韓路一看去,只見這位年輕的董事長正面帶微笑的看著大屏幕。
只是不知怎麼的,這個微笑看起來沒什麼溫度。 此時,大屏幕上的模型能力排名已經淡去,取而代之的是nexus ai白底黑字的logo,理察說道:「接下來我們請nexus ai的創始人、ceo,米勒先生來為我們介紹他們的最新模型——金星2.0。」
瑞恩從後台走了出來,西裝革履,意氣風發。
他先上台與理察握手,然後朝四周點頭致意。
「非常感謝會議主辦方,也非常感謝所有參與測評工作的研究人員。」瑞恩聲音激昂,「這不是我一個人的成績,也不是nexus ai一家公司的成績,我們能取得這樣的進步,離不開在座所有人工智慧從業者的共同努力!」
底下的媒體區快門聲不斷。
觀眾們都不覺怪,他們自己也在發x呢。
nexus ai再次摘冠,拿下智能體時代的sota模型地位,這絕對是值得今天科技版頭版的新聞。
但是他們不知道的是,媒體的記者們之所以這麼積極地在這拍照,完全是為了一會兒來個大的。
趙文淵回頭看了看韓路一,見他的表情還是那麼淡定,竟然還跟著別人鼓掌的節奏一起輕輕拍了兩下手,忍不住說道:「韓總,您還給他鼓掌?」
韓路一點了點頭:「讓他珍惜這段時間吧,還好他們加了媒體問答環節,這樣我就不用現在打斷他了。」
瑞恩還在上面介紹著金星2.0模型突破性的能力——尤其是在長程任務方面的能力,以及nexus ai的團隊付出了多少努力才能達到這樣的成績。
當然,具體使用了什麼樣的方法和訓練策略肯定是保密的。 並且瑞恩還強調了ai的安全有多麼重要,強大的能力需要更高的安全監管,金星2.0模型已經不可避免的成為了國家戰略級的武器,吧啦吧啦。
當講話轉向這些宏大敘事的時候,觀眾們的反應明顯分成了兩種。有些美國專家明顯沾了點技術狂熱,而世界各地來的其他地方的學者和從業者們則對美國佬這種無處不在的傲慢感到無奈。
終於,瑞恩的演講結束,進入到了公開問答的環節。
所有的記者們都爭相舉起了手。
瑞恩有點兒猶豫,第一個問題,他想給一個關係好一點兒的媒體。
但其實不管他點誰都一樣。
無論哪個媒體提問,都只會問同一個問題,一個能讓他們拿到今天的頭版新聞的問題。
因為就在剛才,所有媒體記者的手機里都收到了同一份資料,裡面的內容是兩封郵件的截圖。
另外一封,則是處理通知,宣布將代號為1042、實際是湯圓1.0的模型測評成績作廢,卻沒有解釋原因。
截圖從哪來,沒人能查到,但是這截圖就這麼出現在了他們的手機里。
視界出馬,他們當然查不到。 現在這些記者們就只想第一個問出那個問題——
湯圓1.0去哪了?
終於,瑞恩點名了《紐約時報》的記者,他曾經接受過對方的深度採訪,合作還算愉快。
金髮碧眼的女記者從工作人員手裡接過話筒,沒有任何寒暄的意思,直接問道:「米勒先生,我們收到資料,顯示在ai foundations本次封閉測評的匿名階段,湯圓1.0模型以93.5的得分排在第一位,遠高於金星2.0的72.3分,現在,它卻沒有出現在最終的榜單上。你知道這是為什麼嗎?」
附近的記者看到這個問題被別人先問出來了,都懊惱地嘆了口氣。
瑞恩站在台上有點兒懵逼。
什麼湯圓1.0?我沒聽說過啊?
他甚至回頭看了一下大屏幕,想看看裡面有沒有湯圓1.0,雖然排名榜單早就已經不在上面了。
我得第一不是應該的嗎?我們花了那麼多錢,那麼多算力,還進行了針對性的訓練。
93分又是什麼鬼?怎麼可能?那不是比金星領先了二十多分嗎?
瑞恩在台上愣了幾秒鐘沒有動作,但他畢竟是明星公司的ceo,見過大場面,很快就反應了過來:「不好意思,這個問題和金星、和nexus ai都沒有關係。我懷疑你收到的資料是假的,但這應該是主辦方來回答的問題。好了,有請下一位記者。」
瑞恩指了指另一個媒體的記者,話筒幾乎是工作人員從女記者的手裡搶了過來遞到了下一個記者的手上。 第二個記者馬上提問:「你覺得湯圓1.0真的有這樣的能力嗎?它比金星2.0高出20分的原因是什麼?你是通過什麼手段讓他下架的?」
瑞恩對第二個記者怒目圓瞪,什麼叫我是通過什麼手段讓他下架的?
我都沒聽說過什麼湯圓1.0!
此時,輪值主席理察看出來事情已經壓不住了,所有的媒體都只會追著這一個問題問。
不得已,他站了出來,走到瑞恩身邊接過他手裡的話筒,說道:「記者朋友們,不管你們是從哪裡聽到的謠言,請相信我,那都是不準確的。組委會確實收到過一款名為湯圓1.0的模型,但是因為它的成績異常,成績已經被取消了,這是遵循程序的。」
現場已經有點兒混亂了,第二個記者還拿著話筒,接著問道:「什麼叫做成績異常?異常的原因是什麼?這次封閉測評的結果還可信嗎?」
雖然會場的冷氣開得很足,但是此時理察的額頭已經開始冒汗了。
如果不能好好地解釋這件事,那對這次封閉測評,甚至對ai foundations舉辦的人工智慧大會都是一次公信力的巨大打擊。
但理察根本沒有什麼證據能拿出來,他們當時大概調查了一下,沒發現什麼異常,只是分數太高,就不了了之了。
理察一邊斟酌一邊開口:「當然,測評標準是經過我們周密設計的,絕對可信——這個模型可能只是一個例外,也許有人——」
說到這他停了下來。
在這個場合下,沒有證據就提出指責太容易被人駁倒了。 突然,一個聲音接過了他的話。
「有人把題偷了出來,讓這家公司提前進行了針對性的訓練?」說話的人正是林偉倫。
作為新加坡國立大學的合作方負責人,連場地都是他聯繫的,拿到一個話筒自然是輕而易舉。
他一邊說話一邊走上台,站在理察和瑞恩的對面,停了下來。
「科爾曼教授,你剛才提出的,真的是非常嚴重的指控。」林偉倫轉身看向台下,說道,「訓練湯圓1.0的廠商——源智科技——的代表們此時此刻就在現場,請你們上台和科爾曼教授現場對峙吧。」
早在這場風波剛剛開始的時候,就已經有人注意韓路一這邊的狀況了,林偉倫這一番話說完,更多的人看向了這邊。
在眾多目光的注視下,韓路一站起身。
今天為了這次活動——這場和理察、瑞恩之間的活動,韓路一特意穿上了顧司玥送給他的一身淺灰色西裝,配上他高大帥氣的建模和那種寵辱不驚的逼王氣質,視覺衝擊力很強。
他不疾不徐,一步一步走到了台上。
周圍越來越多的目光集中在了韓路一的身上,直到他從林偉倫的手中接過話筒。
「作為被ai foundations主動邀請來參加這次會議的人,我感到非常困惑。」韓路一緩緩說道,「測試是主辦方邀請我們參加的,我們只是正常提交了模型的接口,現在卻受到了這樣的指責。」
「從我們接到邀請到最終提交,只有幾個星期的時間,如果大家對模型訓練有所了解的話,就應該知道,即使有參考答案,要做訓練也來不及。」韓路一轉向理察,說道,「不知道科爾曼教說我們偷了測試集,有什麼證據嗎?」 理察沒有回答韓路一的問題,而是向現場的觀眾解釋道:「這次封閉測試之所以有效,很大的原因是我們進行了隔離式的沙盒環境,模型不能自己根據考題進行疊代。但是鑑於湯圓1.0已經進行過一次測試,如果用同一套測試集讓它再做一次,我們就很難保證結果的公平和公正了。」
他其實已經在給自己找台階下了,如果湯圓1.0現在再做出90多的高分,那也不是因為模型強,而是因為在上一輪測試中他們已經知道了考題,現在可能已經針對性的調整過了。
韓路一站在台上笑了笑。
「我們都知道,想要證明自己的清白有多難,我也不是來自證清白的。」
韓路一看了看台下的觀眾,說道:「我想,大家之所以來參加人工智慧會議,是想看到人工智慧有真正解決問題的能力,而不是為了看看幾個模型的分數。既然如此,倒不如就在今天,就在現場——」
「讓大家體驗一下最新一代模型所具有的能力。」
話音剛落,台下就已經響起了掌聲、尖叫聲、起鬨聲。
兩家頂尖模型公司現場battle,這不比聽瑞恩講什麼安全性重要、戰略級武器有意思?
理察站在原地,進退兩難。
大會的議程是早就定好的,後面還有主會場和各個分會場的演講,現在橫叉一個現場體驗來,怎麼安排,不是全亂套了嗎?
倒是瑞恩,看到現在這個場面之後,信心滿滿的向前一步。
「韓先生,只是開放接口,讓人們現場體驗,怎麼能直觀的分出好壞?」瑞恩說道,「我看倒不如就用之前搭建的沙盒環境,讓所有的模型都接入,再由所有現場的觀眾們投票選出一個複雜任務,同樣的提示詞給所有的模型,看看誰的完成度最高,如何?」 韓路一看向瑞恩。
雖然兩人之前郵件交流過、視頻過,更在各種會議中談論過對方。
但這還是兩人第一次在現實中見面。
視界打開。
【瑞恩·米勒】
【職位:nexus ai創始人、ceo】
【情緒:自信、激昂】
【核心動機:金星2.0模型能力內部驗證極為優秀,一定能在現場測試中取勝】
韓路一心下瞭然,不管是理察還是瑞恩,他們是真的不相信湯圓1.0的能力超過了金星2.0,之前測試中93.5的得分不是真實的成績。
「好。」韓路一答應了下來。
林偉倫帶著幾名同事迅速把之前測評中心機房裡的沙盒環境拉了過來,讓想要參與實時測試的廠商現場就能接入。
而韓路一則把電腦接入了大屏幕,現場用御風寫了一個投票程序,github開源,然後部署在鼎盛雲上,再把寫好的程序運行在大屏幕上。 前後花了不到五分鐘。
這是一場給御風智能體工具和鼎盛雲的活廣告,所有的開發者都能看見完成這樣一個需求的效率有多高。
很快,觀眾們自主發起的複雜任務提示詞被一個一個添加,然後根據點讚數排序。
最終得贊最高的那個提示詞就將成為今天的唯一測試題。
瑞恩拿著話筒,繼續細化流程。
「長程任務可能會長達幾個小時,為了讓大家都能在今天就能查看到結果,我們將在提示詞中添加最長可以運行的時間——」說到這,他抬手看了看表,此時已經是上午十一點多了,「五個小時,到下午五點,必須停止運行,然後運行的結果開放給大家自由查看。」
瑞恩沒說評判標準是什麼。
在這一點上,他和韓路一不謀而合。
榜單上的分數並不重要,真正重要的是讓潛在用戶們了解到模型所具有的解決問題的能力。
如果你是最強模型這件事已經能夠深入人心,那什麼榜單都沒有必要了。
韓路一聽完之後在旁邊點了點頭,瑞恩提出來的賽制其實還挺公平的。
更像是一場針對模型的黑客松比賽,統一出題、限制時間,最後的結果由觀眾們決定。 時間臨近十二點,觀眾們投票選出來的複雜任務此時也已經確定了。
任務只有短短的一句話。
趙文淵看到的時候不禁一笑。
那句話是——
「build me a minecraft(給我寫一個《我的世界》)。」