第387章 雙標
與此同時,新加坡,ai foundation在新加坡國立大學人工智慧研究所臨時租用的測評中心。
研究員、教授林偉倫正皺著眉頭盯著屏幕上的測評結果。
他是一個新加坡華裔,也是這次新加坡人工智慧大會,新加坡國立大學作為合作方的負責人。
「湯圓1.0為什麼沒在結果名單里?」林偉倫問旁邊的同事。
同事也是個華裔面孔,操著一口新加坡英語:「額,好像是被委員會拿掉了。」
「為什麼?」林偉倫奇怪地問道。
同事搖了搖頭:「這是他們的測評,可能是有什麼原因吧,我不清楚。」
林偉倫站起身。
「這可不是他們的測評,新加坡國立也是參與了的,他們不能無視我們的意見。」
說完他走了出去。
半個多小時後,在ai foundations與合作方的聯合會議上,林偉倫提出了同樣的問題。
「湯圓1.0為什麼沒在結果名單里?」 坐在林偉倫對面的是理察·科爾曼,一個滿臉皺紋白髮蒼蒼的老人。
理察現在擔任ai foundations的輪值主席,同時他本人也在mit擔任計算機科學教授,在業內德高望重。
理察把眼鏡摘下來,從上衣兜里取出一塊眼鏡布擦了擦,然後把眼鏡布收好,把眼鏡戴了回去。
等他慢條斯理的把這些動作做完,才開口回答林偉倫的問題。
「林教授,這是委員會共同的決定。」理察說道。
「據我所知,委員會共同決定了兩次。」林偉倫站起身,舉起手中列印記錄,上面寫著最近幾個小時之內委員會發的兩封內部郵件。
第一封是在盲測階段剛剛結束的時候,這個時候所有的模型都經過匿名處理,所有人能看到的結果只有一款模型的測試分數異常的高,遠遠超過了其他模型。
郵件內容是:「編號為1042的模型表現極佳,建議進行覆核檢查。」
第二封則是在幾小時之後,模型匿名解除,證實1042是由源智科技提交的湯圓1.0模型。
委員會發出的郵件內容已經變成了:「高度懷疑湯圓1.0模型通過非技術手段進行了作弊,已決定將湯圓1.0模型的成績進行作廢處理。湯圓0.9模型的成績可以保留。」
林偉倫晃了晃手中的紙,問道:「在匿名階段,處理決定是進行覆核檢查;等到身份解盲之後,就變成了作廢處理。我想知道這背後的理由是什麼?」
「自然是因為我們掌握了更多的信息。」理察淡定地回答道。 「更多的信息是廠商的名字嗎?」林偉倫的語氣略顯譏諷,因為他真的覺得這個問題非常荒誕。
「這是一部分有用的信息。」理察並沒有覺得這裡面有什麼不對,他神色認真地說道,「我們對中國廠商都有所了解,現實情況就是,中國的大模型廠商在公開排行榜上有非常強的優化動機。你也看到了,這個來自中國的模型分數極為異常,我們都有理由相信這個測試結果是不準確的。」
只是分高就是不準確?
林偉倫「嘿」了一聲:「如果測試結果不準確的話,難道不是所有的模型測試結果都不準確嗎?為什麼單獨剔除這一個模型?」
「這套測試題是多家機構和專家聯合設計的,我認為作為最新的、評價現行模型的標準,是很有價值的——只要剔除掉明顯作弊的模型就可以了。」
林偉倫環視了一圈坐在會議室里的代表,ai foundations的成員單位大部分都來自於美國,這裡大部分的代表也都來自於美國。
對這個結果,沒有一個代表提出不同的意見。
他感到自己剛剛經歷了一場學術霸凌。
全網首發更新 讀小說上 TW 看書網,𝐬𝐡𝐮.𝐭𝐰超讚
雖然這個霸凌不是針對他本人的。
「那麼,」林偉倫繼續說道,「這樣一套經過嚴密設計的測試題,他們是怎麼作弊的?」
理察看向林偉倫。
「我沒想到你會問出這個問題,林教授。」他說道,話里意有所指,「一個模型的成績異常的高,自然是因為提前進行了針對性的訓練,我認為,可能有ai foundations的合作單位把這套本應視為機密的測試題進行了泄露。」 這場人工智慧大會新加坡站,ai foundations的合作單位只有兩家,新加坡國立大學和新加坡國家ai研究院,這個指責指向誰,不言而喻。
林偉倫氣極反笑。
以他的權限,他只能看到分數結果,卻對測試里的內容一無所知。
合作方唯一能接觸到的信息是內部公告和關於會議議程、測試流程的一些統一郵件。
偷測試集,他難道是商業間諜嗎?如果是的話,他直接偷模型不好嗎,為什麼要去偷一個沒什麼用的測試集?
現在理察不僅要作廢排名第一的測試結果,還要把提前泄露考題的黑鍋扣在他身上?
林偉倫冷笑了一聲,說道:「科爾曼教授,你的指責令人發笑,如果你執意要執行這樣的決定的話,我會代表新加坡國立大學退出這次合作。」
林偉倫說這話只是在虛張聲勢,他只是個教授,不是校長,更不姓李。他完全因為專業對口擔任合作方的負責人,根本沒有權利決定退出合作。
理察果然沒被嚇到,他微微一笑:「林教授,請便吧。」
林偉倫沒等到會議結束就直接走出了會議室,一路回到自己的辦公室。
回到辦公室之後,他又拿出測試結果的分數看了一遍。
以往的模型測試集主要集中在測試知識、數學能力、編程能力、理解能力和推理能力之類的方向。 但是因為智能體應用最近的爆火,ai foundations這一次的測試集特意注重了長程任務的能力,而且占比極高,總分一百分的測試題中有三十五分是與長程任務的管理有關的。
當然,這裡說的分並不是像學生考試做卷子一樣,四個選項里蒙一個,對了就拿分。具體的測試過程相當複雜,每一題都要完成一個跨度長達幾個小時、進行很多個步驟才能完成的任務,最後成功之後才能拿到一分,有時甚至要重複多次來驗證穩定性,取平均分。
在這樣的新標準下,現在的公開模型評分普遍不算太高。
之前霸榜了很久的湯圓0.9隻有70.2分。
gemini的新模型最終得分70.8分,openai的gpt-v-ii最終得分71.7。
分數第二高的金星模型2.0得分是72.3分。
互相之間咬的很緊。
只有湯圓1.0,得分93.5,比第二名領先了二十多分。
說實話,這種程度的領先,林偉倫也不理解。
但正是因為不理解,他更不能接受理察等人毫無理由的打壓。打不過就修改規則?這些傲慢的西方人。
林偉倫翻看起了源智科技來參會成員的聯繫方式,他決定等對方到了之後,親自過去交流一下。
至少要讓他們知道自己所受到的不公正待遇。 如果他們需要幫助的話,林偉倫也做好了準備。
另外一邊,理察剛剛接通和矽谷的電話。
電話那邊的是nexus ai的ceo瑞恩。
「測試成績你看到了嗎?」理察一邊喝紅茶一邊說道,「恭喜你啊,瑞恩,這次你可是堂堂正正的打敗了山姆。」
「看到了,還要多虧了老師你的指點。」瑞恩說道。
在他的學術生涯中,瑞恩曾經和理察有過友好的學習關係,這個關係一直保留了下來,在他的創業過程中也起到了很大的幫助。
就拿這次來說,如果沒有理察在大方向上的指點,甚至指出了某些極為具體的技術挑戰,金星2.0的研究方向肯定也會優化長程任務,但是出來的效果能不能有現在這麼好,瑞恩也不敢保證。
「很好,聽說mcp最近的推廣也很有成效,我為你自豪。」理察在電話里笑了兩聲,「期待在新加坡見到你展示你的最新成果。我知道,你的對手,那個湯圓協議公司的人也會來,但是你放心,你會得到我的支持。」
理察沒提湯圓1.0的事。
畢竟他是真心認為,這個模型是作弊了,大部分頂級模型之間的差距都在一兩分之間,這個模型一次高出二十分去,除了作弊他想不到別的原因。
雖然理察也沒想出他們是怎麼作弊的,但這不重要。
電話掛斷之後,瑞恩靠在老闆椅的椅背上,把雙腳翹上了辦公桌的桌面,同時鼻子裡哼起了義大利小曲。 nexus ai的最新模型能力超過了openai的最新模型。
值得紀念的一天。
什麼叫技術儲備啊?這就是技術儲備!
研究員、教授林偉倫正皺著眉頭盯著屏幕上的測評結果。
他是一個新加坡華裔,也是這次新加坡人工智慧大會,新加坡國立大學作為合作方的負責人。
「湯圓1.0為什麼沒在結果名單里?」林偉倫問旁邊的同事。
同事也是個華裔面孔,操著一口新加坡英語:「額,好像是被委員會拿掉了。」
「為什麼?」林偉倫奇怪地問道。
同事搖了搖頭:「這是他們的測評,可能是有什麼原因吧,我不清楚。」
林偉倫站起身。
「這可不是他們的測評,新加坡國立也是參與了的,他們不能無視我們的意見。」
說完他走了出去。
半個多小時後,在ai foundations與合作方的聯合會議上,林偉倫提出了同樣的問題。
「湯圓1.0為什麼沒在結果名單里?」 坐在林偉倫對面的是理察·科爾曼,一個滿臉皺紋白髮蒼蒼的老人。
理察現在擔任ai foundations的輪值主席,同時他本人也在mit擔任計算機科學教授,在業內德高望重。
理察把眼鏡摘下來,從上衣兜里取出一塊眼鏡布擦了擦,然後把眼鏡布收好,把眼鏡戴了回去。
等他慢條斯理的把這些動作做完,才開口回答林偉倫的問題。
「林教授,這是委員會共同的決定。」理察說道。
「據我所知,委員會共同決定了兩次。」林偉倫站起身,舉起手中列印記錄,上面寫著最近幾個小時之內委員會發的兩封內部郵件。
第一封是在盲測階段剛剛結束的時候,這個時候所有的模型都經過匿名處理,所有人能看到的結果只有一款模型的測試分數異常的高,遠遠超過了其他模型。
郵件內容是:「編號為1042的模型表現極佳,建議進行覆核檢查。」
第二封則是在幾小時之後,模型匿名解除,證實1042是由源智科技提交的湯圓1.0模型。
委員會發出的郵件內容已經變成了:「高度懷疑湯圓1.0模型通過非技術手段進行了作弊,已決定將湯圓1.0模型的成績進行作廢處理。湯圓0.9模型的成績可以保留。」
林偉倫晃了晃手中的紙,問道:「在匿名階段,處理決定是進行覆核檢查;等到身份解盲之後,就變成了作廢處理。我想知道這背後的理由是什麼?」
「自然是因為我們掌握了更多的信息。」理察淡定地回答道。 「更多的信息是廠商的名字嗎?」林偉倫的語氣略顯譏諷,因為他真的覺得這個問題非常荒誕。
「這是一部分有用的信息。」理察並沒有覺得這裡面有什麼不對,他神色認真地說道,「我們對中國廠商都有所了解,現實情況就是,中國的大模型廠商在公開排行榜上有非常強的優化動機。你也看到了,這個來自中國的模型分數極為異常,我們都有理由相信這個測試結果是不準確的。」
只是分高就是不準確?
林偉倫「嘿」了一聲:「如果測試結果不準確的話,難道不是所有的模型測試結果都不準確嗎?為什麼單獨剔除這一個模型?」
「這套測試題是多家機構和專家聯合設計的,我認為作為最新的、評價現行模型的標準,是很有價值的——只要剔除掉明顯作弊的模型就可以了。」
林偉倫環視了一圈坐在會議室里的代表,ai foundations的成員單位大部分都來自於美國,這裡大部分的代表也都來自於美國。
對這個結果,沒有一個代表提出不同的意見。
他感到自己剛剛經歷了一場學術霸凌。
全網首發更新 讀小說上 TW 看書網,𝐬𝐡𝐮.𝐭𝐰超讚
雖然這個霸凌不是針對他本人的。
「那麼,」林偉倫繼續說道,「這樣一套經過嚴密設計的測試題,他們是怎麼作弊的?」
理察看向林偉倫。
「我沒想到你會問出這個問題,林教授。」他說道,話里意有所指,「一個模型的成績異常的高,自然是因為提前進行了針對性的訓練,我認為,可能有ai foundations的合作單位把這套本應視為機密的測試題進行了泄露。」 這場人工智慧大會新加坡站,ai foundations的合作單位只有兩家,新加坡國立大學和新加坡國家ai研究院,這個指責指向誰,不言而喻。
林偉倫氣極反笑。
以他的權限,他只能看到分數結果,卻對測試里的內容一無所知。
合作方唯一能接觸到的信息是內部公告和關於會議議程、測試流程的一些統一郵件。
偷測試集,他難道是商業間諜嗎?如果是的話,他直接偷模型不好嗎,為什麼要去偷一個沒什麼用的測試集?
現在理察不僅要作廢排名第一的測試結果,還要把提前泄露考題的黑鍋扣在他身上?
林偉倫冷笑了一聲,說道:「科爾曼教授,你的指責令人發笑,如果你執意要執行這樣的決定的話,我會代表新加坡國立大學退出這次合作。」
林偉倫說這話只是在虛張聲勢,他只是個教授,不是校長,更不姓李。他完全因為專業對口擔任合作方的負責人,根本沒有權利決定退出合作。
理察果然沒被嚇到,他微微一笑:「林教授,請便吧。」
林偉倫沒等到會議結束就直接走出了會議室,一路回到自己的辦公室。
回到辦公室之後,他又拿出測試結果的分數看了一遍。
以往的模型測試集主要集中在測試知識、數學能力、編程能力、理解能力和推理能力之類的方向。 但是因為智能體應用最近的爆火,ai foundations這一次的測試集特意注重了長程任務的能力,而且占比極高,總分一百分的測試題中有三十五分是與長程任務的管理有關的。
當然,這裡說的分並不是像學生考試做卷子一樣,四個選項里蒙一個,對了就拿分。具體的測試過程相當複雜,每一題都要完成一個跨度長達幾個小時、進行很多個步驟才能完成的任務,最後成功之後才能拿到一分,有時甚至要重複多次來驗證穩定性,取平均分。
在這樣的新標準下,現在的公開模型評分普遍不算太高。
之前霸榜了很久的湯圓0.9隻有70.2分。
gemini的新模型最終得分70.8分,openai的gpt-v-ii最終得分71.7。
分數第二高的金星模型2.0得分是72.3分。
互相之間咬的很緊。
只有湯圓1.0,得分93.5,比第二名領先了二十多分。
說實話,這種程度的領先,林偉倫也不理解。
但正是因為不理解,他更不能接受理察等人毫無理由的打壓。打不過就修改規則?這些傲慢的西方人。
林偉倫翻看起了源智科技來參會成員的聯繫方式,他決定等對方到了之後,親自過去交流一下。
至少要讓他們知道自己所受到的不公正待遇。 如果他們需要幫助的話,林偉倫也做好了準備。
另外一邊,理察剛剛接通和矽谷的電話。
電話那邊的是nexus ai的ceo瑞恩。
「測試成績你看到了嗎?」理察一邊喝紅茶一邊說道,「恭喜你啊,瑞恩,這次你可是堂堂正正的打敗了山姆。」
「看到了,還要多虧了老師你的指點。」瑞恩說道。
在他的學術生涯中,瑞恩曾經和理察有過友好的學習關係,這個關係一直保留了下來,在他的創業過程中也起到了很大的幫助。
就拿這次來說,如果沒有理察在大方向上的指點,甚至指出了某些極為具體的技術挑戰,金星2.0的研究方向肯定也會優化長程任務,但是出來的效果能不能有現在這麼好,瑞恩也不敢保證。
「很好,聽說mcp最近的推廣也很有成效,我為你自豪。」理察在電話里笑了兩聲,「期待在新加坡見到你展示你的最新成果。我知道,你的對手,那個湯圓協議公司的人也會來,但是你放心,你會得到我的支持。」
理察沒提湯圓1.0的事。
畢竟他是真心認為,這個模型是作弊了,大部分頂級模型之間的差距都在一兩分之間,這個模型一次高出二十分去,除了作弊他想不到別的原因。
雖然理察也沒想出他們是怎麼作弊的,但這不重要。
電話掛斷之後,瑞恩靠在老闆椅的椅背上,把雙腳翹上了辦公桌的桌面,同時鼻子裡哼起了義大利小曲。 nexus ai的最新模型能力超過了openai的最新模型。
值得紀念的一天。
什麼叫技術儲備啊?這就是技術儲備!