-
日期: 2025-06-12 | 來源: 騰訊科技 | 有0人參與評論 | 字體: 小 中 大

2025年的高考剛結束,AI挑戰高考題的浪潮卻持續升溫。
DeepSeek、騰訊混元、訊飛星火、字節豆包、阿裡通義千問、百度文心等大模型紛紛被“請”進同款試卷的線上戰場,掀起了壹波“AI 趕考”的刷屏熱潮,“千軍萬馬過獨木橋”的競賽在硅基世界中重演。
然而,不同評測團隊的試卷版本和OCR識別效果各不相同,可能連模型是否順利閱讀到答卷都有很大的不確定性,打分標准更是伍花八門,單次的“高分”往往難以復現。
另外,高考是為篩選人才而設計的,它考查的不僅是知識掌握,更是時間壓力下的心理素質和臨場應變能力。
當我們用非標測試下的AI高考分數能力來評估大模型的能力,真的客觀嗎?單次的分數,又能否代表某個大模型的真實能力?
先說結論:
●用高考題這種標准化試題評測大模型的單科能力具有壹定的客觀性和參考意義。但是成績高不等於大模型壹定強,人類考試的分數標准並不適用於AI模型的能力評估標准。
●目前的"AI高考"測試普遍缺乏嚴謹性,測試環境和評分標准都不夠規范可信。
●評估大模型能力應使用專門設計的Benchmark。
●如果非要用“高考成績”看模型能力,應該看梯隊而非排名,幾分的差距不能充分代表能力差距。
壹、“AI高考"如何考?
從目前已經公開的文章來看,“大模型趕考”壹般會經歷以下兩個步驟:
第壹步是給大模型輸入高考題,主要采用了以下幾種方法:
直接文本輸入:將題目以純文本形式輸入給大模型,讓模型給出答案。但是如果題目包含圖像,模型可能無法解題。
OCR轉換法:將圖片、掃描件或PDF文檔中的文字轉換為可編輯和可搜索的文本格式,再輸入給大模型。這種方法的准確性很大程度上依賴於OCR技術的質量,可能引入額外的誤差。
多模態輸入法:直接將包含文字和圖像的題目輸入給具備視覺能力的大模型。這種方法最接近人類考試的實際情況,但很多大語言模型還不具備這種能力。
人工轉寫:由人工將題目內容轉寫為標准文本格式。這種方法可以避免OCR錯誤,但可能在轉寫過程中丟失或改變原題的某些信息。
第贰步,是進行評分,這個環節也有不同的機制:
最簡單的是標准答案對比法:將模型答案與標准答案進行對比,按照預設規則給分。這種方法相對客觀,但主觀題的評判還是會有偏差。
還有很多人邀請壹線教師或教育專家對模型答案進行評分。這種方法的優勢是專業性強,但完全依賴人類高考的標准,存在主觀性和壹致性問題。
多輪評分法:由多位專家獨立評分後取平均值。這種方法可以減少個體主觀性的影響,但評測成本較高,被采用比較少。
混合評分法:結合自動化評分和人工評分。對於有明確答案的題目使用自動評分,對於開放性題目使用人工評分。
給模型輸入題目的路徑方法伍花八門,評分環節也有不同的機制,所以我們會發現同壹個AI在不同媒體的測試中,分數往往不太壹樣,排名也是千差萬別。
比如,讓AI做同壹張數學全國卷壹。下圖(上)是壹位AI自媒體,用AI進行叁輪答題,僅參考最終答案,按照答對的概率給模型評分,得出的得分排名。下圖(下)是我們用OCR轉化之後,取AI壹輪答題結果,並請人類名師按照高考的標准進行評分後得到的結果。兩個結果大相徑庭,以豆包為例,右邊得分僅為75分,而左邊得分高達145分。- 新聞來源於其它媒體,內容不代表本站立場!
-
原文鏈接
原文鏈接:
目前還沒有人發表評論, 大家都在期待您的高見