KDZNR网

 找回密码
 立即注册
搜索
热搜: 活动 交友 discuz
查看: 15|回复: 0

如何看懂AI基准测试不被忽悠

[复制链接]
匿名
匿名  发表于 昨天 17:58 |阅读模式
OpenAI 悄悄停用了 AI 编程圈被引用最多的那道考题。下面讲清楚,每次发布时那些分数到底在量什么,以及你该反过来查什么。



那个被引用最多的 AI 编程分数,带着它的小字条款:80.9% 加星号。这是 SWE-bench Verified 的最高分,一年半里几乎每次编程模型发布都要报这个数。

数字是真的,星号才是故事

OpenAI 审计了 138 道最难的题,发现 59.4% 的测试本身是坏的或不公平的。前沿模型在训练期间似乎见过部分答案。OpenAI 已不再用这个基准评估前沿模型。

这三个问题,以某种形式出现在每一个流行的 AI 测试里。

不久前,OpenAI 悄悄停用了 AI 编程圈被引用最多的那道考题。一年半里,几乎每次模型发布都要吹嘘自己在 SWE-bench Verified 上的得分——这是一个从真实开源项目里真实 bug 构建出来的基准。OpenAI 参与创建了它,结果自家审计发现,最难的那些题大部分评分都是坏的,而且前沿模型似乎在训练时就见过部分答案。人人指着的那块记分牌,量出来的东西里有一部分是记忆和运气。

这件事不止关乎编程。每次你读到一个新模型"在基准上击败 GPT-5"或者"博士考试拿了 92 分",别人塞给你的都是一个带着一大堆没人念出来的小字的数字。本文就是那份小字,用大白话讲:那些大考到底在量什么,它们的数字会以哪三种方式出错,以及一个大约十分钟、自己判断任何新模型的简单办法。

每条 AI 头条都压在同一小撮考试上

基准说白了就是一套固定考卷。有人写一大堆带标准答案的题,每个模型做同一张卷,答对的百分比就是你在图上看到的分数。这个想法表面上很公平:题目人人一样,数字就该可比。

发布公告里主要靠四门考试撑场面。MMLU 是一场横跨 57 个学科的巨型选择题测验,从法律到小学数学都有。GPQA 是 448 道由博士写的科学题,难到上网搜几乎没用。SWE-bench Verified 给模型 500 份真实 bug 报告,让它去修真正的代码。而 LMArena 根本不是考试:它把同一个问题的两个匿名答案摆给志愿者,让他们投自己更喜欢的那个。

大多数 AI 头条背后的四门考试,用大白话讲:

MMLU|57 学科选择题:法律、医学、历史、数学等|顶级模型现在都过 90%,谁看起来都很聪明|老、错漏多、几乎肯定进过训练数据
GPQA|448 道博士写的科学题,难到谷歌帮不上忙|博士专家自己约 65%,模型已经超过他们|题量小,几分的差距可能只是噪声
SWE-bench Verified|500 份开源项目真实 bug,修代码|顶端约 80% 且卡住不动|已被 OpenAI 停用:测试坏了、答案漏了
LMArena|陌生人在两个匿名答案间投票,胜场汇成排名|排名高意味着人们喜欢读它的答案|既测魅力也测准确,而且可以被操纵

下面两列里的每一条主张都在正文里有出处。基准还有几百个,但发布公告主要靠这四个。

它们每一个都在量某样真实的东西。麻烦出现在把某一门考试的数字当成对智能的总评时。有三件具体的事会坏掉,值得你记住名字,因为它们几乎能解释所有"纸上很强、见光死"的模型案例。



模型会背答案

模型从互联网的海量抓取里学习,而互联网上就摆着这些考卷。题目、答案、以及讨论这两者的成千上万页网页。当考试材料漏进训练数据,研究者称之为污染。模型不是推理推出答案,它本质上已经见过了答题卡。

最干净的示范来自 Scale AI 的一个团队。他们从零重建了一场流行的小学数学考试:1000 道全新题,由人写,风格和难度对齐著名的 GSM8k 基准,并且保证不在任何人的训练数据里。然后他们让主流模型做两个版本。在新考卷上,有些模型家族比原版低了整整八个百分点,好几个家族几乎在所有尺寸上都过拟合。模型们部分背下了公开考卷。数学能力是真的,只是分数夸大了它。

同一个问题也促成了 SWE-bench Verified 的死。在 OpenAI 的审计里,模型解出了被评为几乎不可能的任务,而且项目发布说明里的细节会出现在模型的推理中——哪怕题目根本没提这些细节。基准任务来自公开代码仓库,而公开,恰恰是训练抓取最吃的东西。

结论不是每个分数都是假的。在那项数学研究里,前沿模型的过拟合很轻。结论是:一个又老又公开的考试上的分数是天花板,不是承诺。真实能力在这个数字上、或者比这个数字更低的地方。

考试会越来越简单

一门考试只有在有人挂科的时候,才分得清模型高下。MMLU 刚发布时是真的难:当时最好的模型只比瞎猜对大约二十个百分点,作者写道最好的模型在 57 个学科里每一个都还需要大幅改进。今天,顶级模型扎堆在 90% 以上,这正是研究者搞出 Humanity's Last Exam 的原因——一份故意做得残酷、2500 题的替代品,前沿模型在上面仍然低分。基准有生命周期:难,然后有用,然后饱和,然后退役。

GPQA 把同一个故事讲得更快。它刚推出时,博士专家在自己领域约 65%,而 GPT-4 只能拿 39%。不到两年,前沿模型就驶过了专家线;Epoch AI 的独立测试测出某个模型在最难切片上拿了 87%。问题从"AI 能不能做科学"漂成了发布表格里一行例行公事。而 SWE-bench Verified 最后半年顶端被钉在 74.9% 到 80.9% 之间,平台平到没人说得清剩下的失败是模型的错还是考试的错。

饱和对读者有个狡猾的后果:靠近天花板时,小差距开始毫无意义。三个模型在几千题的测验上拿 89%、90%、91%,排名可能取决于几道题,其中几道还是坏的。这就引出第三个问题。

有些题本身就是错的

基准是人建的,通常建得很快,常常从网上扒题。错误就这么混进来了。一组研究者人工复查了 MMLU 的一个切片,估计其中 6.49% 的题有错:标准答案错了、多个选项都对、或者题目本身就不通。最差的学科是病毒学,他们分析的题里 57% 有问题。在这些题上,模型可能因为答对了反而被判错。

编程基准更惨,因为评分是自动的。一个修复只有通过项目自己的测试才算对,而测试可以不公平。SWE-bench Verified 之所以存在,正是因为原版 SWE-bench 噪声太大;OpenAI 花钱请人工评审筛到 500 道经过核验的题。即便如此,对剩下最难 138 道的审计发现,59.4% 的测试有缺陷或题目陈述不清,包括那种仅仅因为修复没照搬某一种具体实现就拒绝正确修复的测试。

把两个数字摆在一起,教训自己就写出来了:如果一份考卷有好几个百分点是坏的,那么两个模型之间两分的差距就在噪声里面。把接近的分数当成平局。

人气比赛可以被刷

因为固定考卷老得快,很多人更喜欢 LMArena 这种盲品测试。你问一个问题,两个没标名字的模型回答,你投更喜欢的那个,然后才亮名字。票攒成公开排名。题目每天更新,所以没东西可背。这是个真正聪明的设计,可它仍然有软肋:它量的是人们喜欢什么,而人们喜欢什么是可以被制造的。

最清楚的例子出现在前不久。Meta 向竞技场提交了 Llama 4 Maverick 的一个特殊版本,专门调校得讨投票者喜欢,它一路爬到世界第二。真正对外发布的那个版本行为不同,等 LMArena 按同一规则几天后排它时,落到了第三十二。同一个名字,差了三十名。竞技场随后改了规则。

送到排行榜的版本|LMArena 全部模型第二|一个叫 Llama-4-Maverick-Experimental 的特殊变体,调校得健谈、爱发表情包、从不对外发布
你真正能下载的版本|同一规则下测试后第三十二|公开版 Llama 4 Maverick,几天之后排名低三十位,排在几乎老一年的模型后面

LMArena 说 Meta 本该更清楚地说明提交的是定制版,随后改了规则。

后来一项名字就叫排行榜幻觉的研究,记录了同一种优势的结构性版本。大实验室私下测了许多变体,只交最好的那个结果;光是 Meta 在 Llama 4 发布前就试了 27 个私下变体。研究还估计,Google 和 OpenAI 的模型合计拿了大约 40% 的竞技场票,而 83 个开放权重模型分不到 30%,光是这种额外曝光就能带来巨大的排名提升。这一切都不意味着榜首是骗来的。它意味着一个排名,部分上是在量某家在排行榜上花了多大力气。

一个分数还能告诉你什么

兜了这么一圈,很容易得出基准一文不值的结论。它们不是。你只需要像读二手车挂牌那样读它们:事实是真的,只是被摆得对你有利。四个习惯就能捡回大部分信号。

信任大差距,忽略小差距。一个模型在难题上比另一个高三十分,那它在这类活儿上很可能就是更强。高两分的,算平局。在坏题、背答案和天花板效应面前,个位数的差距很少能活过现实的检验。

优先选模型没机会备考的考试。更新的基准、私有的题库、新写的任务,好过任何已经挂在网上好几年的东西。当一个发布只引用陈年基准时,这本身就是信息。

查谁跑的测试。厂商给自己的模型判卷,挑设置、挑尝试次数、挑问法。独立复测通常低几分。不是丑闻,只是人性。把厂商数字当成最好情况读。

让考试匹配你的任务。编程基准对写作质量一言不发。竞技场排名对事实准确性几乎没说什么。如果你主要是总结文档,一个模型的数学奥赛成绩就是闲话。我们在月度盘点里用大白话持续记录哪些新模型真正重要,那边也用同样的怀疑:基准会拍马屁。

拿你自己的任务测十分钟,胜过任何排行榜

实操部分来了。你不需要基准来选模型。你需要的是五个你自己的任务和十分钟,因为唯一重要的考试,是你这一周一直在做的那套。

十分钟个人基准,不需要任何排行榜:

第一步,收集五个真实任务。从你真实的一周里抽:你写过的一封邮件、你修过的一个 bug、你总结过的一份文档、你跑过的一个出图提示词、你答错过的一个问题。

第二步,每个任务留一个已有的答案。你上次接受的那个输出就是基线。新模型赢它、平它、还是输它,不需要分数。

第三步,五个任务都在新模型上跑一遍。同样的措辞、同样的文件、你平时用的同样设置。你测的是你的工作流,不是模型的考试技巧。

第四步,能盲测就盲测。把新旧答案并排贴上,不标名字,挑更好的那个。这就是竞技场方法,只是去掉了陌生人。

第五步,按五局四胜定。在你五个任务里赢四个的模型,对你来说就是更好的,管它排行榜说什么。五五开的局面,就保留你现在用的。

这就是正经团队正式做的那套东西的家用版。如果你在产品里跑 AI,同一个思路会长成真正的测试套件,带保存案例和通过标准;我们写过一篇手把手的指南讲怎么写你自己的 AI 评测。如果你只是想在测任何东西之前先要一个起步短名单,我们那篇 ChatGPT、Claude、Gemini 逐个任务对比就是这么建的:同样的提示词,并排摆,按输出判断。

下次再看到头条说某个模型碾压基准,你已经知道该问三个问题。它会不会是背过这张考卷?这张考卷是不是简单到已经分不出高下了?答题卡是谁核对的?大多数发布日数字,至少在其中一个问题面前就蔫了。你自己的五个任务,永远不会。
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

Archiver|手机版|小黑屋|KDZNR网

GMT+8, 2026-9-26 22:29 , Processed in 0.059809 second(s), 20 queries .

Powered by Discuz! X3.4

© 2001-2023 Discuz! Team.

快速回复 返回顶部 返回列表