跳转至

大模型也要考试:从 MMLU 到 DeepSWE 看懂 AI 评测

每次有新的旗舰大模型发布,厂商都会晒出一张类似这样的“成绩单”:MMLU-Pro 87%、AIME 95%、SWE-bench Verified 80%、DeepSWE 70%……这些缩写是什么?它们是同一张考卷吗?分数更高就一定更聪明吗?

这篇文章把大模型评测当成一套“考试系统”来拆解:每个著名基准的全称是什么、什么时候出现的、为什么出现,以及它真正在考模型哪种能力。

阅读提示

这篇文章假设你只是普通用户,不需要懂机器学习。只需要记住一个类比:评测基准就是给大模型准备的标准考试——有人出题、有人规定答题方式、有人批改打分,最后把分数公开。不同考试就像语文、数学、编程的不同科目,不能直接比较分数高低。

1 考卷地图

1.1 为什么要给大模型考试

或许我们经常会听说:现在的AI大模型很强,能干的事情有很多。

但大模型的能力究竟有多强?究竟能干什么事情?干到什么程度?不同大模型的好坏又该怎么比较?

为了解决这些问题,我们需要一套固定题目 + 固定评分规则的系统,把所有大模型拉到同一张卷子上公平较量。

这种系统就叫 Benchmark(基准测试,也常译为“评测基准”)。

一套完整的评测基准通常由四部分组成:

组成部分 作用 例子
题目集 决定“考什么” MMLU 的选择题、DeepSWE 的仓库任务
作答规则 规定模型怎么答题 直接作答、给几个例题(few-shot)、先写推理过程(CoT)
判分器 决定“怎么算对” 对答案、跑单元测试、在容器里运行代码
运行环境 保证过程可复现 Docker 沙箱、隔离的仓库副本

1.2 常见的“题型”和“分数”

大模型评测主要有三类题型:

  • 选择题:好判分,但模型可能靠猜。MMLU 是四选一,纯猜也有 25% 正确率;MMLU-Pro 是十选一,纯猜只剩 10%。
  • 开放题:例如数学题直接输出一个数字或表达式,评分器检查是否与标准答案等价。难度更高,但判分复杂。
  • 执行题:让模型写代码或修改项目,然后真正运行测试。最接近“动手能力”,但最贵、最慢。

常见的分数含义:

指标 含义
Accuracy(准确率) 答对的题目数 ÷ 总题目数,适合选择题和数学题
pass@k 允许模型尝试 k 次,只要有一次通过测试就算会做。pass@1 是“一次过”,最严格
Resolved rate(解决率) SWE 类基准专用:修改后的代码能让“原本失败的测试通过、原本通过的测试不坏”的任务比例

常见的考察方式:

名称 含义
Zero-shot 不给例题,直接问
Few-shot 在问题前塞几道“题目 + 标准答案”作示范
CoT(Chain of Thought) 要求模型“先把推理步骤写出来,再给答案”。同一张卷子用不同作答方式,分数可能差很多,所以看成绩单时要注意评测设置。

1.3 考卷存在的问题

  • Contamination(数据污染):模型在训练时已经“见过”考题和答案。这就像考试前已经背下了真题,考高分只能说明记忆力强,解题能力却未必强。老考题、公开题库都容易中招。
  • Saturation(饱和):当顶尖模型都考到 95 分以上,这张卷子就“没有区分度”了,大家看起来都差不多,评测也就失去了意义。

评测发展的主线,就是和这两种问题作斗争:题目变难、选项变多、考题保密、动态更新,或者干脆写一批从没被公开过答案的新题。下面要介绍的每一个基准,几乎都是为了解决上一张考卷的某个问题而诞生的。

2 知识广度

2.1 MMLU:大模型的“文理综合高考”

MMLU 的全称是 Massive Multitask Language Understanding,直译为“大规模多任务语言理解”。

它由 Dan Hendrycks 等人于 2020 年 9 月发布,论文后来被 ICLR 2021 接收,题目来自教材、考试和百科等公开资料。1 MMLU 一共整理出约 1.5 万道四选一选择题,覆盖 57 个学科,从基础数学、美国历史、计算机科学、法律,到营养学、宗教学都有,再归入人文、社科、STEM 和其他四大类。

MMLU 在考什么

它的关键词是“广而不深”:不要求模型写长答案,而是看模型是否拥有像受过良好通识教育的人那样的知识面和基本理解力。比如“下列哪个概念属于经济学中的机会成本”“这段程序的时间复杂度是多少”这类题。

刚发布时,GPT-3(175B)在 few-shot 设置下也只有约 44% 的正确率,只比随机猜测(25%)好一些。后来大模型能力快速提升,到 2024 年前后,前沿模型普遍考到 85% 以上,MMLU 逐渐“饱和”。同时,它的题目在网上流传多年,污染问题越来越严重,于是人们开始设计更难的升级版。

2.2 MMLU-Pro:从四选一到十选一

MMLU-Pro 的论文全称是 A More Robust and Challenging Multi-Task Language Understanding Benchmark,即“一个更稳健、更具挑战性的多任务语言理解基准”。

它由 TIGER-Lab(滑铁卢大学)等团队于 2024 年 6 月发布,入选 NeurIPS 2024,可以理解为 MMLU 的“加强版考卷”。2 主要做了四件事:

  1. 学科重组:把原来细碎的 57 个学科合并成 14 个大类,包括生物、商科、化学、计算机、经济、工程、健康、历史、法律、数学、哲学、物理、心理学等。
  2. 删掉简单题:用 8 个小型模型筛题,凡是多数小模型都能答对的题(共 5,886 道)直接淘汰。
  3. 补充难题:从 STEM 网站、TheoremQA、SciBench 等来源加入更难的题目,最终得到 12,032 道题。
  4. 选项从 4 个增加到 10 个:新增的干扰项由 GPT-4-Turbo 生成并经过人工检查,很多干扰项“看起来都对”,必须靠细致推理才能排除。

效果很明显:模型在 MMLU-Pro 上的准确率比原版 MMLU 普遍下降 16% 到 33%;更换 24 种提示词风格时,分数波动从原版的 4%-5% 降到了 2%,说明这张卷子更稳定;而且思维链(CoT)在 MMLU-Pro 上有明显帮助,说明它考的已经不只是“知不知道”,还有“能不能推理着选出来”。

对比项 MMLU MMLU-Pro
题量 约 1.5 万道 12,032 道
学科 57 个细类 14 个大类
选项数 4 个 10 个
随机猜对概率 25% 10%
主要问题 偏简单、易污染、对提示词敏感 难度和稳定性更好,但仍是静态题库
侧重能力 通识知识广度 专业知识 + 选项辨析式推理

今天看新模型发布时,MMLU 和 MMLU-Pro 常常同时出现:前者看“基本盘”,后者看“拉开差距的硬知识”。不过 MMLU-Pro 也是静态公开题库,使用几年后同样会积累污染,所以前沿实验室还会配合内部保密考题使用。

3 数学与推理

3.1 GSM8K:小学数学,却曾难倒大模型

GSM8K 全称是 Grade School Math 8K,即“小学数学 8K”。

它由 OpenAI 于 2021 年发布,包含约 8,500 道小学数学应用题,题目虽然只需要小学知识,但通常要 2 到 8 步运算才能解出来。3 例如“小明有 5 个苹果,给了小红 2 个,又买了 3 袋每袋 4 个……”这类题,关键不在于单步计算,而在于能不能把文字转化成多步计划。

GSM8K 在历史上还有个重要贡献:2022 年的“思维链”论文用它证明了“让模型先写过程再给答案”能大幅提高正确率,CoT 从此成为主流答题方式。到今天,前沿模型在 GSM8K 上普遍接近满分,它已经饱和,更多被用来训练小型模型或做基础检验。

3.2 MATH:竞赛数学题库

MATH 不是缩写,就是“数学”的意思,全称 Measuring Mathematical Problem Solving With the MATH Dataset(“用 MATH 数据集衡量数学问题求解”)。

它由 Hendrycks 等人于 2021 年发布,包含 12,500 道竞赛数学题,覆盖代数、几何、数论、概率等 7 个主题,难度分 5 档,并附有完整的逐步解答。4 与 GSM8K 不同,它考的是正式的数学能力:符号运算、公式变形、几何证明思路等。刚发布时,最强的大模型也只能答对很小一部分;现在前沿模型已经能拿到 90 分以上,但仍是数学能力的重要参照。

3.3 AIME:被借来当考卷的数学竞赛

AIME 全称是 American Invitational Mathematics Examination,即“美国数学邀请赛”。

它原本是美国数学协会为中学生举办的竞赛,不是为 AI 设计的:每场 15 道题、3 小时,答案是 0 到 999 之间的整数,没有选项可以猜。由于题目难、答案客观、容易自动判分,AI 公司从 2024 年前后开始普遍把 AIME 当作旗舰模型的数学成绩单。

它也有明显缺点:历年真题都是公开的,模型可能在训练时背过。所以各实验室越来越多地用最新一年的 AIME或内部新出的竞赛题来减少污染。

3.4 GPQA Diamond:连搜索都救不了的题

GPQA 全称是 Graduate-Level Google-Proof Q&A,即“研究生级、防谷歌搜索的问答”。

它于 2023 年发布,由专家编写了 448 道生物、物理、化学领域的研究生级别选择题,其中 GPQA Diamond 是最难的 198 道子集,要求至少两位专家独立确认答案。5 论文里的一个数字很能说明难度:相关领域的博士专家正确率约 65%,而熟练的非专家即使允许上网搜索,正确率也只有 34%——所以叫“Google-proof”(搜也搜不出来)。GPT-4 当年只拿到 39%。

它考的是前沿科学推理:模型必须真正理解专业概念并推导,而不是查资料或凭常识蒙。如今 GPQA Diamond 已成为旗舰模型发布时的标配指标。

4 代码能力

4.1 HumanEval:写对一个函数

HumanEval 可以理解为 Human Evaluation(人工评测),因为题目是人工手写的,而不是从网上爬的。

它由 OpenAI 在 2021 年的 Codex 论文中发布,共 164 道 Python 编程题,每道题给一个函数签名和文档字符串,要求模型补全函数体,然后用隐藏的单元测试判分(平均每道题约 7.7 个测试)。6 它考的是最基础的“把一句需求翻译成一段正确代码”的能力。

HumanEval 还推广了 pass@k 评分:pass@1 表示第一次生成就通过测试;pass@10 表示允许生成 10 次,只要有 1 次通过就算会。今天前沿模型的 pass@1 已经超过 95%,这张卷子基本考穿了,但因为它便宜、易跑,仍是社区最常用的“入门体检”。

4.2 MBPP:基础 Python 百题

MBPP 全称是 Mostly Basic Python Problems,即“大多是基础 Python 问题”。

它由 Google 于 2021 年发布,包含 974 道入门级 Python 编程任务,目标对象是“刚入门的程序员”。7 它和 HumanEval 考的能力类似,但题目更生活化(处理字符串、列表、日期等)。两者如今都已饱和,主要用于快速回归测试,而不是区分顶尖模型。

4.3 LiveCodeBench:不断更新,防止背题

LiveCodeBench 即“活的代码基准”。

它于 2024 年发布,思路很简单:持续收集 LeetCode、AtCoder、Codeforces 等平台上的新竞赛题,并按照模型训练截止日期划分时间窗口,只统计模型“没见过的那批题”的成绩。8 这样既能保持题目新鲜、抵抗污染,又能不断补充难度。除了代码生成,它还考自我修复(代码错了自己改)、代码执行预测和测试输出预测等更完整的能力。

从 HumanEval 到 LiveCodeBench,代码评测的进化方向是:题目从手写小函数,变成不断滚动更新的算法竞赛题。

5 真实软件工程

如果说 HumanEval 是“默写一个函数”,那么下面这些基准就是“接手一个陌生项目,独立完成一个真实需求”。

flowchart LR
  A["2021<br/>HumanEval / MBPP<br/>写一个函数"] --> B["2023<br/>SWE-bench<br/>修真实 GitHub Issue"]
  B --> C["2024<br/>SWE-bench Verified<br/>精选 500 道干净题"]
  C --> D["2025<br/>SWE-bench Pro<br/>更长更难的企业级任务"]
  D --> E["2026<br/>DeepSWE<br/>原创长周期任务 + 行为判题"]

5.1 SWE-bench:让模型去修 GitHub Issue

SWE-bench 里的 SWE 是 Software Engineering(软件工程)的缩写,因此可译为“软件工程基准”。

它由普林斯顿大学等团队于 2023 年发布,论文标题是《语言模型能解决真实世界的 GitHub Issue 吗?》,入选 ICLR 2024 口头报告。9 数据集包含 2,294 个任务实例,来自 12 个热门 Python 开源项目(如 Django、Flask、SymPy、Matplotlib)。每个任务给模型三样东西:

  1. 某个历史版本的完整代码仓库;
  2. 一条真实的 GitHub Issue(用户报告的 bug 或功能请求);
  3. 运行环境和测试工具。

模型必须自己读代码、定位问题、修改一个或多个文件,生成补丁。判分非常工程化:

  • FAIL_TO_PASS:那些原本失败、修好后应当通过的测试,必须通过;
  • PASS_TO_PASS:那些原本就通过的测试,不能被改坏;
  • 两者都满足,这个任务才算 Resolved(已解决)。

发布之初,表现最好的 Claude 2 只解决了 1.96% 的任务;到 2025 年,顶尖编码智能体在 SWE-bench Verified 上的解决率已经超过七成。这个变化也说明,“能聊天”和“能在真实代码库里干活”之间的距离,曾经极其遥远。SWE-bench 考的是仓库级代码理解、长上下文处理、多文件协同修改和自主调试。

5.2 SWE-bench Verified:把脏题洗干净的 500 道

原版 SWE-bench 的 issue 是自动采集的,有些问题描述不清、缺少必要信息,甚至根本无法解决,导致分数有噪声。

2024 年 8 月,OpenAI 与 SWE-bench 作者合作发布了 SWE-bench Verified:请人类工程师逐题验证,最终筛出 500 道确认可解的干净题目。10 它没有改变题型,而是提高了“考卷质量”。从此,新模型的软件工程成绩单一般默认报告 Verified 版本,它也成为最流行的编码智能体公开基准之一。

5.3 SWE-bench Pro:把任务拉长到企业级

SWE-bench Pro 由 Scale AI 于 2025 年 9 月发布,包含 1,865 道长周期软件工程任务,来自 41 个活跃仓库,并分为公开、隐藏和商业合作三部分。11

它的特点是把任务从“修一个小 bug”升级到可能需要工程师花几小时甚至几天完成的需求:跨多个文件、改动大量代码、涉及真实业务系统。隐藏题库不容易被背到,商业题库更是完全不公开。它考的是专业级、长周期、端到端的工程交付能力。

5.4 DeepSWE:为什么还要一张新卷子

DeepSWE 中的 SWE 仍是 Software Engineering,Deep 强调的是“更深、更长周期”的工程任务。它由 DataCurve 于 2026 年 5 月发布,是本文写作时最受关注的编码智能体新基准之一。12

它指出此前 SWE 类基准有两个“先天缺陷”:

  1. 答案可能早就被模型背过:任务是从公开仓库里挖出的历史 issue 和补丁,这些内容很可能已经进入模型的预训练数据。高分可能来自“回忆”,而不是“解决”。
  2. 判题测试可能只认“标准答案的形状”:原测试是维护者为自己的补丁写的,可能拒绝另一种同样正确的写法(误杀),也可能放行不完整的实现(漏判)。

DeepSWE 的应对方式是从源头重新出题:

  • 组织作者在 91 个活跃开源仓库中从零编写 113 个原创任务,覆盖 TypeScript、Go、Python、JavaScript、Rust 五种语言;
  • 参考解法从不合并回上游仓库,因此不会进入公开训练数据;
  • 每个任务配一个手写的“行为判题器”:只检查题目要求的功能是否真的实现,不要求内部符号、函数名和标准答案一致;同时跑回归测试,保证没有改坏其他功能;
  • 判题器要连跑三次确认稳定,任务还要经过人工和 LLM 双重审核,最后在全新容器里独立评分,防止模型“骗过”自己的环境。

效果是题更难了,而且更真实:DeepSWE 的平均提示词只有约 2,100 个字符,远短于 SWE-bench Pro 的约 4,600 个字符;但参考答案平均要新增约 668 行代码(SWE-bench Pro 约 120 行、Verified 约 10 行),平均改动 7 个文件。用独立 LLM 法官复查评分结果时,DeepSWE 判题器的分歧率只有 1.4%,而 SWE-bench Pro 继承的测试分歧率高达 32.4%。

DeepSWE 发布时的成绩单(节选)

官方 2026 年 5 月排行榜:GPT-5.5 约 70%,GPT-5.4 约 56%,Claude Opus 4.7 约 54%,Claude Sonnet 4.6 约 32%,Gemini 3.5 Flash 约 28%,DeepSeek V4 Pro 约 8%。同一批模型在传统榜单上分数接近,在 DeepSWE 上却被明显拉开——这正是它“区分度”更高的体现。分数会随时间变化,最新榜单请以官方网站为准。

当然,DeepSWE 也不是完美考卷:113 道题样本量还不大,仓库以英文项目为主,而且随着时间推移,题目本身也可能被污染。它的意义在于展示了下一代评测的方向——用原创任务、行为判题和隔离环境,尽量贴近“一个工程师接需求、写代码、交差”的真实过程。

6 其他值得认识的评测速查

名称 全称 / 含义 主要考什么
ARC-AGI-2 Abstraction and Reasoning Corpus for Artificial General Intelligence 抽象图形规律推理,2025 年推出的加难版
HLE Humanity's Last Exam,人类最后一场考试 各学科专家出的前沿题,2025 年发布,顶尖模型最初得分也很低 13
SimpleQA OpenAI 的事实问答集 事实准确性,以及“不知道时敢不敢说不知道”
IFEval Instruction-Following Eval 遵守格式、字数、关键词等具体指令
MMMLU Multilingual MMLU MMLU 的多语言版本
GAIA General AI Assistants 综合使用工具、网页和文件完成日常助手任务
Terminal-Bench 终端操作基准 在命令行里安装、配置、排查问题
Aider Polyglot Aider 多语言编程基准 6 种语言的基础编程练习

7 怎么读懂一张“成绩单”

最后,把本文的要点浓缩成几条实战建议:

  1. 先看是不是同一张卷子。MMLU 和 DeepSWE 没有可比性,前者是知识选择题,后者是仓库实战;不同基准的随机得分基线也不同。
  2. 警惕“背过真题”。题目公开多年、网上到处都是答案的基准,高分含金量会打折;动态更新、隐藏题库、原创任务的基准更可信。
  3. 警惕“满分考卷”。如果所有模型都在 95 分以上,说明这张卷子已经没有区分度,看新卷子更有意义。
  4. 注意答题设置和误差。zero-shot 还是 CoT、pass@1 还是 pass@10,都会影响分数;认真一点的榜单会标注多次运行的波动区间(例如 ±3%)。
  5. 按使用场景选指标。日常问答看 MMLU-Pro、GPQA、SimpleQA;数学看 MATH 和最新 AIME;写代码片段看 LiveCodeBench;让智能体维护真实项目看 SWE-bench Verified 或 DeepSWE。
  6. 记住古德哈特定律:当一个指标成为目标时,它就不再是好指标。厂商可能针对公开考卷做优化,所以最可信的是保密、新鲜、行为导向的评测。

8 名词对照表

缩写 英文全称 中文直译 一句话解释
LLM Large Language Model 大语言模型 本文所有考试的“考生”
Benchmark Benchmark 基准测试 固定题目加固定判分规则的标准考试
MMLU Massive Multitask Language Understanding 大规模多任务语言理解 57 个学科的四选一通识考试
MMLU-Pro A More Robust and Challenging Multi-Task Language Understanding Benchmark 更稳健、更具挑战性的多任务语言理解基准 14 个领域、每题十选的加强版 MMLU
GSM8K Grade School Math 8K 小学数学 8K 约 8,500 道多步应用题
MATH Measuring Mathematical Problem Solving With the MATH Dataset 用 MATH 数据集衡量数学问题求解 12,500 道竞赛数学题
AIME American Invitational Mathematics Examination 美国数学邀请赛 15 道整数答案的竞赛题,常被用作数学能力标尺
GPQA Graduate-Level Google-Proof Q&A 研究生级防搜索问答 连上网搜都不容易答对的科学推理题
HumanEval Human Evaluation 人工评测集 164 道手写 Python 函数题
MBPP Mostly Basic Python Problems 大多是基础 Python 问题 974 道入门编程题
LiveCodeBench Live Code Benchmark 活的代码基准 持续收集新竞赛题,防背题
SWE-bench Software Engineering Benchmark 软件工程基准 给真实开源仓库修 GitHub Issue
SWE-bench Verified 同上(验证子集) 验证版软件工程基准 经人工确认可解的 500 道
DeepSWE Deep Software Engineering 深度软件工程 113 道原创长周期工程任务,行为判题、答案保密
pass@k pass at k k 次尝试内通过 允许尝试 k 次,有一次通过即算会
Contamination Data Contamination 数据污染 模型在训练时见过考题答案
Saturation Benchmark Saturation 基准饱和 大家都考高分,卷子失去区分度

9 结语

评测基准的发展,本质上是一场“出题人”和“考生”的军备竞赛:模型越来越强,考卷就必须越来越难、越来越真、越来越防作弊。从 MMLU 的四选一,到 SWE-bench 的修仓库,再到 DeepSWE 的原创长周期任务,评价方式已经从“考知识”走向“考工作”。

所以下次看到新模型发布,不必被一串百分比吓到。只要问三个问题就够了:这张卷子考什么能力?题目有没有被训练数据见过?同场考试里,它比别人高多少? 看懂这三点,你就能像看球赛一样看懂 AI 成绩单。