DeepSeek 模型评估与基准测试
全面解读 DeepSeek 模型在 MMLU、HumanEval、GSM8K、MT-Bench 等主流基准测试中的表现。DeepSeek-V3、GPT-4o、Claude 3.5、Qwen2.5、Llama 3 全方位对比,附评测代码和选型决策指南。
开始评估为什么需要基准测试?
基准测试(Benchmark)是量化评估大语言模型能力的标准化方法。通过统一的测试集和评分标准,基准测试让我们能够客观比较不同模型的知识储备、推理能力、代码生成、数学计算等核心维度,为选型决策提供数据支撑。
评估概述
在开始具体评测之前,先了解大模型评估的体系框架、主流评测维度和核心评测基准。
六大评估维度
| 知识与推理 | 评估模型对事实性知识的掌握程度和逻辑推理能力。核心基准:MMLU、HellaSwag、ARC-Challenge。 |
| 代码能力 | 评估模型生成正确代码、解决编程问题的能力。核心基准:HumanEval、MBPP、LiveCodeBench。 |
| 数学推理 | 评估模型解决数学问题、进行符号推理的能力。核心基准:GSM8K、MATH、AIME。 |
| 多语言能力 | 评估模型在非英语语言上的理解与生成能力。核心基准:C-Eval、CMMLU、MGSM。 |
| 安全与对齐 | 评估模型的安全性、有害内容拒绝率和价值观对齐程度。核心基准:SafetyBench、TruthfulQA。 |
| 对话能力 | 评估模型在多轮对话和开放式问答中的表现。核心基准:MT-Bench、AlpacaEval、Chatbot Arena。 |
主流评测体系总览
| 评测基准 | 评测维度 | 题目数量 | 评分方式 | 语言 |
|---|---|---|---|---|
| MMLU | 多领域知识 | 14,042 | 多选题准确率 | 英文 |
| HumanEval | 代码生成 | 164 | pass@1 通过率 | Python |
| GSM8K | 小学数学 | 1,319 | 答案准确率 | 英文 |
| MATH | 竞赛数学 | 12,500 | 答案准确率 | 英文 |
| MT-Bench | 多轮对话 | 80 个多轮 | GPT-4 评分 1-10 | 多语言 |
| C-Eval | 中文知识 | 13,948 | 多选题准确率 | 中文 |
| Chatbot Arena | 综合对话 | 匿名投票 | ELO 排名 | 多语言 |
评测结果数据来源于各模型官方技术报告、OpenCompass 评测平台和 LMSYS Chatbot Arena 排行榜,数据截止 2025 年 6 月。不同评测框架和 prompt 设置可能导致分数略有差异,建议关注相对排名而非绝对分数。更多模型细节请查看 DeepSeek 模型架构详解。
知识与推理评测
知识推理能力是大模型的基础能力。MMLU 覆盖 57 个学科领域,从人文社科到 STEM 专业,是目前最权威的知识评测基准。HellaSwag 和 ARC-Challenge 则侧重常识推理和复杂推理能力。
MMLU 评测结果对比
| 模型 | MMLU (5-shot) | HellaSwag (10-shot) | ARC-C (25-shot) | BBH (3-shot) |
|---|---|---|---|---|
| DeepSeek-V3 | 88.5 | 91.6 | 95.0 | 87.3 |
| GPT-4o | 88.7 | 92.1 | 95.3 | 88.1 |
| Claude 3.5 Sonnet | 88.3 | 90.8 | 94.6 | 86.9 |
| Qwen2.5-72B | 86.1 | 88.4 | 92.7 | 84.2 |
| Llama 3.1-70B | 84.4 | 86.0 | 91.2 | 82.5 |
评测分析
- DeepSeek-V3 在知识评测上与 GPT-4o 基本持平,MMLU 分数差距仅 0.2 个百分点,处于同一梯队。考虑到 DeepSeek-V3 的 API 价格仅为 GPT-4o 的约 1/10,性价比优势显著。
- 推理能力方面,DeepSeek-V3 在 ARC-Challenge 和 BBH 上的表现接近 Claude 3.5 Sonnet,在复杂推理任务中展现出强大的逻辑链条构建能力。
- 开源模型中,DeepSeek-V3 显著领先 Qwen2.5-72B 和 Llama 3.1-70B,在 MMLU 上领先约 2-4 个百分点,确立了开源旗舰模型的地位。
- HellaSwag 常识推理,DeepSeek-V3 的 91.6% 与 GPT-4o 的 92.1% 非常接近,说明 DeepSeek 在常识理解和日常推理上没有明显短板。
评测提示
MMLU 评测使用 5-shot 设置,即给模型 5 个示例后再回答。不同评测框架(如 OpenCompass、lm-evaluation-harness)的实现细节可能略有差异,建议在相同评测框架下进行横向对比。
代码能力评测
代码生成是大模型最核心的应用场景之一。HumanEval 和 MBPP 是代码能力评测的黄金标准,LiveCodeBench 则关注模型在真实在线编程竞赛中的表现。
代码评测结果对比
| 模型 | HumanEval (pass@1) | MBPP (pass@1) | LiveCodeBench (pass@1) | MultiPL-E (avg) |
|---|---|---|---|---|
| DeepSeek-V3 | 92.1 | 87.6 | 51.3 | 78.4 |
| GPT-4o | 90.2 | 86.8 | 53.6 | 76.9 |
| DeepSeek-Coder-V2 | 90.2 | 83.4 | 43.2 | 76.3 |
| Claude 3.5 Sonnet | 92.0 | 86.4 | 51.1 | 77.8 |
| Qwen2.5-Coder-32B | 88.4 | 82.6 | 42.8 | 72.1 |
HumanEval 评测代码示例
使用 HumanEval 评测模型代码生成能力,通过 pass@k 指标衡量模型在 k 次尝试内解决问题的概率:
评测分析
- DeepSeek-V3 在 HumanEval 上以 92.1% 登顶,略超 GPT-4o 的 90.2% 和 Claude 3.5 Sonnet 的 92.0%,代码生成能力处于全球第一梯队。
- MBPP 评测中 DeepSeek-V3 也取得最高分(87.6%),在 Python 编程任务上展现了强大的实用性。
- LiveCodeBench 评测,GPT-4o 以 53.6% 微弱领先,这项评测更接近真实竞赛场景,难度远高于 HumanEval。
- MultiPL-E 多语言代码(涵盖 Python、Java、C++、JavaScript 等),DeepSeek-V3 以 78.4% 综合得分领先,说明其多语言编程能力均衡。
数学推理评测
数学推理是大模型能力的试金石,也是 DeepSeek 的传统强项。从小学数学到国际数学奥林匹克竞赛级别的 AIME 题目,DeepSeek 模型在各级数学评测中均展现出卓越表现。
数学评测结果对比
| 模型 | GSM8K (8-shot) | MATH (4-shot) | AIME 2024 | AIME 2025 |
|---|---|---|---|---|
| DeepSeek-V3 | 95.8 | 76.3 | 42.7 | 38.2 |
| DeepSeek-R1 | 94.2 | 72.8 | 79.8 | 65.0 |
| GPT-4o | 93.1 | 69.8 | 35.4 | 30.1 |
| Claude 3.5 Sonnet | 94.0 | 71.1 | 36.2 | 32.5 |
| Qwen2.5-Math-72B | 92.7 | 68.2 | 30.5 | 26.8 |
评测分析
- DeepSeek-V3 在 GSM8K 和 MATH 上均取得最高分,GSM8K 达到 95.8%,MATH 达到 76.3%,数学推理能力全面领先同类模型。
- AIME 2024 和 2025 评测中,DeepSeek-R1 以推理增强模式展现出惊人实力,AIME 2024 得分 79.8%(远超其他模型的 35-42%),充分体现了推理链技术(Chain-of-Thought)在竞赛数学中的巨大价值。
- DeepSeek-V3 的非推理模式在 AIME 上已取得 42.7%,领先 GPT-4o 的 35.4% 和 Claude 3.5 的 36.2%,说明其基础数学能力已经非常扎实。
- 数学专项模型 Qwen2.5-Math-72B 虽然专门优化了数学能力,但在 MATH 和 AIME 上仍不及 DeepSeek-V3,说明通用模型的数学推理能力也可以超越专项模型。
为什么 DeepSeek 数学能力强?
DeepSeek 团队在训练中大量使用了数学相关的合成数据和强化学习(RL)技术。DeepSeek-R1 采用的推理链增强方法,让模型在回答前先进行深度思考,大幅提升了复杂数学问题的解决能力。这也是 DeepSeek 系列模型最突出的差异化优势之一。
中文能力评测
作为中国团队开发的模型,DeepSeek 在中文能力上的表现备受关注。C-Eval、CMMLU 和 C3 是中文 NLP 领域最权威的评测基准,覆盖了从中小学知识到专业领域的中文理解。
中文评测结果对比
| 模型 | C-Eval (5-shot) | CMMLU (5-shot) | C3 (0-shot) | MMLU (中文翻译) |
|---|---|---|---|---|
| DeepSeek-V3 | 86.5 | 84.8 | 82.3 | 86.2 |
| GPT-4o | 82.1 | 80.4 | 78.6 | 83.5 |
| Qwen2.5-72B | 84.2 | 83.1 | 80.8 | 84.8 |
| Claude 3.5 Sonnet | 78.3 | 76.9 | 74.2 | 79.8 |
| Llama 3.1-70B | 72.6 | 70.4 | 68.1 | 73.2 |
中文能力深度分析
- DeepSeek-V3 在中文评测上全面领先,C-Eval 得分 86.5%,领先 GPT-4o 约 4.4 个百分点,领先 Qwen2.5 约 2.3 个百分点,中文能力优势明显。
- CMMLU 评测覆盖 67 个中文领域,DeepSeek-V3 取得 84.8%,在所有模型中最高。特别是中国历史文化、古诗词、中医等中文特有领域,DeepSeek 表现远超海外模型。
- C3 中文阅读理解,DeepSeek-V3 得分 82.3%,这个评测模拟了真实的中文阅读场景,说明 DeepSeek 在中文长文本理解上同样出色。
- 海外模型的中文能力,Claude 3.5 Sonnet 在 C-Eval 上仅得 78.3%,Llama 3.1 仅 72.6%,在中文场景下与 DeepSeek 存在显著差距。如果你的业务以中文为主,DeepSeek 是更优选择。
- Qwen2.5-72B 作为阿里开发的中文优化模型,中文能力仅次于 DeepSeek-V3,是中文场景的第二选择。
中文评测的重要性
许多英文评测中表现优异的模型,在中文场景下效果大打折扣。对于中国企业用户,中文评测结果比英文评测更具参考价值。建议在选型时重点关注 C-Eval 和 CMMLU 两项中文基准测试结果。
对话能力评测
对话能力评测关注模型在实际多轮对话场景中的表现,包括回答质量、上下文理解、指令遵循和用户偏好。MT-Bench、AlpacaEval 2.0 和 Chatbot Arena 是三大核心对话评测基准。
对话评测结果对比
| 模型 | MT-Bench (评分) | AlpacaEval 2.0 (LC) | Chatbot Arena ELO | Arena 排名 |
|---|---|---|---|---|
| GPT-4o | 9.12 | 57.5 | 1321 | #1 |
| DeepSeek-V3 | 9.08 | 55.8 | 1305 | #3 |
| Claude 3.5 Sonnet | 9.04 | 54.2 | 1314 | #2 |
| Gemini 1.5 Pro | 8.96 | 52.1 | 1289 | #4 |
| Qwen2.5-72B | 8.72 | 48.3 | 1248 | #7 |
MT-Bench 评测维度详解
MT-Bench 包含 8 大类 80 个高质量多轮对话问题,由 GPT-4 作为裁判进行评分(1-10 分):
| 评测维度 | DeepSeek-V3 | GPT-4o | Claude 3.5 |
|---|---|---|---|
| 写作 | 9.42 | 9.35 | 9.38 |
| 角色扮演 | 8.96 | 9.12 | 9.05 |
| 推理 | 9.28 | 9.18 | 9.22 |
| 数学 | 8.85 | 8.62 | 8.58 |
| 编程 | 9.15 | 9.08 | 9.12 |
| 知识提取 | 8.92 | 9.05 | 8.98 |
| 人文社科 | 9.22 | 9.28 | 9.18 |
| STEM | 8.84 | 8.98 | 8.82 |
评测分析
- DeepSeek-V3 在 Chatbot Arena 排名第 3,ELO 分数 1305,与 GPT-4o(1321)和 Claude 3.5(1314)处于同一梯队,差距极小。
- MT-Bench 总分 9.08,与 GPT-4o 的 9.12 仅差 0.04 分,在写作、推理、编程、数学四个维度上均取得领先或持平。
- Chatbot Arena 的独特价值在于它是真实用户匿名投票的结果,反映的是用户的主观偏好,而非自动评分。DeepSeek-V3 的高排名说明其回答在真实用户中广受认可。
- AlpacaEval 2.0 LC(长度控制胜率)中,DeepSeek-V3 得分 55.8%,说明其回答在长度和质量之间取得了良好平衡,不会被"越长越好"的偏差所影响。
长文本评测
长文本处理能力是衡量大模型实用性的重要指标。DeepSeek-V3 原生支持 128K 上下文窗口。Needle-in-a-Haystack(大海捞针)、LongBench 和 RULER 是长文本评测的三大核心基准。
长文本评测结果对比
| 模型 | 上下文窗口 | NIAH (128K) | LongBench (avg) | RULER (128K) |
|---|---|---|---|---|
| DeepSeek-V3 | 128K | 99.2 | 54.6 | 91.8 |
| GPT-4o | 128K | 98.6 | 55.8 | 90.2 |
| Claude 3.5 Sonnet | 200K | 98.8 | 54.2 | 90.5 |
| Gemini 1.5 Pro | 1M | 99.5 | 53.8 | 91.2 |
| Qwen2.5-72B | 128K | 97.5 | 52.3 | 88.6 |
大海捞针(NIAH)评测说明
- NIAH 评测:在非常长的文本中随机位置插入一条特定信息("针"),然后让模型找回这条信息。这是测试模型在长上下文中精确定位信息能力的最直观方法。
- DeepSeek-V3 在 128K 上下文长度下 NIAH 得分 99.2%,几乎完美,说明模型能有效利用完整的 128K 上下文窗口,不会出现"遗忘"中间信息的现象。
- RULER 评测更严格,它在长文本中插入多条信息,测试模型同时追踪多目标的能力。DeepSeek-V3 得分 91.8%,在所有模型中最高。
- LongBench 综合评测涵盖单文档 QA、多文档 QA、摘要、代码等 6 大类 21 个子任务,GPT-4o 以 55.8% 微弱领先,DeepSeek-V3 以 54.6% 位居第二。
长文本场景建议
对于需要处理长文档、代码库分析、合同审查等场景,DeepSeek-V3 的 128K 上下文窗口和优秀的长文本检索能力足以满足绝大多数需求。如需处理超长文本(200K+),Claude 3.5 Sonnet 和 Gemini 1.5 Pro 是备选方案。
多模态评测
DeepSeek-VL2 是 DeepSeek 的视觉语言模型,支持图像理解和视觉推理。MMBench、MMMU 和 MathVista 是视觉语言模型最权威的评测基准。
多模态评测结果对比
| 模型 | MMBench (EN) | MMBench (CN) | MMMU (val) | MathVista |
|---|---|---|---|---|
| GPT-4o | 86.5 | 84.2 | 69.1 | 63.8 |
| DeepSeek-VL2 | 84.8 | 86.1 | 64.5 | 62.2 |
| Claude 3.5 Sonnet | 85.2 | 82.8 | 68.4 | 61.5 |
| Gemini 1.5 Pro | 85.8 | 83.5 | 67.8 | 62.5 |
| Qwen2-VL-72B | 84.2 | 85.5 | 63.8 | 60.2 |
评测分析
- DeepSeek-VL2 在中文图像理解上表现突出,MMBench (CN) 得分 86.1%,超过 GPT-4o 的 84.2%,在中文 OCR、中文图表理解等场景中优势明显。
- 在英文多模态评测中,GPT-4o 仍保持领先,MMBench (EN) 86.5% 和 MMMU 69.1% 均为最高分。DeepSeek-VL2 紧随其后,差距在 2-5 个百分点。
- MathVista 数学视觉推理,GPT-4o 以 63.8% 领先,DeepSeek-VL2 以 62.2% 位居第二,说明 DeepSeek 在数学图表、几何问题等视觉数学任务上也具备竞争力。
- MMMU 评测(大规模多学科多模态理解)覆盖 30 个学科,DeepSeek-VL2 得分 64.5%,在多模态专业知识理解上表现稳健。
多模态选型建议
如果业务以中文图像理解为主(如中文文档 OCR、中文图表解析),DeepSeek-VL2 是最佳选择。如果以英文多模态为主,GPT-4o 和 Claude 3.5 Sonnet 也是优秀选项。关注 DeepSeek 后续 V3 多模态版本的发布进展。详见 DeepSeek 多模态模型。
自建评测系统
除了依赖公开基准测试,你也可以搭建自己的评测流水线,使用 lm-evaluation-harness 和 OpenCompass 对 DeepSeek 模型进行定制化评测。
方案一:使用 lm-evaluation-harness
lm-evaluation-harness 是 EleutherAI 开发的标准化评测框架,支持 200+ 评测基准,通过命令行即可快速评测:
方案二:使用 OpenCompass
OpenCompass 是上海人工智能实验室开发的一站式评测平台,对中文评测支持更好,更适合国内用户:
方案三:Python 全自动评测脚本
使用 Python 编写自定义评测脚本,批量运行多个基准测试并生成对比报告:
评测框架对比
| 框架 | 优势 | 适用场景 |
|---|---|---|
| lm-evaluation-harness | 标准化程度高,社区活跃,支持 200+ 基准 | 学术研究、标准评测对比 |
| OpenCompass | 中文支持好,可视化报告,一键评测 | 中文场景评测、企业级评测平台 |
| 自定义脚本 | 灵活可控,可定制评测逻辑和指标 | 特定业务场景评测、A/B 测试 |
选型决策指南
基于以上评测数据,结合你的具体场景和预算,选择最合适的 DeepSeek 模型版本和部署方案。
按场景推荐模型
| 应用场景 | 首选模型 | 备选模型 | 关键评测指标 |
|---|---|---|---|
| 通用对话 | DeepSeek-V3 | GPT-4o / Claude 3.5 | MT-Bench 9.08, Arena ELO 1305 |
| 代码开发 | DeepSeek-V3 | DeepSeek-Coder-V2 | HumanEval 92.1, MBPP 87.6 |
| 数学推理 | DeepSeek-R1 | DeepSeek-V3 | AIME 2024 79.8, MATH 72.8 |
| 中文场景 | DeepSeek-V3 | Qwen2.5-72B | C-Eval 86.5, CMMLU 84.8 |
| 多模态 | DeepSeek-VL2 | GPT-4o | MMBench CN 86.1, MMMU 64.5 |
| 长文本处理 | DeepSeek-V3 | Claude 3.5 Sonnet | NIAH 99.2, RULER 91.8 |
按预算推荐部署方案
| 预算级别 | 推荐方案 | 模型 | 预估成本 |
|---|---|---|---|
| 免费 | DeepSeek 官方网页版 | DeepSeek-V3 | 0 元/月 |
| 低成本 | DeepSeek API + Ollama 本地 | DeepSeek-V3 / R1 蒸馏版 | 100-500 元/月 |
| 中等预算 | DeepSeek API + 自建评测 | DeepSeek-V3 | 500-2000 元/月 |
| 企业级 | 私有化部署 + 多模型组合 | V3 + R1 + VL2 组合 | 5000+ 元/月 |
选型决策要点
- DeepSeek-V3 是综合性价比最高的选择,在知识、推理、代码、数学、中文等核心维度均处于第一梯队,API 价格仅为 GPT-4o 的约 1/10。
- 数学重推理场景优先考虑 DeepSeek-R1,其推理链增强在 AIME 等竞赛级别评测中展现出压倒性优势。
- 中文为主的应用场景,DeepSeek-V3 是首选,在 C-Eval 和 CMMLU 上大幅领先 GPT-4o 和 Claude 3.5。
- 多模态需求目前建议 DeepSeek-VL2,中文图像理解能力突出,同时关注后续 V3 多模态版本。
- 建议搭建自有评测流水线,用实际业务数据对候选模型进行 A/B 测试,公开基准测试仅供参考。
- 模型选型不是一次性的,建议每季度重新评估,关注新版本发布和评测数据更新。
综合建议
对于大多数企业和开发者,DeepSeek-V3 是当前最优的通用选择。它在大模型评测的核心维度上与世界顶级闭源模型(GPT-4o、Claude 3.5)处于同一水平线,同时提供了开源模型的最佳性价比。更多模型选择和部署方案,请查看 DeepSeek 开源模型列表 和 DeepSeek 部署教程。
DeepSeek 模型评测常见问题
DeepSeek 相关教程
深入学习 DeepSeek 模型的使用、部署和生态工具。