Skills MCP Model 博客 提交 Skills
登录 注册

DeepSeek 模型评估与基准测试

全面解读 DeepSeek 模型在 MMLU、HumanEval、GSM8K、MT-Bench 等主流基准测试中的表现。DeepSeek-V3、GPT-4o、Claude 3.5、Qwen2.5、Llama 3 全方位对比,附评测代码和选型决策指南。

开始评估

为什么需要基准测试?

基准测试(Benchmark)是量化评估大语言模型能力的标准化方法。通过统一的测试集和评分标准,基准测试让我们能够客观比较不同模型的知识储备、推理能力、代码生成、数学计算等核心维度,为选型决策提供数据支撑。

评估概述

在开始具体评测之前,先了解大模型评估的体系框架、主流评测维度和核心评测基准。

六大评估维度

知识与推理 评估模型对事实性知识的掌握程度和逻辑推理能力。核心基准:MMLU、HellaSwag、ARC-Challenge。
代码能力 评估模型生成正确代码、解决编程问题的能力。核心基准:HumanEval、MBPP、LiveCodeBench。
数学推理 评估模型解决数学问题、进行符号推理的能力。核心基准:GSM8K、MATH、AIME。
多语言能力 评估模型在非英语语言上的理解与生成能力。核心基准:C-Eval、CMMLU、MGSM。
安全与对齐 评估模型的安全性、有害内容拒绝率和价值观对齐程度。核心基准:SafetyBench、TruthfulQA。
对话能力 评估模型在多轮对话和开放式问答中的表现。核心基准:MT-Bench、AlpacaEval、Chatbot Arena。

主流评测体系总览

评测基准 评测维度 题目数量 评分方式 语言
MMLU 多领域知识 14,042 多选题准确率 英文
HumanEval 代码生成 164 pass@1 通过率 Python
GSM8K 小学数学 1,319 答案准确率 英文
MATH 竞赛数学 12,500 答案准确率 英文
MT-Bench 多轮对话 80 个多轮 GPT-4 评分 1-10 多语言
C-Eval 中文知识 13,948 多选题准确率 中文
Chatbot Arena 综合对话 匿名投票 ELO 排名 多语言

评测结果数据来源于各模型官方技术报告、OpenCompass 评测平台和 LMSYS Chatbot Arena 排行榜,数据截止 2025 年 6 月。不同评测框架和 prompt 设置可能导致分数略有差异,建议关注相对排名而非绝对分数。更多模型细节请查看 DeepSeek 模型架构详解

知识与推理评测

知识推理能力是大模型的基础能力。MMLU 覆盖 57 个学科领域,从人文社科到 STEM 专业,是目前最权威的知识评测基准。HellaSwag 和 ARC-Challenge 则侧重常识推理和复杂推理能力。

MMLU 评测结果对比

模型 MMLU (5-shot) HellaSwag (10-shot) ARC-C (25-shot) BBH (3-shot)
DeepSeek-V3 88.5 91.6 95.0 87.3
GPT-4o 88.7 92.1 95.3 88.1
Claude 3.5 Sonnet 88.3 90.8 94.6 86.9
Qwen2.5-72B 86.1 88.4 92.7 84.2
Llama 3.1-70B 84.4 86.0 91.2 82.5

评测分析

  • DeepSeek-V3 在知识评测上与 GPT-4o 基本持平,MMLU 分数差距仅 0.2 个百分点,处于同一梯队。考虑到 DeepSeek-V3 的 API 价格仅为 GPT-4o 的约 1/10,性价比优势显著。
  • 推理能力方面,DeepSeek-V3 在 ARC-Challenge 和 BBH 上的表现接近 Claude 3.5 Sonnet,在复杂推理任务中展现出强大的逻辑链条构建能力。
  • 开源模型中,DeepSeek-V3 显著领先 Qwen2.5-72B 和 Llama 3.1-70B,在 MMLU 上领先约 2-4 个百分点,确立了开源旗舰模型的地位。
  • HellaSwag 常识推理,DeepSeek-V3 的 91.6% 与 GPT-4o 的 92.1% 非常接近,说明 DeepSeek 在常识理解和日常推理上没有明显短板。

评测提示

MMLU 评测使用 5-shot 设置,即给模型 5 个示例后再回答。不同评测框架(如 OpenCompass、lm-evaluation-harness)的实现细节可能略有差异,建议在相同评测框架下进行横向对比。

代码能力评测

代码生成是大模型最核心的应用场景之一。HumanEval 和 MBPP 是代码能力评测的黄金标准,LiveCodeBench 则关注模型在真实在线编程竞赛中的表现。

代码评测结果对比

模型 HumanEval (pass@1) MBPP (pass@1) LiveCodeBench (pass@1) MultiPL-E (avg)
DeepSeek-V3 92.1 87.6 51.3 78.4
GPT-4o 90.2 86.8 53.6 76.9
DeepSeek-Coder-V2 90.2 83.4 43.2 76.3
Claude 3.5 Sonnet 92.0 86.4 51.1 77.8
Qwen2.5-Coder-32B 88.4 82.6 42.8 72.1

HumanEval 评测代码示例

使用 HumanEval 评测模型代码生成能力,通过 pass@k 指标衡量模型在 k 次尝试内解决问题的概率:

from human_eval.data import write_jsonl, read_problems from human_eval.evaluation import evaluate_functional_correctness from openai import OpenAI # 初始化 DeepSeek 客户端 client = OpenAI( api_key="sk-your-api-key", base_url="https://api.deepseek.com", ) # 生成 HumanEval 答案 problems = read_problems() num_samples_per_task = 1 samples = [] for task_id in problems: prompt = problems[task_id]["prompt"] response = client.chat.completions.create( model="deepseek-chat", messages=[{"role": "user", "content": prompt}], temperature=0.0, max_tokens=1024, ) completion = response.choices[0].message.content samples.append(dict(task_id=task_id, completion=completion)) write_jsonl("deepseek_samples.jsonl", samples) # 评估 pass@1 results = evaluate_functional_correctness("deepseek_samples.jsonl") print(f"DeepSeek-V3 HumanEval pass@1: {results['pass@1']*100:.1f}%")

评测分析

  • DeepSeek-V3 在 HumanEval 上以 92.1% 登顶,略超 GPT-4o 的 90.2% 和 Claude 3.5 Sonnet 的 92.0%,代码生成能力处于全球第一梯队。
  • MBPP 评测中 DeepSeek-V3 也取得最高分(87.6%),在 Python 编程任务上展现了强大的实用性。
  • LiveCodeBench 评测,GPT-4o 以 53.6% 微弱领先,这项评测更接近真实竞赛场景,难度远高于 HumanEval。
  • MultiPL-E 多语言代码(涵盖 Python、Java、C++、JavaScript 等),DeepSeek-V3 以 78.4% 综合得分领先,说明其多语言编程能力均衡。

数学推理评测

数学推理是大模型能力的试金石,也是 DeepSeek 的传统强项。从小学数学到国际数学奥林匹克竞赛级别的 AIME 题目,DeepSeek 模型在各级数学评测中均展现出卓越表现。

数学评测结果对比

模型 GSM8K (8-shot) MATH (4-shot) AIME 2024 AIME 2025
DeepSeek-V3 95.8 76.3 42.7 38.2
DeepSeek-R1 94.2 72.8 79.8 65.0
GPT-4o 93.1 69.8 35.4 30.1
Claude 3.5 Sonnet 94.0 71.1 36.2 32.5
Qwen2.5-Math-72B 92.7 68.2 30.5 26.8

评测分析

  • DeepSeek-V3 在 GSM8K 和 MATH 上均取得最高分,GSM8K 达到 95.8%,MATH 达到 76.3%,数学推理能力全面领先同类模型。
  • AIME 2024 和 2025 评测中,DeepSeek-R1 以推理增强模式展现出惊人实力,AIME 2024 得分 79.8%(远超其他模型的 35-42%),充分体现了推理链技术(Chain-of-Thought)在竞赛数学中的巨大价值。
  • DeepSeek-V3 的非推理模式在 AIME 上已取得 42.7%,领先 GPT-4o 的 35.4% 和 Claude 3.5 的 36.2%,说明其基础数学能力已经非常扎实。
  • 数学专项模型 Qwen2.5-Math-72B 虽然专门优化了数学能力,但在 MATH 和 AIME 上仍不及 DeepSeek-V3,说明通用模型的数学推理能力也可以超越专项模型。

为什么 DeepSeek 数学能力强?

DeepSeek 团队在训练中大量使用了数学相关的合成数据和强化学习(RL)技术。DeepSeek-R1 采用的推理链增强方法,让模型在回答前先进行深度思考,大幅提升了复杂数学问题的解决能力。这也是 DeepSeek 系列模型最突出的差异化优势之一。

中文能力评测

作为中国团队开发的模型,DeepSeek 在中文能力上的表现备受关注。C-Eval、CMMLU 和 C3 是中文 NLP 领域最权威的评测基准,覆盖了从中小学知识到专业领域的中文理解。

中文评测结果对比

模型 C-Eval (5-shot) CMMLU (5-shot) C3 (0-shot) MMLU (中文翻译)
DeepSeek-V3 86.5 84.8 82.3 86.2
GPT-4o 82.1 80.4 78.6 83.5
Qwen2.5-72B 84.2 83.1 80.8 84.8
Claude 3.5 Sonnet 78.3 76.9 74.2 79.8
Llama 3.1-70B 72.6 70.4 68.1 73.2

中文能力深度分析

  • DeepSeek-V3 在中文评测上全面领先,C-Eval 得分 86.5%,领先 GPT-4o 约 4.4 个百分点,领先 Qwen2.5 约 2.3 个百分点,中文能力优势明显。
  • CMMLU 评测覆盖 67 个中文领域,DeepSeek-V3 取得 84.8%,在所有模型中最高。特别是中国历史文化、古诗词、中医等中文特有领域,DeepSeek 表现远超海外模型。
  • C3 中文阅读理解,DeepSeek-V3 得分 82.3%,这个评测模拟了真实的中文阅读场景,说明 DeepSeek 在中文长文本理解上同样出色。
  • 海外模型的中文能力,Claude 3.5 Sonnet 在 C-Eval 上仅得 78.3%,Llama 3.1 仅 72.6%,在中文场景下与 DeepSeek 存在显著差距。如果你的业务以中文为主,DeepSeek 是更优选择。
  • Qwen2.5-72B 作为阿里开发的中文优化模型,中文能力仅次于 DeepSeek-V3,是中文场景的第二选择。

中文评测的重要性

许多英文评测中表现优异的模型,在中文场景下效果大打折扣。对于中国企业用户,中文评测结果比英文评测更具参考价值。建议在选型时重点关注 C-Eval 和 CMMLU 两项中文基准测试结果。

对话能力评测

对话能力评测关注模型在实际多轮对话场景中的表现,包括回答质量、上下文理解、指令遵循和用户偏好。MT-Bench、AlpacaEval 2.0 和 Chatbot Arena 是三大核心对话评测基准。

对话评测结果对比

模型 MT-Bench (评分) AlpacaEval 2.0 (LC) Chatbot Arena ELO Arena 排名
GPT-4o 9.12 57.5 1321 #1
DeepSeek-V3 9.08 55.8 1305 #3
Claude 3.5 Sonnet 9.04 54.2 1314 #2
Gemini 1.5 Pro 8.96 52.1 1289 #4
Qwen2.5-72B 8.72 48.3 1248 #7

MT-Bench 评测维度详解

MT-Bench 包含 8 大类 80 个高质量多轮对话问题,由 GPT-4 作为裁判进行评分(1-10 分):

评测维度 DeepSeek-V3 GPT-4o Claude 3.5
写作 9.42 9.35 9.38
角色扮演 8.96 9.12 9.05
推理 9.28 9.18 9.22
数学 8.85 8.62 8.58
编程 9.15 9.08 9.12
知识提取 8.92 9.05 8.98
人文社科 9.22 9.28 9.18
STEM 8.84 8.98 8.82

评测分析

  • DeepSeek-V3 在 Chatbot Arena 排名第 3,ELO 分数 1305,与 GPT-4o(1321)和 Claude 3.5(1314)处于同一梯队,差距极小。
  • MT-Bench 总分 9.08,与 GPT-4o 的 9.12 仅差 0.04 分,在写作、推理、编程、数学四个维度上均取得领先或持平。
  • Chatbot Arena 的独特价值在于它是真实用户匿名投票的结果,反映的是用户的主观偏好,而非自动评分。DeepSeek-V3 的高排名说明其回答在真实用户中广受认可。
  • AlpacaEval 2.0 LC(长度控制胜率)中,DeepSeek-V3 得分 55.8%,说明其回答在长度和质量之间取得了良好平衡,不会被"越长越好"的偏差所影响。

长文本评测

长文本处理能力是衡量大模型实用性的重要指标。DeepSeek-V3 原生支持 128K 上下文窗口。Needle-in-a-Haystack(大海捞针)、LongBench 和 RULER 是长文本评测的三大核心基准。

长文本评测结果对比

模型 上下文窗口 NIAH (128K) LongBench (avg) RULER (128K)
DeepSeek-V3 128K 99.2 54.6 91.8
GPT-4o 128K 98.6 55.8 90.2
Claude 3.5 Sonnet 200K 98.8 54.2 90.5
Gemini 1.5 Pro 1M 99.5 53.8 91.2
Qwen2.5-72B 128K 97.5 52.3 88.6

大海捞针(NIAH)评测说明

  • NIAH 评测:在非常长的文本中随机位置插入一条特定信息("针"),然后让模型找回这条信息。这是测试模型在长上下文中精确定位信息能力的最直观方法。
  • DeepSeek-V3 在 128K 上下文长度下 NIAH 得分 99.2%,几乎完美,说明模型能有效利用完整的 128K 上下文窗口,不会出现"遗忘"中间信息的现象。
  • RULER 评测更严格,它在长文本中插入多条信息,测试模型同时追踪多目标的能力。DeepSeek-V3 得分 91.8%,在所有模型中最高。
  • LongBench 综合评测涵盖单文档 QA、多文档 QA、摘要、代码等 6 大类 21 个子任务,GPT-4o 以 55.8% 微弱领先,DeepSeek-V3 以 54.6% 位居第二。

长文本场景建议

对于需要处理长文档、代码库分析、合同审查等场景,DeepSeek-V3 的 128K 上下文窗口和优秀的长文本检索能力足以满足绝大多数需求。如需处理超长文本(200K+),Claude 3.5 Sonnet 和 Gemini 1.5 Pro 是备选方案。

多模态评测

DeepSeek-VL2 是 DeepSeek 的视觉语言模型,支持图像理解和视觉推理。MMBench、MMMU 和 MathVista 是视觉语言模型最权威的评测基准。

多模态评测结果对比

模型 MMBench (EN) MMBench (CN) MMMU (val) MathVista
GPT-4o 86.5 84.2 69.1 63.8
DeepSeek-VL2 84.8 86.1 64.5 62.2
Claude 3.5 Sonnet 85.2 82.8 68.4 61.5
Gemini 1.5 Pro 85.8 83.5 67.8 62.5
Qwen2-VL-72B 84.2 85.5 63.8 60.2

评测分析

  • DeepSeek-VL2 在中文图像理解上表现突出,MMBench (CN) 得分 86.1%,超过 GPT-4o 的 84.2%,在中文 OCR、中文图表理解等场景中优势明显。
  • 在英文多模态评测中,GPT-4o 仍保持领先,MMBench (EN) 86.5% 和 MMMU 69.1% 均为最高分。DeepSeek-VL2 紧随其后,差距在 2-5 个百分点。
  • MathVista 数学视觉推理,GPT-4o 以 63.8% 领先,DeepSeek-VL2 以 62.2% 位居第二,说明 DeepSeek 在数学图表、几何问题等视觉数学任务上也具备竞争力。
  • MMMU 评测(大规模多学科多模态理解)覆盖 30 个学科,DeepSeek-VL2 得分 64.5%,在多模态专业知识理解上表现稳健。

多模态选型建议

如果业务以中文图像理解为主(如中文文档 OCR、中文图表解析),DeepSeek-VL2 是最佳选择。如果以英文多模态为主,GPT-4o 和 Claude 3.5 Sonnet 也是优秀选项。关注 DeepSeek 后续 V3 多模态版本的发布进展。详见 DeepSeek 多模态模型

自建评测系统

除了依赖公开基准测试,你也可以搭建自己的评测流水线,使用 lm-evaluation-harness 和 OpenCompass 对 DeepSeek 模型进行定制化评测。

方案一:使用 lm-evaluation-harness

lm-evaluation-harness 是 EleutherAI 开发的标准化评测框架,支持 200+ 评测基准,通过命令行即可快速评测:

# 安装 lm-evaluation-harness git clone https://github.com/EleutherAI/lm-evaluation-harness cd lm-evaluation-harness pip install -e . # 评测 DeepSeek-V3 在 MMLU 上的表现 lm_eval \ --model openai-completions \ --model_args model=deepseek-chat,base_url=https://api.deepseek.com/v1/completions,api_key=sk-xxx \ --tasks mmlu \ --num_fewshot 5 \ --batch_size 8 \ --output_path ./results/deepseek-v3 # 评测代码能力(HumanEval + MBPP) lm_eval \ --model openai-completions \ --model_args model=deepseek-chat,base_url=https://api.deepseek.com/v1/completions,api_key=sk-xxx \ --tasks humaneval,mbpp \ --num_fewshot 0 \ --output_path ./results/deepseek-v3-code # 评测数学能力 lm_eval \ --model openai-completions \ --model_args model=deepseek-chat,base_url=https://api.deepseek.com/v1/completions,api_key=sk-xxx \ --tasks gsm8k,math \ --num_fewshot 8 \ --output_path ./results/deepseek-v3-math

方案二:使用 OpenCompass

OpenCompass 是上海人工智能实验室开发的一站式评测平台,对中文评测支持更好,更适合国内用户:

# 安装 OpenCompass git clone https://github.com/open-compass/opencompass cd opencompass pip install -e . # 使用配置文件评测 DeepSeek # 创建 configs/eval_deepseek.py from opencompass.models import OpenAISDK from opencompass.partitioners import NaivePartitioner from opencompass.runners import LocalRunner from opencompass.tasks import OpenICLInferTask, OpenICLEvalTask # 配置 DeepSeek 模型 models = [ dict( type=OpenAISDK, path='deepseek-chat', key='sk-your-api-key', openai_api_base='https://api.deepseek.com/v1/chat/completions', is_chat_api=True, max_out_len=2048, temperature=0.0, batch_size=8, ) ] # 选择评测数据集 datasets = [ 'mmlu', 'ceval', 'cmmlu', 'gsm8k', 'humaneval', ] # 运行评测(命令行) # python run.py configs/eval_deepseek.py --debug

方案三:Python 全自动评测脚本

使用 Python 编写自定义评测脚本,批量运行多个基准测试并生成对比报告:

"""DeepSeek 模型全自动评测流水线""" import json import time from datetime import datetime from openai import OpenAI class DeepSeekBenchmark: """DeepSeek 模型评测类""" def __init__(self, api_key, base_url="https://api.deepseek.com"): self.client = OpenAI(api_key=api_key, base_url=base_url) self.results = {} def run_gsm8k(self, num_samples=100): """运行 GSM8K 数学评测""" from datasets import load_dataset dataset = load_dataset("gsm8k", "main", split="test") correct = 0 total = 0 for i, item in enumerate(dataset): if i >= num_samples: break response = self.client.chat.completions.create( model="deepseek-chat", messages=[{"role": "user", "content": item["question"]}], temperature=0.0, ) answer = response.choices[0].message.content # 提取答案中的数字 import re numbers = re.findall(r'-?\d+\.?\d*', answer) if numbers and float(numbers[-1]) == float(item["answer"].split("####")[-1].strip().replace(",", "")): correct += 1 total += 1 if (i + 1) % 10 == 0: print(f"GSM8K 进度: {i+1}/{num_samples}, 当前准确率: {correct/total*100:.1f}%") self.results["gsm8k"] = {"accuracy": correct/total, "total": total} return self.results["gsm8k"] def generate_report(self): """生成评测报告""" report = { "model": "DeepSeek-V3", "timestamp": datetime.now().isoformat(), "results": self.results, } with open("benchmark_report.json", "w") as f: json.dump(report, f, indent=2, ensure_ascii=False) print("评测报告已生成: benchmark_report.json") return report # 使用示例 benchmark = DeepSeekBenchmark("sk-your-api-key") benchmark.run_gsm8k(num_samples=100) benchmark.generate_report()

评测框架对比

框架 优势 适用场景
lm-evaluation-harness 标准化程度高,社区活跃,支持 200+ 基准 学术研究、标准评测对比
OpenCompass 中文支持好,可视化报告,一键评测 中文场景评测、企业级评测平台
自定义脚本 灵活可控,可定制评测逻辑和指标 特定业务场景评测、A/B 测试

选型决策指南

基于以上评测数据,结合你的具体场景和预算,选择最合适的 DeepSeek 模型版本和部署方案。

按场景推荐模型

应用场景 首选模型 备选模型 关键评测指标
通用对话 DeepSeek-V3 GPT-4o / Claude 3.5 MT-Bench 9.08, Arena ELO 1305
代码开发 DeepSeek-V3 DeepSeek-Coder-V2 HumanEval 92.1, MBPP 87.6
数学推理 DeepSeek-R1 DeepSeek-V3 AIME 2024 79.8, MATH 72.8
中文场景 DeepSeek-V3 Qwen2.5-72B C-Eval 86.5, CMMLU 84.8
多模态 DeepSeek-VL2 GPT-4o MMBench CN 86.1, MMMU 64.5
长文本处理 DeepSeek-V3 Claude 3.5 Sonnet NIAH 99.2, RULER 91.8

按预算推荐部署方案

预算级别 推荐方案 模型 预估成本
免费 DeepSeek 官方网页版 DeepSeek-V3 0 元/月
低成本 DeepSeek API + Ollama 本地 DeepSeek-V3 / R1 蒸馏版 100-500 元/月
中等预算 DeepSeek API + 自建评测 DeepSeek-V3 500-2000 元/月
企业级 私有化部署 + 多模型组合 V3 + R1 + VL2 组合 5000+ 元/月

选型决策要点

  • DeepSeek-V3 是综合性价比最高的选择,在知识、推理、代码、数学、中文等核心维度均处于第一梯队,API 价格仅为 GPT-4o 的约 1/10。
  • 数学重推理场景优先考虑 DeepSeek-R1,其推理链增强在 AIME 等竞赛级别评测中展现出压倒性优势。
  • 中文为主的应用场景,DeepSeek-V3 是首选,在 C-Eval 和 CMMLU 上大幅领先 GPT-4o 和 Claude 3.5。
  • 多模态需求目前建议 DeepSeek-VL2,中文图像理解能力突出,同时关注后续 V3 多模态版本。
  • 建议搭建自有评测流水线,用实际业务数据对候选模型进行 A/B 测试,公开基准测试仅供参考。
  • 模型选型不是一次性的,建议每季度重新评估,关注新版本发布和评测数据更新。

综合建议

对于大多数企业和开发者,DeepSeek-V3 是当前最优的通用选择。它在大模型评测的核心维度上与世界顶级闭源模型(GPT-4o、Claude 3.5)处于同一水平线,同时提供了开源模型的最佳性价比。更多模型选择和部署方案,请查看 DeepSeek 开源模型列表DeepSeek 部署教程

DeepSeek 模型评测常见问题

DeepSeek-V3 和 GPT-4o 哪个更好? +
两者在大多数评测指标上非常接近。DeepSeek-V3 在数学(GSM8K 95.8 vs 93.1)、代码(HumanEval 92.1 vs 90.2)和中文(C-Eval 86.5 vs 82.1)上略占优势,GPT-4o 在对话综合评分(MT-Bench 9.12 vs 9.08)和多模态上略优。综合来看,DeepSeek-V3 以约 1/10 的价格提供与 GPT-4o 同级别的能力,性价比极高。如果你的场景以中文或数学推理为主,DeepSeek-V3 是更优选择。
基准测试分数能完全代表模型能力吗? +
不能。基准测试存在局限性:1) 评测数据集可能被训练数据污染,导致分数虚高;2) 多选题格式不能完全反映真实对话场景;3) 不同评测框架的实现差异可能导致分数偏差。建议将基准测试作为参考,同时结合自有业务数据的 A/B 测试和真实用户反馈进行综合评估。
DeepSeek-R1 和 DeepSeek-V3 的区别是什么? +
DeepSeek-R1 是推理增强模型,在回答前会进行深度思考(Chain-of-Thought),在数学竞赛(AIME 2024 79.8% vs V3 的 42.7%)和复杂推理任务上有显著优势。但 R1 的响应速度较慢,成本较高。DeepSeek-V3 是通用对话模型,在大多数日常任务上表现优异且延迟更低。推荐:日常对话用 V3,复杂推理和数学问题用 R1。
如何搭建自己的评测流水线? +
推荐使用 lm-evaluation-harness(国际标准)或 OpenCompass(中文友好)。简要步骤:1) 安装评测框架;2) 配置 DeepSeek API 或本地模型;3) 选择评测任务(MMLU、HumanEval 等);4) 运行评测并生成报告。建议先用标准基准测试验证,再补充自有业务数据集的评测。详见第 9 章的完整代码示例。
DeepSeek 模型评测数据从哪里获取? +
最权威的来源包括:1) DeepSeek 官方技术报告和博客;2) OpenCompass 排行榜(opencompass.org.cn);3) LMSYS Chatbot Arena(chat.lmsys.org);4) HuggingFace Open LLM Leaderboard。建议以官方技术报告为主要参考,使用 OpenCompass 和 Chatbot Arena 进行交叉验证。
开源模型和闭源模型的评测可以公平对比吗? +
在相同评测框架下使用相同设置(prompt、few-shot、温度等)进行的评测是可以公平对比的。OpenCompass 和 lm-evaluation-harness 都提供了标准化的评测流程。但需要注意:1) 闭源模型可能通过 API 更新,不同时间点的评测结果可能不同;2) 某些评测基准可能存在数据污染,导致分数虚高。建议固定评测框架和版本,定期复测。

DeepSeek 相关教程

深入学习 DeepSeek 模型的使用、部署和生态工具。

每日精选 Skill 推荐,免费送到你邮箱

输入邮箱,每天接收一个精选 AI Agent 技能推荐。完全免费,持续更新。

完全免费,取消任意时间。我们不会发送垃圾邮件。