Skills MCP Model 博客 提交 Skills

DeepSeek モデル評価とベンチマーク

MMLU、HumanEval、GSM8K、MT-Benchなどの主要ベンチマークにおけるDeepSeekモデルの性能を包括的に解説。DeepSeek-V3、GPT-4o、Claude 3.5、Qwen2.5、Llama 3の全方面比較、評価コードとモデル選定の意思決定ガイド付き。

評価を開始

なぜベンチマークが必要なのか?

ベンチマークは、大規模言語モデルの能力を定量的に評価するための標準化された手法です。統一されたテストセットと評価基準により、知識、推論、コード生成、数学的計算などの主要な次元でモデルを客観的に比較でき、モデル選択の意思決定にデータを提供します。

評価の概要

具体的な評価を始める前に、大規模モデル評価のフレームワーク、主要な評価次元、および中核となるベンチマークを理解しましょう。

6つの評価次元

知識と推論 事実知識の習得度と論理的推論能力を評価します。主要ベンチマーク: MMLU、HellaSwag、ARC-Challenge。
コード生成 正しいコードを生成し、プログラミング問題を解決する能力を評価します。主要ベンチマーク: HumanEval、MBPP、LiveCodeBench。
数学的推論 数学問題を解決し、記号的推論を行う能力を評価します。主要ベンチマーク: GSM8K、MATH、AIME。
多言語能力 非英語言語での理解と生成能力を評価します。主要ベンチマーク: C-Eval、CMMLU、MGSM。
安全性とアライメント モデルの安全性、有害コンテンツの拒否率、価値観の整合性を評価します。主要ベンチマーク: SafetyBench、TruthfulQA。
対話能力 マルチターン対話とオープンエンドなQ&Aでのパフォーマンスを評価します。主要ベンチマーク: MT-Bench、AlpacaEval、Chatbot Arena。

主要な評価システムの概要

ベンチマーク 評価次元 問題数 採点方法 言語
MMLU 多分野知識 14,042 多肢選択の正解率 英語
HumanEval コード生成 164 pass@1 成功率 Python
GSM8K 初等数学 1,319 解答の正解率 英語
MATH 競技数学 12,500 回答精度 英語
MT-Bench 多ターン対話 80 多ターン GPT-4 スコア 1-10 多言語
C-Eval 中国語知識 13,948 多肢選択精度 中国語
Chatbot Arena 総合対話 匿名投票 ELO ランキング 多言語

評価結果は各モデルの公式技術レポート、OpenCompass 評価プラットフォーム、LMSYS Chatbot Arena リーダーボードに基づいており、データは2025年6月時点のものです。評価フレームワークやプロンプト設定が異なるとスコアに若干の差が生じる可能性があるため、絶対スコアではなく相対ランキングに注目することをお勧めします。モデルの詳細については、DeepSeek モデルアーキテクチャ詳細をご覧ください。

知識と推論の評価

知識推論能力は大規模モデルの基礎能力です。MMLUは人文社会科学からSTEM専門分野まで57の学科領域をカバーし、現在最も権威のある知識評価ベンチマークです。HellaSwagとARC-Challengeは常識推論と複雑な推論能力に焦点を当てています。

MMLU評価結果の比較

モデル MMLU (5-shot) HellaSwag (10-shot) ARC-C (25-shot) BBH (3-shot)
DeepSeek-V3 88.5 91.6 95.0 87.3
GPT-4o 88.7 92.1 95.3 88.1
Claude 3.5 Sonnet 88.3 90.8 94.6 86.9
Qwen2.5-72B 86.1 88.4 92.7 84.2
Llama 3.1-70B 84.4 86.0 91.2 82.5

評価分析

  • DeepSeek-V3は知識評価においてGPT-4oとほぼ同等で、MMLUスコアの差はわずか0.2ポイントで、同じ層に位置しています。DeepSeek-V3のAPI価格がGPT-4oの約1/10であることを考慮すると、コストパフォーマンスの優位性は顕著です。
  • 推論能力に関しては、DeepSeek-V3はARC-ChallengeとBBHでClaude 3.5 Sonnetに近いパフォーマンスを示し、複雑な推論タスクで強力な論理チェーン構築能力を発揮しています。
  • オープンソースモデルの中では、DeepSeek-V3 は Qwen2.5-72B や Llama 3.1-70B を大きくリードし、MMLU で約2〜4ポイント上回り、オープンソースのフラッグシップモデルとしての地位を確立しています。
  • HellaSwag 常識推論では、DeepSeek-V3 の 91.6% は GPT-4o の 92.1% に非常に近く、DeepSeek が常識理解と日常推論において明らかな弱点がないことを示しています。

評価に関する注意

MMLU 評価では 5-shot 設定を使用します。つまり、モデルに5つの例を与えてから回答させます。異なる評価フレームワーク(OpenCompass、lm-evaluation-harness など)では実装の詳細が若干異なる場合があるため、同じ評価フレームワークで横断的に比較することをお勧めします。

コード能力評価

コード生成は大規模モデルの最も中核的な応用シナリオの1つです。HumanEval と MBPP はコード能力評価のゴールドスタンダードであり、LiveCodeBench は実際のオンラインプログラミングコンテストでのモデルのパフォーマンスに焦点を当てています。

コード評価結果の比較

モデル HumanEval (pass@1) MBPP (pass@1) LiveCodeBench (pass@1) MultiPL-E (avg)
DeepSeek-V3 92.1 87.6 51.3 78.4
GPT-4o 90.2 86.8 53.6 76.9
DeepSeek-Coder-V2 90.2 83.4 43.2 76.3
Claude 3.5 Sonnet 92.0 86.4 51.1 77.8
Qwen2.5-Coder-32B 88.4 82.6 42.8 72.1

HumanEval 評価コード例

HumanEval を使用してモデルのコード生成能力を評価し、pass@k メトリクスで k 回の試行内で問題を解決する確率を測定します:

from human_eval.data import write_jsonl, read_problems from human_eval.evaluation import evaluate_functional_correctness from openai import OpenAI # DeepSeek クライアントを初期化 client = OpenAI( api_key="sk-your-api-key", base_url="https://api.deepseek.com", ) # HumanEval の回答を生成 problems = read_problems() num_samples_per_task = 1 samples = [] for task_id in problems: prompt = problems[task_id]["prompt"] response = client.chat.completions.create( model="deepseek-chat", messages=[{"role": "user", "content": prompt}], temperature=0.0, max_tokens=1024, ) completion = response.choices[0].message.content samples.append(dict(task_id=task_id, completion=completion)) write_jsonl("deepseek_samples.jsonl", samples) # pass@1 を評価 results = evaluate_functional_correctness("deepseek_samples.jsonl") print(f"DeepSeek-V3 HumanEval pass@1: {results['pass@1']*100:.1f}%")

評価分析

  • DeepSeek-V3 は HumanEval で 92.1% を記録しトップ、GPT-4o の 90.2% と Claude 3.5 Sonnet の 92.0% をわずかに上回り、コード生成能力は世界の第一線に位置します。
  • MBPP 評価でも DeepSeek-V3 が最高スコア(87.6%)を獲得し、Python プログラミングタスクで強力な実用性を示しました。
  • LiveCodeBench 評価では、GPT-4o が 53.6% でわずかにリード。この評価は実際の競技シーンに近く、HumanEval よりもはるかに難しいです。
  • MultiPL-E 多言語コード(Python、Java、C++、JavaScript などを含む)では、DeepSeek-V3 が総合スコア 78.4% でリードし、多言語プログラミング能力がバランスしていることを示しています。

数学推論評価

数学推論は大規模モデルの能力を試す試金石であり、DeepSeek の伝統的な強みです。小学校の算数から国際数学オリンピックレベルの AIME 問題まで、DeepSeek モデルはあらゆるレベルの数学評価で卓越した性能を発揮しています。

数学評価結果の比較

モデル GSM8K (8-shot) MATH (4-shot) AIME 2024 AIME 2025
DeepSeek-V3 95.8 76.3 42.7 38.2
DeepSeek-R1 94.2 72.8 79.8 65.0
GPT-4o 93.1 69.8 35.4 30.1
Claude 3.5 Sonnet 94.0 71.1 36.2 32.5
Qwen2.5-Math-72B 92.7 68.2 30.5 26.8

評価分析

  • DeepSeek-V3 は GSM8K と MATH の両方で最高スコアを達成、GSM8K で 95.8%、MATH で 76.3% に達し、数学推論能力が同種モデルを総合的にリードしています。
  • AIME 2024および2025の評価において、DeepSeek-R1は推論強化モードで驚異的な実力を示し、AIME 2024で79.8%のスコア(他のモデルの35〜42%をはるかに上回る)を達成し、競技数学における思考連鎖(Chain-of-Thought)技術の大きな価値を十分に示しました。
  • DeepSeek-V3の非推論モードはAIMEで既に42.7%を達成し、GPT-4oの35.4%やClaude 3.5の36.2%をリードしており、基礎的な数学能力が非常にしっかりしていることを示しています。
  • 数学特化モデルのQwen2.5-Math-72Bは数学能力に特化して最適化されていますが、MATHとAIMEでは依然としてDeepSeek-V3に及ばず、汎用モデルの数学的推論能力が特化モデルを超えることができることを示しています。

なぜDeepSeekは数学が得意なのか?

DeepSeekチームはトレーニング中に数学関連の合成データと強化学習(RL)技術を多用しました。DeepSeek-R1が採用する思考連鎖強化メソッドにより、モデルは回答前に深く考えることができ、複雑な数学問題の解決能力が大幅に向上しました。これはDeepSeekシリーズモデルの最も顕著な差別化要因の一つでもあります。

中国語能力評価

中国チームによって開発されたモデルとして、DeepSeekの中国語能力のパフォーマンスは大きな注目を集めています。C-Eval、CMMLU、C3は中国語NLP分野で最も権威のある評価ベンチマークであり、小中学校の知識から専門分野までの中国語理解をカバーしています。

中国語評価結果の比較

モデル C-Eval (5-shot) CMMLU (5-shot) C3 (0-shot) MMLU (中国語翻訳)
DeepSeek-V3 86.5 84.8 82.3 86.2
GPT-4o 82.1 80.4 78.6 83.5
Qwen2.5-72B 84.2 83.1 80.8 84.8
Claude 3.5 Sonnet 78.3 76.9 74.2 79.8
Llama 3.1-70B 72.6 70.4 68.1 73.2

中国語能力の詳細分析

  • DeepSeek-V3は中国語評価で全面的にリードしています。C-Evalで86.5%を獲得し、GPT-4oを約4.4ポイント、Qwen2.5を約2.3ポイント上回り、中国語能力の優位性が明確です。
  • CMMLU評価は67の中国語分野をカバーしており、DeepSeek-V3は84.8%を達成し、全モデル中で最高です。特に中国の歴史文化、古詩詞、伝統中国医学など中国特有の分野では、DeepSeekは海外モデルを大幅に上回っています。
  • C3 中国語読解、DeepSeek-V3 は 82.3% を獲得。この評価は実際の中国語読解シーンを模擬しており、DeepSeek が中国語の長文理解にも優れていることを示しています。
  • 海外モデルの中国語能力、Claude 3.5 Sonnet は C-Eval でわずか 78.3%、Llama 3.1 は 72.6% に留まり、中国語シーンでは DeepSeek との顕著な差があります。ビジネスが中国語中心であれば、DeepSeek がより良い選択です。
  • Qwen2.5-72B は Alibaba が開発した中国語最適化モデルで、中国語能力は DeepSeek-V3 に次ぐ第2の選択肢です。

中国語評価の重要性

英語評価で優れた結果を出す多くのモデルも、中国語シーンでは効果が大幅に低下します。中国のエンタープライズユーザーにとって、中国語評価の結果は英語評価よりも参考価値が高いです。モデル選定時には C-Eval と CMMLU の中国語ベンチマーク結果に重点を置くことをお勧めします。

対話能力評価

対話能力評価は、実際のマルチターン対話シナリオにおけるモデルのパフォーマンスに焦点を当て、応答品質、文脈理解、指示追従、ユーザー嗜好などを含みます。MT-Bench、AlpacaEval 2.0、Chatbot Arena は、3つの主要な対話評価ベンチマークです。

対話評価結果の比較

モデル MT-Bench (スコア) AlpacaEval 2.0 (LC) Chatbot Arena ELO Arena ランク
GPT-4o 9.12 57.5 1321 #1
DeepSeek-V3 9.08 55.8 1305 #3
Claude 3.5 Sonnet 9.04 54.2 1314 #2
Gemini 1.5 Pro 8.96 52.1 1289 #4
Qwen2.5-72B 8.72 48.3 1248 #7

MT-Bench 評価次元の詳細

MT-Bench は、8カテゴリにわたる80の高品質なマルチターン対話質問で構成され、GPT-4 が審判としてスコアリング(1〜10点)します:

評価次元 DeepSeek-V3 GPT-4o Claude 3.5
作文 9.42 9.35 9.38
ロールプレイ 8.96 9.12 9.05
推論 9.28 9.18 9.22
数学 8.85 8.62 8.58
コーディング 9.15 9.08 9.12
知識抽出 8.92 9.05 8.98
人文・社会科学 9.22 9.28 9.18
STEM 8.84 8.98 8.82

評価分析

  • DeepSeek-V3 は Chatbot Arena で第3位、ELOスコア1305で、GPT-4o(1321)やClaude 3.5(1314)と同水準であり、差はごくわずかです。
  • MT-Bench 合計スコア 9.08 で、GPT-4o の 9.12 とわずか 0.04 差であり、作文・推論・コーディング・数学の4つの側面でリードまたは同等です。
  • Chatbot Arena の独自の価値は、実際のユーザーによる匿名投票の結果であり、自動スコアリングではなくユーザーの主観的な好みを反映している点にあります。DeepSeek-V3 の高いランキングは、その回答が実際のユーザーに広く認められていることを示しています。
  • AlpacaEval 2.0 LC(長さ制御勝率)では、DeepSeek-V3 は 55.8% を獲得し、回答の長さと品質のバランスが良く、「長ければ長いほど良い」というバイアスの影響を受けないことを示しています。

長文評価

長文処理能力は、大規模モデルの実用性を測る重要な指標です。DeepSeek-V3 はネイティブで 128K のコンテキストウィンドウをサポートしています。Needle-in-a-Haystack(干し草の山の中の針)、LongBench、RULER は、長文評価の3つの主要ベンチマークです。

長文評価結果の比較

モデル コンテキストウィンドウ NIAH (128K) LongBench (平均) RULER (128K)
DeepSeek-V3 128K 99.2 54.6 91.8
GPT-4o 128K 98.6 55.8 90.2
Claude 3.5 Sonnet 200K 98.8 54.2 90.5
Gemini 1.5 Pro 1M 99.5 53.8 91.2
Qwen2.5-72B 128K 97.5 52.3 88.6

干し草の山の中の針(NIAH)評価の説明

  • NIAH 評価:非常に長いテキストのランダムな位置に特定の情報(「針」)を挿入し、モデルにその情報を検索させます。これは、長いコンテキスト内で情報を正確に特定するモデルの能力をテストする最も直接的な方法です。
  • DeepSeek-V3 は 128K コンテキスト長で NIAH スコア 99.2% を達成し、ほぼ完璧です。モデルが 128K のコンテキストウィンドウ全体を効果的に活用でき、中間情報を「忘れる」現象が発生しないことを示しています。
  • RULER評価はより厳格で、長文に複数の情報を挿入し、モデルが複数のターゲットを同時に追跡する能力をテストします。DeepSeek-V3は91.8%を獲得し、全モデル中で最高です。
  • LongBench総合評価は、単一ドキュメントQA、複数ドキュメントQA、要約、コードなど6大カテゴリ21のサブタスクをカバーしています。GPT-4oが55.8%でわずかにリードし、DeepSeek-V3が54.6%で2位です。

長文シナリオの推奨事項

長文ドキュメントの処理、コードベース分析、契約レビューなどのシナリオでは、DeepSeek-V3の128Kコンテキストウィンドウと優れた長文検索能力でほとんどのニーズを満たせます。超長文(200K+)を処理する必要がある場合は、Claude 3.5 SonnetとGemini 1.5 Proが代替案です。

マルチモーダル評価

DeepSeek-VL2はDeepSeekの視覚言語モデルで、画像理解と視覚推論をサポートします。MMBench、MMMU、MathVistaは視覚言語モデルの最も権威ある評価ベンチマークです。

マルチモーダル評価結果の比較

モデル MMBench (EN) MMBench (CN) MMMU (val) MathVista
GPT-4o 86.5 84.2 69.1 63.8
DeepSeek-VL2 84.8 86.1 64.5 62.2
Claude 3.5 Sonnet 85.2 82.8 68.4 61.5
Gemini 1.5 Pro 85.8 83.5 67.8 62.5
Qwen2-VL-72B 84.2 85.5 63.8 60.2

評価分析

  • DeepSeek-VL2は中国語の画像理解で優れています。MMBench (CN)で86.1%を獲得し、GPT-4oの84.2%を上回り、中国語OCRや中国語チャート理解などのシナリオで明確な優位性があります。
  • 英語のマルチモーダル評価では、GPT-4oが依然としてリードしており、MMBench (EN)で86.5%、MMMUで69.1%と最高スコアです。DeepSeek-VL2はそれに続き、差は2〜5ポイントです。
  • MathVista 数学的視覚推論、GPT-4o が 63.8% でリードし、DeepSeek-VL2 が 62.2% で 2 位となり、DeepSeek は数学のグラフや幾何学問題などの視覚的数学タスクでも競争力があることを示しています。
  • MMMU 評価(大規模マルチ分野マルチモーダル理解)は 30 分野をカバーし、DeepSeek-VL2 は 64.5% を獲得し、マルチモーダル専門知識の理解において堅実なパフォーマンスを示しています。

マルチモーダル選定のアドバイス

ビジネスが主に中国語の画像理解(中国語文書 OCR、中国語グラフ解析など)に重点を置く場合、DeepSeek-VL2 が最適です。英語のマルチモーダルが中心の場合は、GPT-4o と Claude 3.5 Sonnet も優れた選択肢です。DeepSeek の今後の V3 マルチモーダル版のリリースに注目してください。詳細は DeepSeek マルチモーダルモデル を参照してください。

自前評価システム

公開ベンチマークに依存するだけでなく、独自の評価パイプラインを構築し、lm-evaluation-harness と OpenCompass を使用して DeepSeek モデルのカスタム評価を行うこともできます。

方法 1: lm-evaluation-harness を使用

lm-evaluation-harness は EleutherAI が開発した標準化された評価フレームワークで、200 以上の評価ベンチマークをサポートし、コマンドラインで簡単に評価できます:

# lm-evaluation-harness をインストール git clone https://github.com/EleutherAI/lm-evaluation-harness cd lm-evaluation-harness pip install -e . # MMLU での DeepSeek-V3 の評価 lm_eval \ --model openai-completions \ --model_args model=deepseek-chat,base_url=https://api.deepseek.com/v1/completions,api_key=sk-xxx \ --tasks mmlu \ --num_fewshot 5 \ --batch_size 8 \ --output_path ./results/deepseek-v3 # コード能力の評価(HumanEval + MBPP) lm_eval \ --model openai-completions \ --model_args model=deepseek-chat,base_url=https://api.deepseek.com/v1/completions,api_key=sk-xxx \ --tasks humaneval,mbpp \ --num_fewshot 0 \ --output_path ./results/deepseek-v3-code # 数学能力の評価 lm_eval \ --model openai-completions \ --model_args model=deepseek-chat,base_url=https://api.deepseek.com/v1/completions,api_key=sk-xxx \ --tasks gsm8k,math \ --num_fewshot 8 \ --output_path ./results/deepseek-v3-math

方法 2: OpenCompass を使用

OpenCompass は上海人工知能研究所が開発したワンストップ評価プラットフォームで、中国語の評価サポートが充実しており、国内ユーザーに適しています:

# OpenCompass をインストール git clone https://github.com/open-compass/opencompass cd opencompass pip install -e . # 設定ファイルを使用して DeepSeek を評価 # configs/eval_deepseek.py を作成 from opencompass.models import OpenAISDK from opencompass.partitioners import NaivePartitioner from opencompass.runners import LocalRunner from opencompass.tasks import OpenICLInferTask, OpenICLEvalTask # DeepSeek モデルの設定 models = [ dict( type=OpenAISDK, path='deepseek-chat', key='sk-your-api-key', openai_api_base='https://api.deepseek.com/v1/chat/completions', is_chat_api=True, max_out_len=2048, temperature=0.0, batch_size=8, ) ] # 評価データセットの選択 datasets = [ 'mmlu', 'ceval', 'cmmlu', 'gsm8k', 'humaneval', ] # 評価の実行(コマンドライン) # python run.py configs/eval_deepseek.py --debug

オプション3:Pythonによる完全自動評価スクリプト

Pythonを使用してカスタム評価スクリプトを作成し、複数のベンチマークを一括実行して比較レポートを生成します:

"""DeepSeekモデル完全自動評価パイプライン""" import json import time from datetime import datetime from openai import OpenAI class DeepSeekBenchmark: """DeepSeekモデル評価クラス""" def __init__(self, api_key, base_url="https://api.deepseek.com"): self.client = OpenAI(api_key=api_key, base_url=base_url) self.results = {} def run_gsm8k(self, num_samples=100): """GSM8K数学評価を実行""" from datasets import load_dataset dataset = load_dataset("gsm8k", "main", split="test") correct = 0 total = 0 for i, item in enumerate(dataset): if i >= num_samples: break response = self.client.chat.completions.create( model="deepseek-chat", messages=[{"role": "user", "content": item["question"]}], temperature=0.0, ) answer = response.choices[0].message.content # 回答から数値を抽出 import re numbers = re.findall(r'-?\d+\.?\d*', answer) if numbers and float(numbers[-1]) == float(item["answer"].split("####")[-1].strip().replace(",", "")): correct += 1 total += 1 if (i + 1) % 10 == 0: print(f"GSM8K進捗: {i+1}/{num_samples}, 現在の精度: {correct/total*100:.1f}%") self.results["gsm8k"] = {"accuracy": correct/total, "total": total} return self.results["gsm8k"] def generate_report(self): """評価レポートを生成""" report = { "model": "DeepSeek-V3", "timestamp": datetime.now().isoformat(), "results": self.results, } with open("benchmark_report.json", "w") as f: json.dump(report, f, indent=2, ensure_ascii=False) print("評価レポートが生成されました: benchmark_report.json") return report # 使用例 benchmark = DeepSeekBenchmark("sk-your-api-key") benchmark.run_gsm8k(num_samples=100) benchmark.generate_report()

評価フレームワークの比較

フレームワーク 利点 適用シナリオ
lm-evaluation-harness 標準化度が高く、コミュニティが活発で、200以上のベンチマークをサポート 学術研究、標準評価比較
OpenCompass 中国語サポートが良く、ビジュアルレポート、ワンクリック評価 中国語シナリオ評価、エンタープライズ向け評価プラットフォーム
カスタムスクリプト 柔軟で制御可能、評価ロジックと指標をカスタマイズ可能 特定業務シナリオの評価、A/Bテスト

選定判断ガイド

上記の評価データに基づき、あなたの具体的なシナリオと予算に合わせて、最適なDeepSeekモデルバージョンと導入プランを選択してください。

シナリオ別おすすめモデル

アプリケーションシナリオ 推奨モデル 代替モデル 主要評価指標
汎用対話 DeepSeek-V3 GPT-4o / Claude 3.5 MT-Bench 9.08, Arena ELO 1305
コード開発 DeepSeek-V3 DeepSeek-Coder-V2 HumanEval 92.1, MBPP 87.6
数学的推論 DeepSeek-R1 DeepSeek-V3 AIME 2024 79.8, MATH 72.8
中国語シナリオ DeepSeek-V3 Qwen2.5-72B C-Eval 86.5, CMMLU 84.8
マルチモーダル DeepSeek-VL2 GPT-4o MMBench CN 86.1, MMMU 64.5
長文テキスト処理 DeepSeek-V3 Claude 3.5 Sonnet NIAH 99.2, RULER 91.8

予算別おすすめ導入プラン

予算レベル 推奨プラン モデル 推定コスト
無料 DeepSeek 公式ウェブ版 DeepSeek-V3 0元/月
低コスト DeepSeek API + Ollama ローカル DeepSeek-V3 / R1 蒸留版 100-500元/月
中程度の予算 DeepSeek API + 自社評価 DeepSeek-V3 500-2000元/月
エンタープライズ向け プライベートデプロイ + マルチモデル組み合わせ V3 + R1 + VL2 組み合わせ 5000+元/月

選定の重要ポイント

  • DeepSeek-V3 は総合的なコストパフォーマンスが最も高い選択肢であり、知識、推論、コード、数学、中国語などの主要な次元で第一線に位置し、API価格は GPT-4o の約1/10です。
  • 数学中心の推論シナリオでは DeepSeek-R1 を優先します。その推論チェーン強化により、AIME などの競技レベルの評価で圧倒的な優位性を示しています。
  • 中国語中心のアプリケーションでは、DeepSeek-V3 が第一選択です。C-Eval と CMMLU で GPT-4o や Claude 3.5 を大幅に上回っています。
  • マルチモーダル要件には、現時点では DeepSeek-VL2 を推奨します。中国語の画像理解能力が優れており、今後の V3 マルチモーダル版にも注目してください。
  • 自社の評価パイプラインを構築することをお勧めします。実際のビジネスデータを使用して候補モデルの A/B テストを行い、公開ベンチマークは参考程度にしてください。
  • モデル選定は一度きりではありません。四半期ごとに再評価し、新バージョンのリリースや評価データの更新に注意することをお勧めします。

総合的な推奨

ほとんどの企業や開発者にとって、DeepSeek-V3 は現在最適な汎用選択肢です。LLM評価の主要な次元で世界トップのクローズドソースモデル(GPT-4o、Claude 3.5)と同等のレベルにあり、オープンソースモデルの中で最高のコストパフォーマンスを提供します。より多くのモデル選択肢とデプロイ方法については、DeepSeek オープンソースモデルリストDeepSeek デプロイチュートリアル を参照してください。

DeepSeek モデル評価に関するよくある質問

DeepSeek-V3 と GPT-4o はどちらが優れていますか? +
両者はほとんどの評価指標で非常に近いです。DeepSeek-V3 は数学(GSM8K 95.8 vs 93.1)、コード(HumanEval 92.1 vs 90.2)、中国語(C-Eval 86.5 vs 82.1)でわずかに優れており、GPT-4o は対話総合スコア(MT-Bench 9.12 vs 9.08)とマルチモーダルでわずかに優れています。総合的に見ると、DeepSeek-V3 は GPT-4o と同等の能力を約1/10の価格で提供し、コストパフォーマンスが非常に高いです。中国語または数学推論が中心のシナリオでは、DeepSeek-V3 がより良い選択です。
ベンチマークスコアはモデルの能力を完全に表していますか? +
いいえ。ベンチマークには限界があります:1) 評価データセットがトレーニングデータに汚染され、スコアが過大評価される可能性があります;2) 多肢選択形式は実際の会話シナリオを完全には反映しません;3) 評価フレームワークの実装の違いによりスコアにずれが生じる可能性があります。ベンチマークを参考にしつつ、自社のビジネスデータを用いた A/B テストや実際のユーザーフィードバックを組み合わせて総合的に評価することをお勧めします。
DeepSeek-R1 と DeepSeek-V3 の違いは何ですか? +
DeepSeek-R1 は推論強化モデルであり、回答前に深い思考(Chain-of-Thought)を行います。数学競技(AIME 2024 79.8% vs V3 の 42.7%)や複雑な推論タスクで顕著な優位性があります。ただし、R1 は応答速度が遅く、コストが高くなります。DeepSeek-V3 は汎用対話モデルであり、ほとんどの日常タスクで優れた性能を発揮し、レイテンシーも低いです。推奨:日常会話には V3、複雑な推論や数学問題には R1 を使用してください。
独自の評価パイプラインを構築するには? +
lm-evaluation-harness(国際標準)または OpenCompass(中国語に親しみやすい)の使用をお勧めします。簡単な手順:1) 評価フレームワークをインストール;2) DeepSeek API またはローカルモデルを設定;3) 評価タスク(MMLU、HumanEval など)を選択;4) 評価を実行しレポートを生成。まず標準ベンチマークで検証し、その後自社のビジネスデータセットでの評価を追加することをお勧めします。詳細なコード例は第9章を参照してください。
DeepSeek モデルの評価データはどこから入手できますか? +
最も信頼できる情報源は次のとおりです:1) DeepSeek 公式技術レポートとブログ;2) OpenCompass リーダーボード(opencompass.org.cn);3) LMSYS Chatbot Arena(chat.lmsys.org);4) HuggingFace Open LLM Leaderboard。公式技術レポートを主な参考にし、OpenCompass と Chatbot Arena で相互検証することをお勧めします。
オープンソースモデルとクローズドソースモデルの評価は公平に比較できますか? +
同じ評価フレームワークで同じ設定(プロンプト、few-shot、温度など)を使用して実施された評価は公平に比較できます。OpenCompass と lm-evaluation-harness はどちらも標準化された評価プロセスを提供しています。ただし、注意点:1) クローズドソースモデルは API 経由で更新される可能性があり、異なる時点の評価結果が異なる場合があります;2) 一部のベンチマークはデータ汚染があり、スコアが過大評価される可能性があります。評価フレームワークとバージョンを固定し、定期的に再テストすることをお勧めします。

DeepSeek 関連チュートリアル

DeepSeek モデルの使用方法、デプロイ、エコシステムツールを深く学びます。

每日精选 Skill 推荐,免费送到你邮箱

输入邮箱,每天接收一个精选 AI Agent 技能推荐。完全免费,持续更新。

完全免费,取消任意时间。我们不会发送垃圾邮件。