DeepSeek 开源模型完整列表
DeepSeek 已开源 6 大系列、20+ 个模型。全部 MIT 协议,免费可商用。一目了然的模型目录,帮你快速找到需要的模型。截至 2026 年 9 月,最新开源模型为 DeepSeek-V4.1-Flash。
查看模型列表模型系列总览
DeepSeek 目前开源了以下 6 大模型系列,覆盖对话、推理、编程、多模态、视觉、数学证明等场景。其中 V3 系列已迭代至 V3.2,最新旗舰为 2026 年 9 月 10 日发布的 V4.1-Flash。
DeepSeek 开源模型一键下载
所有模型完整下载链接汇总。Ollama 适合个人快速体验,Hugging Face 适合开发集成和微调。
| 模型 | 规格 | 大小 | Hugging Face | Ollama |
|---|---|---|---|---|
| V3 | 671B | 404GB | deepseek-ai/DeepSeek-V3 | ollama pull deepseek-v3 |
| V3.1 | 404GB | deepseek-ai/DeepSeek-V3.1 | ollama pull deepseek-v3.1 |
|
| V3.2 | 685B | ~404GB | deepseek-ai(官方组织页) | — |
| V3-0324 | 404GB | deepseek-ai/DeepSeek-V3-0324 | — | |
| V4 | V4.1-Flash(552B) | — | deepseek-ai(官方组织页) | — |
| R1 | 671B 完整版 | 404GB | deepseek-ai/DeepSeek-R1 | ollama run deepseek-r1:671b |
| Distill 1.5B | 1.1GB | deepseek-ai/DeepSeek-R1-Distill-Qwen-1.5B | ollama run deepseek-r1:1.5b |
|
| Distill 7B | 4.7GB | deepseek-ai/DeepSeek-R1-Distill-Qwen-7B | ollama run deepseek-r1:7b |
|
| Distill 8B (0528) | 5.2GB | —(Ollama 专属) | ollama run deepseek-r1:8b |
|
| Distill 14B | 9.0GB | deepseek-ai/DeepSeek-R1-Distill-Qwen-14B | ollama run deepseek-r1:14b |
|
| Distill 32B | 20GB | deepseek-ai/DeepSeek-R1-Distill-Qwen-32B | ollama run deepseek-r1:32b |
|
| Distill 70B | 43GB | deepseek-ai/DeepSeek-R1-Distill-Llama-70B | ollama run deepseek-r1:70b |
|
| Coder | V2 236B MoE | 142GB | deepseek-ai/DeepSeek-Coder-V2-Instruct | — |
| V2 Lite 16B | 10GB | deepseek-ai/DeepSeek-Coder-V2-Lite-Instruct | ollama pull deepseek-coder-v2 |
|
| V1 6.7B | 3.8GB | deepseek-ai/deepseek-coder-6.7b-instruct | ollama pull deepseek-coder:6.7b |
|
| V1 33B | 19GB | deepseek-ai/deepseek-coder-33b-instruct | ollama pull deepseek-coder:33b |
|
| Janus | Pro 7B | 15GB | deepseek-ai/Janus-Pro-7B | — |
| Janus 1.3B | ~800MB | deepseek-ai/Janus-1.3B | — | |
| JanusFlow 1.3B | ~800MB | deepseek-ai/JanusFlow-1.3B | — | |
| VL2 | Tiny (1.0B) | ~2GB | deepseek-ai/deepseek-vl2-tiny | — |
| Small (2.8B) | ~5GB | deepseek-ai/deepseek-vl2-small | — | |
| VL2 (4.5B) | ~8GB | deepseek-ai/deepseek-vl2 | — | |
| Prover V2 | 7B | ~15GB | deepseek-ai/DeepSeek-Prover-V2 | — |
* V3.2、V4.1-Flash 等最新模型的仓库地址以 DeepSeek 官方 Hugging Face 组织页为准;V4 Flash(284B,2026 年 7 月 31 日发布)已于 2026 年 9 月 10 日退役。
2026 最新开源模型:V3.1 / V3.2 / V4-Flash / V4.1-Flash
2025 年 8 月至今,DeepSeek 的开源主线从 V3 一路迭代到 V4。以下四个模型是当前最新的一批,全部 MIT 协议开源可商用。
DeepSeek-V4.1-Flash
552B 总参数 MoE,采用全新 CED 非对称架构(输入侧仅激活 8B、输出侧激活 16B),支持 1M tokens 上下文与最大 384K 输出,原生多模态视觉理解。
- 基准全面超越上一代旗舰 V4 Pro
- KV Cache 的 HBM 需求降至上一代 1/4
- 缓存命中输入低至 ¥0.02/百万 tokens
DeepSeek V4 Flash
284B 总参数 MoE,推理仅激活 13B 参数,1M tokens 上下文、385K 最大输出。性能对标 GPT-5,Agent 能力超越 Claude Opus 4.8。
- 2026 年 7 月 31 日发布
- 2026 年 9 月 10 日随 V4.1-Flash 发布退役
- 原 API 请求由 V4.1-Flash 自动承接
DeepSeek-V3.2
685B MoE 旗舰,在编码和通用能力上全面升级。API 定价低至 $0.14 / 百万 tokens,被称为「最便宜的顶级模型」。
- SWE-bench 55.0%,LMArena 排名前列
- 160K 上下文,支持 Agent 能力
- 完全开源,可商用
DeepSeek-V3.1
685B MoE,混合推理架构——一个模型同时支持思考模式与非思考模式,原生支持工具调用与 Agent 能力,被定义为「迈向 Agent 时代的第一步」。
- 思考 / 非思考模式一键切换
- MMLU 89.5%,Agent 基准大幅领先前代
- API 输入 ¥0.50 / 输出 ¥2.00(每百万 tokens)
V3 → V4.1-Flash 规格演进对照
| 模型 | 发布时间 | 参数量 | 上下文 | 类型 | 协议 |
|---|---|---|---|---|---|
| DeepSeek-V4.1-Flash | 2026-09 | 552B(输入 8B / 输出 16B 激活) | 1M tokens | 多模态 | MIT |
| DeepSeek V4 Flash | 2026-07 | 284B(13B 激活) | 1M tokens | 文本 | MIT |
| DeepSeek-V3.2 | 2025-12 | 685B(37B 激活) | 160K tokens | 文本 | MIT |
| DeepSeek-V3.1 | 2025-08 | 685B(37B 激活) | 160K tokens | 文本 | MIT |
| DeepSeek V3 | 2024-12 | 671B(37B 激活) | 160K tokens | 文本 | MIT |
* 数据来自 DeepSeek 官方发布说明。V4 Flash 退役后,原有 API 请求自动由 V4.1-Flash 承接并按 Flash 价格计费,无需修改调用代码。
DeepSeek V3 — 通用大语言模型
当前 DeepSeek 最强通用模型。671B 参数 MoE 架构,每次推理仅激活 37B 参数,高效且性能强大。
| 模型名称 | DeepSeek V3 |
| 参数量 | 671B(MoE,37B 激活/Token) |
| 模型大小 | 404 GB |
| 上下文窗口 | 160K tokens |
| 训练成本 | 约 557 万美元(极低) |
| 开源协议 | MIT License(可商用) |
| Ollama 下载 | ollama pull deepseek-v3(3.8M+ 下载) |
| GitHub | github.com/deepseek-ai/DeepSeek-V3 |
| 适用场景 | 通用对话、写作、翻译、知识问答、内容创作 |
DeepSeek R1 — 推理增强模型
采用强化学习训练,在数学、编程、逻辑推理方面表现惊艳。R1 完整版 671B 参数为最强推理模型;蒸馏版将 R1 的推理能力迁移到 Qwen 和 Llama 等小模型上,让普通硬件也能运行。提供 1.5B 到 671B 共 7 种规格,是 Ollama 上下载量最高的模型。
| 模型名称 | DeepSeek R1(最新版 R1-0528) |
| 参数量 | 1.5B / 7B / 8B / 14B / 32B / 70B / 671B |
| 模型大小 | 1.1GB ~ 404GB |
| 上下文窗口 | 128K(671B 为 160K) |
| 蒸馏基底 | Qwen-2.5 + Llama-3.1/3.3 |
| Ollama 下载量 | 88.3M+(35 个版本) |
| GitHub | github.com/deepseek-ai/DeepSeek-R1 |
| 适用场景 | 数学解题、编程、逻辑推理、复杂问题分析 |
R1 蒸馏版完整规格与 Ollama 下载
R1 蒸馏版是将 R1 671B 的推理能力通过知识蒸馏迁移到小模型上,让你在消费级硬件上也能体验强大的推理能力。以下为全部可用版本:
| 模型版本 | 蒸馏基底 | 模型大小 | 上下文 | 推荐硬件 | Hugging Face | Ollama 命令 |
|---|---|---|---|---|---|---|
| R1-0528-Qwen3-8B 最新 | Qwen3 | 5.2GB | 128K | 8GB 显存 | Ollama 专属 | ollama run deepseek-r1:8b |
| R1-Distill-Qwen-1.5B | Qwen-2.5 | 1.1GB | 128K | CPU 可运行 | DeepSeek-R1-Distill-Qwen-1.5B | ollama run deepseek-r1:1.5b |
| R1-Distill-Qwen-7B | Qwen-2.5 | 4.7GB | 128K | 8GB 显存 | DeepSeek-R1-Distill-Qwen-7B | ollama run deepseek-r1:7b |
| R1-Distill-Qwen-14B | Qwen-2.5 | 9.0GB | 128K | 16GB 显存 | DeepSeek-R1-Distill-Qwen-14B | ollama run deepseek-r1:14b |
| R1-Distill-Qwen-32B | Qwen-2.5 | 20GB | 128K | 24GB 显存 | DeepSeek-R1-Distill-Qwen-32B | ollama run deepseek-r1:32b |
| R1-Distill-Llama-70B | Llama-3.3 | 43GB | 128K | 48GB 显存 | DeepSeek-R1-Distill-Llama-70B | ollama run deepseek-r1:70b |
| R1-671B 完整版 | 原生 | 404GB | 160K | 多卡集群 | DeepSeek-R1 | ollama run deepseek-r1:671b |
DeepSeek Coder — 代码专用模型
专注代码生成与理解。Coder V2 采用 236B MoE 架构,支持 338 种编程语言和 128K 上下文,代码能力超越 GPT-4 Turbo。Coder V1 提供轻量级 1.3B~33B 规格,支持 FIM 代码补全。
Coder V2 — 最新旗舰代码模型
| 模型版本 | DeepSeek-Coder-V2(236B MoE)/ DeepSeek-Coder-V2-Lite(16B) |
| 参数量 | 236B(MoE,21B 激活)/ 16B |
| 模型大小 | ~142GB / ~10GB |
| 上下文窗口 | 128K tokens |
| 支持语言 | 338 种编程语言 |
| Hugging Face | DeepSeek-Coder-V2-Instruct | DeepSeek-Coder-V2-Lite-Instruct |
| Ollama | ollama pull deepseek-coder-v2 |
| 适用场景 | 代码生成、代码补全、Bug 修复、代码审查、多文件重构 |
Coder V1 — 轻量级代码模型
使用 2 万亿 Token 训练(87% 代码 + 13% 中英文自然语言),支持 FIM 代码补全。适合单卡部署。
| 版本 | 参数量 | 大小 | 上下文 | Hugging Face | Ollama |
|---|---|---|---|---|---|
| Coder 1.3B | 1.3B | 776MB | 16K | deepseek-coder-1.3b-instruct | ollama pull deepseek-coder:1.3b |
| Coder 6.7B | 6.7B | 3.8GB | 16K | deepseek-coder-6.7b-instruct | ollama pull deepseek-coder:6.7b |
| Coder 33B | 33B | 19GB | 16K | deepseek-coder-33b-instruct | ollama pull deepseek-coder:33b |
DeepSeek Janus-Pro — 统一多模态理解与生成
DeepSeek Janus-Pro-7B 是 DeepSeek 最新开源的统一多模态模型,同时支持图像理解和文本到图像生成。其核心创新在于 解耦视觉编码(Decoupled Visual Encoding)技术——为"理解"和"生成"两条路径分别设计独立的视觉编码器,突破了传统统一多模态模型在理解和生成质量上的权衡困境。
解耦视觉编码架构
Janus-Pro 的核心创新是 Decoupled Visual Encoding——将视觉编码分为两条独立路径:
使用 SigLIP 编码器提取图像的高层语义特征,专注于语义级别的视觉理解。该编码器擅长捕捉图像中的物体类别、场景关系、文字内容等高级语义信息,为图像问答、视觉推理、图像描述等任务提供高质量的特征表示。
使用 VQ Tokenizer(向量量化分词器)将图像转换为离散的视觉 token 序列,用于图像生成。VQ Tokenizer 将连续像素空间映射到离散的 codebook 索引,使得语言模型可以像生成文本 token 一样自回归地生成视觉 token,最终解码为图像。
两条路径共享同一个 Transformer 语言模型作为"大脑",但视觉编码各自独立。这种设计避免了传统方案中单一编码器在理解和生成任务上的冲突,让 Janus-Pro 在两个方向上都达到顶尖水平。
图像生成能力
Janus-Pro-7B 支持 384×384 分辨率的文本到图像生成。其生成流程如下:
- 用户输入文本描述(prompt)
- 语言模型将文本转换为视觉 token 序列(通过 VQ Tokenizer 的 codebook)
- 自回归生成离散的视觉 token,每个 token 对应 codebook 中的一个索引
- VQ Tokenizer 解码器将 token 序列重构为 384×384 RGB 图像
虽然分辨率(384×384)不及专用图像生成模型(如 SDXL 的 1024×1024),但作为统一多模态模型,Janus-Pro 在理解与生成兼顾的场景下表现优异,生成质量接近专用模型。
多模态理解能力
Image Captioning
对任意图像生成准确、详细的自然语言描述。涵盖物体、场景、动作、颜色、空间关系等要素,支持中英文双语描述。
Visual Question Answering
针对图像内容回答自然语言问题。支持计数、比较、存在性判断、属性查询等多种问答类型,在 VQAv2、GQA 等基准上表现出色。
Visual Reasoning
对图像进行逻辑推理和因果分析。理解图像中隐含的关系、意图和事件因果链,支持"如果……会怎样"类的假设推理。
Text-to-Image Generation
根据文本描述生成 384×384 分辨率图像。覆盖人物、场景、物体、抽象概念等多种主题,支持风格化描述。
| 模型版本 | Janus(1.3B)/ Janus-Pro-7B(最新)/ JanusFlow(1.3B) |
| 参数量 | 1.3B(Janus)/ 7B(Janus-Pro-7B) |
| 核心架构 | 解耦视觉编码(Decoupled Visual Encoding)— 理解与生成路径独立 |
| 理解编码器 | SigLIP 编码器 — 提取高层语义特征,用于视觉理解 |
| 生成编码器 | VQ Tokenizer — 离散视觉 token 序列,用于图像生成 |
| 图像生成分辨率 | 384×384 像素 |
| 核心功能 | 统一多模态理解(图像描述/VQA/视觉推理)+ 文本到图像生成 |
| 开源协议 | MIT License |
| Hugging Face | Janus-Pro-7B | Janus-1.3B | JanusFlow-1.3B |
| GitHub | github.com/deepseek-ai/Janus |
| 适用场景 | 图像问答、图文理解、AI 绘画、多模态对话、视觉内容创作 |
推理代码示例
以下代码来自 GitHub 仓库 generation_inference.py,展示 Janus-Pro-7B 的多模态理解和图像生成:
import torch from transformers import AutoModelForCausalLM from janus.models import MultiModalityCausalLM, VLChatProcessor from PIL import Image # 1. 加载模型 model_path = "deepseek-ai/Janus-Pro-7B" vl_chat_processor = VLChatProcessor.from_pretrained(model_path) tokenizer = vl_chat_processor.tokenizer vl_gpt = AutoModelForCausalLM.from_pretrained( model_path, trust_remote_code=True, torch_dtype=torch.bfloat16, device_map="auto" ).eval() # 2. 多模态理解 — 图像问答 conversation = [ { "role": "<|User|>", "content": "<image_placeholder>\n这张图片中有什么?请详细描述。", "images": ["images/demo.jpg"], }, {"role": "<|Assistant|>", "content": ""}, ] prepare_inputs = vl_chat_processor( conversations=conversation, images=[Image.open("images/demo.jpg")], force_batchify=True ).to(vl_gpt.device) inputs_embeds = vl_gpt.prepare_inputs_embeds(**prepare_inputs) outputs = vl_gpt.language_model.generate( inputs_embeds=inputs_embeds, attention_mask=prepare_inputs.attention_mask, pad_token_id=tokenizer.eos_token_id, max_new_tokens=512, do_sample=False, ) answer = tokenizer.decode(outputs[0], skip_special_tokens=True) print(f"理解结果: {answer}") # 3. 图像生成 — 文本到图像 gen_conversation = [ { "role": "<|User|>", "content": "生成一张图片:一只可爱的橘猫坐在窗台上,阳光洒在它身上。", }, {"role": "<|Assistant|>", "content": ""}, ] gen_inputs = vl_chat_processor( conversations=gen_conversation, force_batchify=True ).to(vl_gpt.device) # 设置生成图像所需的特殊 token gen_inputs_embeds = vl_gpt.prepare_inputs_embeds(**gen_inputs) gen_outputs = vl_gpt.language_model.generate( inputs_embeds=gen_inputs_embeds, attention_mask=gen_inputs.attention_mask, pad_token_id=tokenizer.eos_token_id, max_new_tokens=2048, do_sample=True, temperature=0.8, ) # 解码生成的视觉 token 为图像 generated_tokens = gen_outputs[0] decoded_image = vl_gpt.gen_vision_model.decode_code( generated_tokens, shape=[384, 384] ) decoded_image.save("generated_cat.png") print("图像已保存为 generated_cat.png")
DeepSeek VL2 — Mixture-of-Experts 视觉语言模型
DeepSeek VL2 是 DeepSeek 开源的 MoE(Mixture-of-Experts)视觉语言模型,采用混合专家架构,在保持高效推理的同时实现强大的视觉理解能力。该模型支持动态分辨率,可处理任意分辨率的图像,无需强制裁剪或缩放。
核心架构设计
DeepSeek VL2 采用 Mixture-of-Experts 视觉语言架构,由两大核心组件构成:
采用 SigLIP-SO400M + SAM-B 双编码器组合。SigLIP 负责高层次的语义理解,SAM-B 提供细粒度的像素级视觉特征。两者融合后可同时捕捉全局语义和局部细节,为动态分辨率处理和精确视觉定位奠定基础。
使用 DeepSeekMoE 作为语言基座——DeepSeek 自研的混合专家模型,每次推理仅激活部分专家参数,实现高效计算。视觉特征通过 MLP 投影器与语言模型的 token embedding 空间对齐,实现视觉-语言跨模态理解。
动态分辨率技术
DeepSeek VL2 的核心创新之一是 动态分辨率(Dynamic Resolution)支持。传统视觉语言模型通常将图像强制裁剪或缩放为固定尺寸(如 224×224 或 336×336),导致小文字模糊、宽高比失真。VL2 通过以下机制解决了这一问题:
- 自适应切块:根据图像原始宽高比和分辨率,自动将图像切分为多个子图块(tiles),每个子图块独立编码
- 全局缩略图:同时保留一张全局缩略图,用于捕捉整体构图和上下文信息
- 分辨率自适应:支持从低分辨率缩略图到高分辨率扫描件的任意分辨率输入,无需人工预处理
- 动态 token 分配:根据图像内容复杂度,智能分配视觉 token 数量——简单图表使用较少 token,密集文档使用更多 token
三种规格对比
VL2 提供三种规格,满足不同场景需求。所有规格均采用 MIT License 开源:
| 规格 | 激活参数 | 总参数 | 推荐场景 | 硬件要求 | Hugging Face |
|---|---|---|---|---|---|
| VL2-Tiny | 1.0B | ~3.4B | 移动端、边缘设备、轻量 OCR | 4GB 显存 | deepseek-vl2-tiny |
| VL2-Small | 2.8B | ~8.1B | 文档理解、图表分析、单卡部署 | 8GB 显存 | deepseek-vl2-small |
| VL2 | 4.5B | ~13.5B | 高精度 OCR、复杂推理、企业级部署 | 16GB 显存 | deepseek-vl2 |
关键能力
高精度文字提取
支持中英文及多语言 OCR,从照片、截图、扫描件中准确提取文字。动态分辨率确保小字体清晰可辨,适合文档数字化场景。
数据可视化解读
能够理解柱状图、折线图、饼图等可视化图表,提取数据趋势、数值关系和图表标题,并生成自然语言描述。
Visual Grounding
根据自然语言描述在图像中定位目标物体,输出精确的边界框坐标。支持指代表达理解(Referring Expression)和开放词汇检测。
Document QA
对 PDF、合同、发票等文档进行问答交互。理解文档结构和排版,精准回答关于文档内容的问题,支持多页文档分析。
| 模型版本 | VL2-Tiny(1.0B 激活)/ VL2-Small(2.8B 激活)/ VL2(4.5B 激活) |
| 架构类型 | Mixture-of-Experts 视觉语言模型(MoE VLM) |
| 视觉编码器 | SigLIP-SO400M + SAM-B(双编码器融合) |
| 语言模型 | DeepSeekMoE(混合专家语言模型) |
| 动态分辨率 | 支持,可处理任意分辨率图像,自适应切块 |
| 训练数据 | 视觉-语言交错数据(vision-language interleaved data) |
| 开源协议 | MIT License |
| 论文 | DeepSeek_VL2_paper.pdf(GitHub) |
| GitHub | github.com/deepseek-ai/DeepSeek-VL2 |
| 适用场景 | 图片内容识别、文档 OCR、截图分析、图表数据提取、视觉定位、文档问答 |
推理代码示例
from transformers import AutoModelForCausalLM from deepseek_vl2.models import DeepseekVLV2Processor, DeepseekVLV2ForCausalLM import torch # 1. 加载模型与处理器 model_path = "deepseek-ai/deepseek-vl2-small" vl_chat_processor = DeepseekVLV2Processor.from_pretrained(model_path) tokenizer = vl_chat_processor.tokenizer vl_gpt = DeepseekVLV2ForCausalLM.from_pretrained( model_path, trust_remote_code=True, torch_dtype=torch.bfloat16, device_map="auto" ).cuda().eval() # 2. 多轮对话示例(支持动态分辨率图像) conversation = [ { "role": "User", "content": "<image>\n请描述这张图片的内容,并提取其中的文字。", "images": ["./document.png"] }, { "role": "Assistant", "content": "这是一份财务报告..." }, { "role": "User", "content": "<image>\n这张图表中的趋势是什么?", "images": ["./chart.png"] }, ] # 3. 准备输入并推理 prepare_inputs = vl_chat_processor( conversations=conversation, images=["./document.png", "./chart.png"], force_batchify=True ).to(device=vl_gpt.device, dtype=vl_gpt.dtype) # 4. 生成回答 inputs_embeds = vl_gpt.prepare_inputs_embeds(**prepare_inputs) outputs = vl_gpt.language_model.generate( inputs_embeds=inputs_embeds, attention_mask=prepare_inputs.attention_mask, max_new_tokens=512, do_sample=False, ) answer = tokenizer.decode(outputs[0], skip_special_tokens=True) print(answer)
DeepSeek Prover V2 — 数学定理证明
专注于形式化数学定理证明的模型。在 Lean 4 证明助手中实现自动化证明,代表着 AI 在数学推理领域的前沿探索。
| 模型名称 | DeepSeek Prover V2 |
| 基座模型 | DeepSeekMath-Base 7B |
| 证明系统 | Lean 4 |
| 开源协议 | MIT License |
| Hugging Face | deepseek-ai/DeepSeek-Prover-V2 |
| GitHub | github.com/deepseek-ai/DeepSeek-Prover-V2 |
| 适用场景 | 数学定理证明、形式化验证、数学教育、学术研究 |
DeepSeek 开源模型快速对比
一张表看清所有 DeepSeek 开源模型的区别,快速找到你需要的模型。
| 模型系列 | 类型 | 参数量 | 最小规格 | Ollama | 下载量 |
|---|---|---|---|---|---|
| DeepSeek V3 | 通用对话 | 671B | 404GB | 支持 | 3.8M+ |
| DeepSeek R1 | 推理增强 | 1.5B~671B | 1.1GB | 支持 | 88.3M+ |
| DeepSeek Coder | 代码生成 | 1.3B~236B | 776MB | 支持 | 4.2M+ |
| DeepSeek Janus | 多模态 | 1.3B~7B | ~800MB | HuggingFace | — |
| DeepSeek VL2 | 视觉语言 | 1.0B~4.5B | ~2GB | HuggingFace | — |
| DeepSeek Prover V2 | 数学证明 | 7B | ~15GB | HuggingFace | — |
| DeepSeek V4.1-Flash | 多模态 | 552B | — | HuggingFace | — |
| DeepSeek V3.2 | 通用对话 | 685B | ~404GB | 支持 | — |
| DeepSeek V3.1 | 通用对话 | 685B | ~404GB | 支持 | — |
DeepSeek 模型 Benchmark 性能排行
以下是 DeepSeek 核心模型在主流基准测试上的表现。数据来源:DeepSeek 官方技术报告。V3、R1(完整版 671B)、Coder(V2 版本)得分对比,让你一目了然各模型的强项。
| Benchmark | 类别 | DeepSeek V3 | DeepSeek R1 | DeepSeek Coder |
|---|---|---|---|---|
| MMLU | 通用知识 | 88.5 | 90.8 | 79.4 |
| MMLU-Pro | 进阶知识 | 75.9 | 84.0 | — |
| GPQA Diamond | 研究生级问答 | 59.1 | 71.5 | — |
| MATH-500 | 数学推理 | 90.2 | 97.3 | — |
| AIME 2024 | 数学竞赛 | 39.2 | 79.8 | — |
| HumanEval | 代码生成 | 82.6 | 96.3 | 81.1 |
| LiveCodeBench | 实战编程 | 49.2 | 65.9 | 43.8 |
DeepSeek-V4.1-Flash 最新基准(2026.09)
2026 年 9 月 10 日发布的 V4.1-Flash 基于全新 CED 非对称架构,在推理、编程与 Agent 长链路任务上全面超越上一代旗舰 V4 Pro:
| Benchmark | 类别 | DeepSeek-V4.1-Flash |
|---|---|---|
| GPQA Diamond | 研究生级问答 | 90.9 |
| Codeforces | 竞赛编程(ELO) | 3471 |
| Terminal-Bench 2.1 | Agent 终端任务 | 90.6 |
| CyberGym | 安全攻防 | 88.1 |
* 以上数据来自 DeepSeek 官方发布说明。官方称 V4.1-Flash 在这四项基准上全面超越上一代旗舰 V4 Pro(V4 Pro 具体数值未公开),同时 KV Cache 的 HBM 需求降至上一代的 1/4、SSD 需求降至 1/8。
所有分数来自 DeepSeek 官方技术报告。V3 和 R1 为 671B 完整版得分,Coder 为 V2 版本得分。「—」表示官方未公开此项数据。R1 在推理和数学 Benchmark 上全面领先,V3 在通用任务上表现均衡。
R1 在 AIME 2024 数学竞赛上得分是 V3 的 2 倍(79.8 vs 39.2);在 HumanEval 代码生成上达到 96.3%,接近满分。V3 性价比极高,以 557 万美元训练成本实现顶级性能。
V4.1-Flash 把 GPQA Diamond 推到 90.9、Codeforces 达到 3471 ELO,Agent 终端任务 Terminal-Bench 2.1 拿下 90.6。相比 V3 时代的 59.1 / 39.2 分档,两年间开源模型的推理与执行能力提升显著。
DeepSeek 模型训练数据揭秘
DeepSeek 各模型的训练数据规模和构成,是理解模型能力边界的关键。以下整理了 DeepSeek 核心开源模型的训练数据详情,所有数据均来自 DeepSeek 官方技术报告和 GitHub 仓库。
| 模型 | 训练数据规模 | 数据构成 | 数据来源 | 训练方式 |
|---|---|---|---|---|
| DeepSeek V3 | 14.8T tokens | 多语言语料(中英为主,覆盖多语种) | 互联网公开文本、书籍、学术论文、代码仓库 | 预训练 + 多阶段 SFT + RLHF |
| DeepSeek R1 | V3 基座 + 800k 精选推理样本 | 强化学习训练数据 + 800k 精选推理样本(用于蒸馏) | RL 自生成推理链 + 人工精选高质量推理样本 | RL 强化学习 + 知识蒸馏 |
| DeepSeek Coder | 2T tokens | 87% 代码 + 13% 中英文自然语言 | GitHub 代码仓库、Stack Overflow、技术文档 | 预训练 + FIM(Fill-in-the-Middle)训练 |
| DeepSeek VL2 | 视觉-语言交错数据 | 图像-文本对 + 图文交错文档 + 多模态指令数据 | 公开图像数据集、文档扫描件、图表数据 | 多模态预训练 + 视觉指令微调 |
| DeepSeek Janus | 多模态理解 + 图像生成数据 | 图像描述 / VQA / 文本-图像对 / 视觉推理数据 | 公开多模态数据集 + 合成图像生成数据 | 多模态预训练 + 解耦视觉编码训练 |
| DeepSeek Prover V2 | Lean 4 形式化证明数据 | Lean 4 定理证明语料 + 形式化数学库 | Mathlib 数学库 + 自动生成的形式化证明 | 预训练 + 证明搜索 + 强化学习 |
V3 以 14.8T tokens 的训练数据量领跑,覆盖多语言和多领域。Coder V2 使用 2T tokens 专注代码领域训练。R1 在 V3 基座上通过 RL + 800k 精选推理样本 实现推理突破,数据效率极高。
DeepSeek Coder 的 87% 代码 + 13% 自然语言 配比是其成功的关键——高比例代码数据确保编程能力,少量自然语言数据保持对话流畅性。VL2 和 Janus 的视觉-语言交错数据是实现多模态理解的基础。
DeepSeek 模型开源社区影响力
DeepSeek 开源模型在全球 AI 社区产生了巨大影响力。以下是截至 2026 年中的关键社区数据,展示 DeepSeek 在 GitHub、Hugging Face、Ollama 等平台上的受欢迎程度。
GitHub 仓库星标
Hugging Face 平台数据
| DeepSeek-V3 | 累计下载量最高,Hugging Face 月度下载量排名前列 |
| DeepSeek-R1-Distill-Qwen-1.5B | Hugging Face 上最受欢迎的蒸馏版,下载量极高 |
| Janus-Pro-7B | 多模态模型中最受欢迎,喜欢数(likes)持续增长 |
| 全系列模型 | DeepSeek 在 Hugging Face 上发布了 30+ 个模型权重,涵盖所有系列 |
Ollama 平台下载量
DeepSeek R1
35 个版本规格,Ollama 下载量最高的模型之一
DeepSeek Coder
代码模型中最受欢迎的选择
DeepSeek V3
671B 完整版,单模型下载量创新高
全系列总下载量
DeepSeek 全系列在 Ollama 累计下载量突破 1 亿
Awesome DeepSeek Integration
社区维护的 Awesome DeepSeek Integration 项目已成为 DeepSeek 生态的重要入口,整合了 DeepSeek API 和开源模型在各类应用中的集成方案:
- 624+ 次提交(commits),持续活跃更新
- 覆盖 5 种语言的集成文档和示例代码
- 涵盖聊天客户端、RAG 框架、Agent 平台、编程插件等 50+ 种集成方式
- 社区贡献者和 Fork 数量持续增长,已成为 DeepSeek 生态的核心枢纽
社区贡献生态
Fork 与 PR
DeepSeek 核心仓库累计获得数千次 Fork,社区提交了大量 PR 用于改进文档、修复 Bug、优化推理性能、添加新功能支持。
生态扩展
vLLM、SGLang、Ollama、LM Studio、llama.cpp 等主流推理框架均已原生支持 DeepSeek 模型,降低部署门槛。
知识共享
全球开发者贡献了大量中英文教程、视频、博客文章,覆盖从入门到精通的各个层次,帮助更多人快速上手 DeepSeek。
模型衍生
基于 DeepSeek 开源模型微调、蒸馏、合并的衍生模型不断涌现,覆盖医疗、法律、金融、教育等垂直领域。
持续快速迭代
从 V3 到 V3.1、V3.2,再到 V4 Flash 与 V4.1-Flash,DeepSeek 在两年内持续更新开源主线,并始终保持 MIT 协议不变。
平滑过渡机制
V4 Flash 于 2026 年 9 月 10 日退役后,原有 API 请求自动由 V4.1-Flash 承接并按 Flash 价格计费,调用代码无需修改。
了解更多
DeepSeek 模型选型指南
面对众多 DeepSeek 模型不知道怎么选?以下按场景、硬件、需求三个维度帮你快速找到最适合的模型。
按场景选择
DeepSeek V3
通用对话、写作、翻译、知识问答首选。671B MoE 架构,回答质量高,覆盖面广。
DeepSeek Coder / R1
代码生成选 Coder 6.7B;复杂编程推理选 R1 32B。HumanEval 96.3%,代码能力顶尖。
DeepSeek R1 / Prover V2
数学解题选 R1 32B+,AIME 2024 得分 79.8。形式化定理证明选 Prover V2。
DeepSeek Janus / VL2
图像理解+生成选 Janus-Pro-7B;纯视觉理解/OCR 选 VL2。解耦视觉编码,理解生成两不误。
DeepSeek V3 / R1 / Prover
综合研究选 V3 或 R1;数学证明方向选 Prover V2。全部 MIT 协议,可自由用于学术发表。
DeepSeek V4.1-Flash
需要 1M 上下文、原生多模态或长链路 Agent 任务时选它。缓存命中输入低至 ¥0.02/百万 tokens,是当前性价比最高的开源旗舰。
按硬件选择
R1-Distill-Qwen-1.5B
仅 1.1GB,无需显卡,纯 CPU 即可运行。适合低配设备尝鲜体验推理能力。
ollama run deepseek-r1:1.5bR1-8B / R1-7B / Coder 6.7B
最推荐的入门配置。R1-0528-Qwen3-8B(5.2GB)为最新推理模型,Coder 6.7B(3.8GB)专注编程。
ollama run deepseek-r1:8bR1-14B / Coder 33B
R1-Distill-Qwen-14B(9.0GB)推理能力显著提升;Coder 33B(19GB)需 16GB+ 显存。
ollama run deepseek-r1:14bR1-32B
R1-Distill-Qwen-32B(20GB)是性能和资源的最佳平衡点。推理能力接近完整版,单卡可跑。
ollama run deepseek-r1:32bR1-70B / R1-671B / V3
R1-70B(43GB)需 48GB+;R1-671B 和 V3(404GB)需多卡集群。可用 vLLM 或 SGLang 部署。
按需求选择
V4.1-Flash / V3.2
想用最新能力,API 侧选 V4.1-Flash(1M 上下文、原生多模态)或 V3.2(最便宜的顶级模型);本地部署仍建议从 R1 蒸馏版起步。
查看下载方式 →DeepSeek 开源模型常见问题
本页最后更新:2026 年 9 月 13 日。