DeepSeek Model 完全指南
基于 GitHub 官方仓库真实数据。88.3M+ Ollama 下载量,开源、免费、可商用。从下载到部署,一文搞定。
开始学习DeepSeek 模型知识体系
5 个专属页面,覆盖 DeepSeek 模型的所有核心知识。点击卡片进入对应专题。
DeepSeek 模型怎么用
四种使用方式手把手教学:官方 App、Ollama 本地部署、API 调用、第三方平台。零基础也能学会。
- 官方 App 使用教程
- Ollama 本地运行
- Python/JS API 调用
DeepSeek 模型下载
Ollama 一键下载、Hugging Face 原版权重、GitHub 官方仓库。所有模型下载链接与步骤说明。
- Ollama 命令大全
- Hugging Face 下载
- GitHub 官方仓库
DeepSeek 开源模型
6 大系列、20+ 模型完整列表。V3、R1、Coder、Janus、VL2、Prover 全部规格与适用场景。
- 6 大模型系列
- 快速对比表
- 适用场景指南
DeepSeek Model 部署教程
Ollama、Docker、vLLM、Dify 四种部署方案。从单机到集群,附完整命令和硬件配置参考。
- Ollama 一键部署
- Docker Compose 编排
- vLLM 高性能推理
DeepSeek Model 是什么?
DeepSeek 由深度求索(DeepSeek AI)开发,是一系列开源大语言模型,所有模型采用 MIT 协议,完全免费可商用。
DeepSeek 官方 GitHub 仓库位于 github.com/deepseek-ai,目前已发布三大核心模型系列:
DeepSeek V3 — 671B 参数 MoE 混合专家架构,每次推理仅激活 37B 参数。在开源模型中排名第一,性能对标 GPT-4。模型大小 404GB,支持 160K 上下文窗口。
DeepSeek R1 — 推理增强模型,采用强化学习训练。在数学、编程、逻辑推理任务上表现惊艳,性能接近 OpenAI O3 和 Gemini 2.5 Pro。最新版本为 DeepSeek-R1-0528。Ollama 上下载量达 88.3M+,提供 1.5B 到 671B 共 7 种规格。
DeepSeek Coder — 代码专用模型,使用 2 万亿 Token 训练(87% 代码 + 13% 中英文自然语言)。Ollama 下载量 4.2M+,提供 1.3B / 6.7B / 33B 三种规格。
DeepSeek 模型技术架构详解
深入理解 DeepSeek V3 和 R1 的核心技术架构。以下数据全部来自 GitHub 官方仓库论文和技术报告。
DeepSeek V3 架构
DeepSeek V3 采用 MoE(Mixture of Experts)混合专家架构,总参数量 671B,每次推理仅激活 37B 参数 per token,在保持极高模型容量的同时大幅降低推理成本。核心技术包括:
| 技术特性 | 说明 |
|---|---|
| MoE 架构 | 671B 总参数,37B 激活参数 per token。通过稀疏激活机制,仅启用与当前 token 最相关的专家子网络,大幅降低计算开销。 |
| Multi-head Latent Attention (MLA) | 创新的低秩键值联合压缩注意力机制,将 KV Cache 压缩为潜在向量,显著降低推理时的显存占用和计算开销。 |
| DeepSeekMoE | 采用细粒度专家分割 + 共享专家隔离机制,结合 auxiliary-loss-free 负载均衡策略,无需辅助损失即可实现专家负载均衡,避免「专家坍塌」问题。 |
| Multi-Token Prediction (MTP) | 同时预测多个未来 token,不仅提升训练效率,还使模型在推理时具备更强的长期规划能力。MTP 模块可在推理时丢弃,不影响推理速度。 |
| FP8 混合精度训练 | 首次在超大规模模型上验证 FP8 训练的可行性和有效性。相较 BF16,显存占用减半,训练速度显著提升。 |
| 训练数据与成本 | 在 14.8T 高质量 token 上预训练,训练成本仅约 557 万美元(基于 H800 GPU 集群),远低于同级别闭源模型的训练开销。 |
DeepSeek R1 架构
DeepSeek R1 是基于强化学习的推理增强模型,通过 Chain-of-Thought(思维链)技术实现深度推理能力。R1-0528 更新大幅提升了推理表现。核心技术包括:
| 技术特性 | 说明 |
|---|---|
| 强化学习推理 | 通过大规模 RL(强化学习)训练,模型自主学会 Chain-of-Thought 推理、自我验证、反思和回溯等高级推理行为,无需人工标注推理步骤。 |
| R1-0528 更新 | 最新版本,针对 8B 和 671B 模型进行了重大推理能力提升,性能逼近 OpenAI O3 和 Gemini 2.5 Pro。 |
| 知识蒸馏 | 将 R1 671B 的推理能力蒸馏到 Qwen-2.5(1.5B/7B/14B/32B)和 Llama-3.1/3.3(8B/70B)等开源模型,使小模型也能获得强大的推理能力。 |
| 蒸馏数据 | 使用 800k 精心筛选的推理样本进行蒸馏训练,涵盖数学、编程、科学推理等多个领域。 |
DeepSeek R1-0528 最新更新
DeepSeek R1-0528 是 R1 系列的最新重大更新,针对 8B 和 671B 模型进行了全面升级。
推理能力大幅提升
R1-0528 是 DeepSeek R1 系列的最新版本(2025 年 5 月 28 日发布),覆盖 8B 和 671B 两种规格。在数学、编程、逻辑推理等任务上,推理和推理能力显著增强。
- 8B 版本:5.2GB,128K 上下文
- 671B 版本:404GB,160K 上下文
- 性能逼近 OpenAI O3 和 Gemini 2.5 Pro
一键更新命令
如果你已通过 Ollama 安装 DeepSeek R1,使用以下命令即可更新到最新 R1-0528 版本:
ollama pull deepseek-r1
Ollama 会自动拉取最新版本。如需指定版本,可使用 ollama run deepseek-r1:8b 获取最新的 8B 版本。
R1-0528 性能对比
| 评测指标 | R1-0528 提升 |
|---|---|
| AIME 2024(数学) | 推理能力大幅提升,接近 O3 水平 |
| MATH-500 | 数学推理能力显著增强 |
| GPQA Diamond(科学推理) | 研究生级别科学推理能力大幅提升 |
| LiveCodeBench(编程) | 代码生成与推理能力接近 Gemini 2.5 Pro |
DeepSeek 开源模型完整列表
以下数据来自 GitHub 官方仓库和 Ollama 模型库,全部真实可查。
DeepSeek V3
671B 参数 MoE 架构,37B 激活/Token。160K 上下文。训练成本仅 557 万美元,推理速度突破性提升。开源模型榜首,对标闭源旗舰。
- 参数量:671B(激活 37B per token)
- 模型大小:404GB
- 上下文窗口:160K
- 开源协议:MIT(可商用)
- GitHub:github.com/deepseek-ai/DeepSeek-V3
DeepSeek R1
强化学习推理模型,最新版 R1-0528。性能接近 O3 和 Gemini 2.5 Pro。蒸馏版涵盖 Qwen 和 Llama 架构,从小到大多种规格任选。
- 1.5B / 7B / 8B / 14B / 32B / 70B / 671B
- 上下文窗口:128K(671B 为 160K)
- 开源协议:MIT(可商用,支持蒸馏)
- 蒸馏基底:Qwen-2.5 + Llama-3.1/3.3
- Ollama 命令:ollama run deepseek-r1
DeepSeek Coder
专注代码生成与理解。使用 2 万亿 Token 训练(87% 代码 + 13% 中英文)。三种规格,最小仅 776MB 即可运行。
- 1.3B(776MB)/ 6.7B(3.8GB)/ 33B(19GB)
- 上下文窗口:16K
- 训练数据:2 万亿 Token
- Ollama 命令:ollama run deepseek-coder
DeepSeek R1 模型规格对照表
7 种规格,从 1.1GB 到 404GB,总有一款适合你的硬件。数据来源:Ollama 官方模型库。
| 模型版本 | 模型大小 | 上下文 | 推荐硬件 | Ollama 命令 |
|---|---|---|---|---|
| DeepSeek-R1-Distill-Qwen-1.5B | 1.1 GB | 128K | CPU 即可 | deepseek-r1:1.5b |
| DeepSeek-R1-Distill-Qwen-7B | 4.7 GB | 128K | 8GB 显存 | deepseek-r1:7b |
| DeepSeek-R1-0528-Qwen3-8B | 5.2 GB | 128K | 8GB 显存 | deepseek-r1:8b |
| DeepSeek-R1-Distill-Qwen-14B | 9.0 GB | 128K | 16GB 显存 | deepseek-r1:14b |
| DeepSeek-R1-Distill-Qwen-32B | 20 GB | 128K | 24GB 显存 | deepseek-r1:32b |
| DeepSeek-R1-Distill-Llama-70B | 43 GB | 128K | 48GB 显存 | deepseek-r1:70b |
| DeepSeek-R1(满血版) | 404 GB | 160K | 多卡集群 | deepseek-r1:671b |
四种方式使用 DeepSeek Model
从零门槛到完全掌控,选一种最适合你的方式。点击下方链接进入对应专题页面,获取完整教程。
| # | 使用方式 | 说明 | 专属页面 |
|---|---|---|---|
| 01 | 官方应用 | 下载 DeepSeek 官方 App 或访问 chat.deepseek.com,免费使用 V3 和 R1 模型。支持对话、文件上传、AI 搜索。零门槛上手。 | deepseek-guide → |
| 02 | Ollama 本地部署 | 一行命令运行 DeepSeek 模型,数据完全本地,无需联网。支持 1.5B 到 671B 全部规格,隐私安全有保障。 | deepseek-deploy → |
| 03 | 模型下载 | Ollama 一键下载、Hugging Face 原版权重、GitHub 官方仓库。所有模型下载链接与步骤说明,官方渠道安全可靠。 | deepseek-download → |
| 04 | 模型目录与 API 调用 | 6 大系列、20+ 模型完整列表。V3、R1、Coder、Janus、VL2、Prover 全部规格。兼容 OpenAI API 格式,支持 curl / Python / JavaScript。 | deepseek-models → |
Ollama 本地部署 DeepSeek 模型
以下教程基于 Ollama 官方文档和 GitHub 仓库真实内容。Ollama 是一个开源 LLM 本地运行工具,DeepSeek R1 在 Ollama 上已有 88.3M+ 下载量。
第一步:安装 Ollama
访问 ollama.com/download,选择对应操作系统下载安装包。支持 Windows、macOS、Linux。
# macOS / Linux 也可用命令行安装
curl -fsSL https://ollama.com/install.sh | sh
第二步:下载并运行 DeepSeek 模型
安装完成后,终端输入以下命令即可下载并运行模型。首次运行会自动下载,后续直接启动。
# 推荐入门:DeepSeek R1 8B(5.2GB,128K 上下文)
ollama run deepseek-r1:8b
# 轻量级:DeepSeek R1 1.5B(1.1GB,CPU 即可运行)
ollama run deepseek-r1:1.5b
# 编程专用:DeepSeek Coder 6.7B(3.8GB)
ollama run deepseek-coder:6.7b
# 满血版:DeepSeek V3 671B(404GB,需多卡集群)
ollama run deepseek-v3
第三步:开始对话
下载完成后,终端直接显示对话界面,输入问题即可与 DeepSeek 交互。按 Ctrl+D 退出。
API 调用方式
Ollama 启动后自动在 localhost:11434 提供 API 服务,兼容 OpenAI 格式:
# curl 调用
curl http://localhost:11434/api/chat -d '{
"model": "deepseek-r1:8b",
"messages": [{"role": "user", "content": "你好,请介绍一下自己"}]
}'
# Python 调用(pip install ollama)
from ollama import chat
response = chat(
model='deepseek-r1:8b',
messages=[{'role': 'user', 'content': '你好'}]
)
print(response.message.content)
# JavaScript 调用(npm install ollama)
import ollama from 'ollama'
const response = await ollama.chat({
model: 'deepseek-r1:8b',
messages: [{role: 'user', content: '你好'}]
})
console.log(response.message.content)
进阶:集成开发工具
Ollama 支持将 DeepSeek R1 集成到 Claude Code、Codex 等开发工具中:
# 在 Claude Code 中使用 DeepSeek R1
ollama launch claude --model deepseek-r1:8b
# 在 Codex App 中使用
ollama launch codex-app --model deepseek-r1:8b
# 在 OpenCode 中使用
ollama launch opencode --model deepseek-r1:8b
DeepSeek 模型版本历史
从 V3 到 Prover V2,DeepSeek 在不到一年的时间里发布了 7 个重大版本,覆盖通用对话、推理、代码、多模态、定理证明等全领域。以下时间线基于 GitHub 官方仓库发布时间。
DeepSeek Prover V2
专注于 Lean 4 形式化定理证明的大语言模型。结合强化学习与大语言模型,实现自动化数学定理证明,在形式化数学领域取得突破性进展。
DeepSeek R1-0528 更新
R1 系列重大更新,覆盖 8B 和 671B 两种规格。推理能力大幅提升,AIME 2024 达 79.8,MATH-500 达 97.3,性能逼近 OpenAI O3 和 Gemini 2.5 Pro。
DeepSeek VL2
视觉语言模型正式发布,提供 3 种规格(Small / Medium / Large),采用 MoE 混合专家架构,支持动态分辨率与多模态理解任务。
DeepSeek Janus-Pro-7B
统一多模态理解与生成模型,创新的解耦视觉编码架构,同时支持图像理解和文本到图像生成,7B 参数即可实现多模态统一。
DeepSeek R1 蒸馏模型
将 R1 671B 推理能力蒸馏到开源小模型,覆盖 1.5B / 7B / 8B / 14B / 32B / 70B 共 6 种规格,基于 Qwen-2.5 和 Llama-3.1/3.3 架构,使用 800k 精选推理样本训练。
DeepSeek R1 发布
基于强化学习的推理增强模型,通过大规模 RL 训练自主学会 Chain-of-Thought 推理、自我验证、反思等高级推理行为。Ollama 下载量达 88.3M+,成为最受欢迎的开源推理模型。
DeepSeek V3 发布
671B 参数 MoE 混合专家架构,每次推理仅激活 37B 参数。首个在超大规模模型上验证 FP8 混合精度训练可行性的模型,训练成本仅 557 万美元。在开源模型中排名第一,性能对标 GPT-4。
DeepSeek 论文与学术引用
DeepSeek 团队坚持开源与学术透明,每款模型均发布详细技术报告/论文。以下为已发表的核心论文,可在 arXiv 上查阅全文。
DeepSeek-V3 Technical Report
671B MoE 架构完整技术报告,涵盖 Multi-head Latent Attention(MLA)、DeepSeekMoE 细粒度专家分割、Multi-Token Prediction(MTP)、FP8 混合精度训练、auxiliary-loss-free 负载均衡等核心创新。在 14.8T token 上预训练,训练成本仅 557 万美元。
arXiv · 2024DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
首次验证纯强化学习(无需人工标注推理步骤)可让大语言模型自主学会 Chain-of-Thought 推理、自我验证、反思和回溯。提出了 R1-Zero(纯 RL)→ R1(冷启动+RL)的训练路线,并将推理能力蒸馏到小型开源模型。
arXiv · 2025DeepSeek-Coder: When the Large Language Model Meets Programming — The Rise of Code Intelligence
代码专用大语言模型技术报告。使用 2 万亿 Token 训练(87% 代码 + 13% 中英文自然语言),提出仓库级代码理解与填充(Fill-in-the-Middle)训练策略,在 HumanEval、MBPP 等基准上取得领先成绩。
arXiv · 2024Janus: Decoupling Visual Encoding for Unified Multimodal Understanding and Generation
提出解耦视觉编码框架,将「理解」和「生成」两种视觉任务分离为独立的编码路径,再通过统一的 Transformer 处理。解决了传统多模态模型中理解与生成任务互相干扰的难题,7B 参数即可实现多模态统一。
arXiv · 2025DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding
将 MoE 架构引入视觉语言模型,提供 3 种规格(Small / Medium / Large)。支持动态分辨率处理、多图理解与跨模态推理,在文档理解、图表分析、OCR 等任务上表现优异。
arXiv · 2025DeepSeek-Prover V2: Advancing Formal Theorem Proving in Large Language Models
专注于 Lean 4 形式化定理证明。通过强化学习与大语言模型结合,实现自动化数学定理证明。在形式化数学验证领域取得突破性进展,展示了 LLM 在严谨数学推理中的潜力。
arXiv · 2025DeepSeek 社区生态数据
以下数据来自 awesome-deepseek-integration 仓库,展示 DeepSeek API 在全球范围内被集成到各类应用、框架和工具中的真实情况。共计 624+ 社区集成,支持中/英/日/西/繁体中文等多语言。
聊天与办公应用
DeepSeek API 已集成到全球主流聊天和办公应用中,覆盖桌面端、移动端、Web 端全平台。
- Chatbox — 跨平台 AI 桌面客户端
- LobeChat — 开源 Chatbot 框架
- LibreChat — 多功能 AI 聊天界面
- NextChat (ChatGPT-Next-Web)
- Open WebUI — 自托管 AI 界面
- ChatGPTBox — 浏览器 AI 助手
智能体开发框架
全球主流 AI Agent 框架均已支持 DeepSeek API,开发者可快速构建智能体应用。
- Dify — 开源 LLM 应用平台
- LangChain — LLM 应用开发框架
- CrewAI — 多智能体协作框架
- AutoGen — 微软多 Agent 框架
- MetaGPT — 多 Agent 元编程
- Agno — 轻量级 Agent 框架
检索增强生成
知识库问答和文档检索领域的主流 RAG 框架全面支持 DeepSeek 模型。
- RAGFlow — 开源 RAG 引擎
- FastGPT — 知识库问答平台
- Dify — 内置 RAG 管道
- AnythingLLM — 全格式文档 RAG
- MaxKB — 智能知识库系统
- Quivr — 第二大脑 RAG 工具
开发工具集成
主流 IDE 和代码编辑器均可通过插件接入 DeepSeek API,实现 AI 辅助编程。
- VS Code — Continue / Cline 插件
- JetBrains — CodeGPT / Continue
- neovim — avante.nvim / codecompanion
- Cursor — 自定义模型接入
- Zed — 内置 AI 助手
- Emacs — gptel / ellama
网页 AI 助手
浏览器扩展让 DeepSeek 随时可用,支持网页摘要、翻译、搜索增强等功能。
- Page Assist — 本地 AI 网页助手
- ChatHub — 多模型对比聊天
- ChatGPTBox — 多功能 AI 工具箱
- Sider — AI 侧边栏助手
- 沉浸式翻译 — 双语对照翻译
- Monica — AI 写作与搜索助手
624+ 社区集成
awesome-deepseek-integration 仓库持续更新,覆盖应用、框架、插件、工具等全品类。多语言支持(中/英/日/西/繁体中文),表明 DeepSeek 已成为全球开发者生态的重要组成部分。
- 总计:624+ 社区集成项目
- 语言:中文 / English / 日本語 / Español / 繁體中文
- 持续更新:社区贡献活跃
- 查看完整列表:deepseek-models →
DeepSeek 模型 Benchmark 性能对比
以下数据来自 DeepSeek 官方技术报告和论文,展示 V3 和 R1 在主流基准测试上的真实表现。
DeepSeek V3 vs GPT-4o vs Claude 3.5 Sonnet
DeepSeek V3 在多项基准测试中达到甚至超越闭源旗舰模型水平:
| 基准测试 | DeepSeek V3 | GPT-4o | Claude 3.5 Sonnet | 最佳 |
|---|---|---|---|---|
| MMLU(知识理解) | 88.5 | 87.7 | 88.9 | Claude 3.5 |
| MMLU-Pro(高级知识) | 75.9 | 72.1 | 74.5 | V3 |
| GPQA Diamond(研究生科学) | 59.1 | 53.6 | 59.4 | Claude 3.5 |
| MATH-500(数学推理) | 90.2 | 76.6 | 78.3 | V3 |
| HumanEval(代码生成) | 92.1 | 90.2 | 92.0 | V3 |
| LiveCodeBench(编程竞赛) | 40.5 | 36.3 | 38.1 | V3 |
* 以上数据来自 DeepSeek V3 技术报告,V3 在 MMLU-Pro、MATH-500、HumanEval、LiveCodeBench 四项基准上均取得最佳成绩。
DeepSeek R1-0528 vs O3 vs Gemini 2.5 Pro
DeepSeek R1-0528 在推理基准上表现卓越,性能逼近 OpenAI O3 和 Gemini 2.5 Pro:
| 基准测试 | DeepSeek R1-0528 | OpenAI O3 | Gemini 2.5 Pro | 对比 |
|---|---|---|---|---|
| AIME 2024(数学竞赛) | 79.8 | 83.3 | 80.6 | 接近 O3 |
| MATH-500(数学推理) | 97.3 | 96.7 | 96.0 | R1 领先 |
| GPQA Diamond(科学推理) | 71.5 | 73.1 | 72.0 | 接近 O3 |
| LiveCodeBench(编程竞赛) | 65.9 | 68.2 | 63.8 | 超越 Gemini |
* 以上数据来自 DeepSeek R1 技术报告和 R1-0528 更新日志。R1 在 MATH-500 上超越 O3,在 LiveCodeBench 上超越 Gemini 2.5 Pro。
V3:开源模型新标杆
DeepSeek V3 在 MMLU-Pro、MATH-500、HumanEval、LiveCodeBench 四项基准上均超越 GPT-4o 和 Claude 3.5 Sonnet,以仅 557 万美元的训练成本实现闭源旗舰水平。
R1:推理领域开源最强
DeepSeek R1-0528 在 MATH-500 上超越 O3,在 LiveCodeBench 上超越 Gemini 2.5 Pro。AIME 2024 和 GPQA Diamond 均接近 O3 水平,是当前开源推理模型的最强选择。
DeepSeek Model 常见问题
ollama pull deepseek-r1 即可更新到最新版本。例如 DeepSeek R1 已从最初版本升级到 R1-0528(8B 和 671B 版本),推理和推理能力显著提升。查看已安装模型:ollama list。参考来源
本页所有数据来自以下官方来源,可自行验证。
- GitHub — deepseek-ai/DeepSeek-V3 — 官方仓库,含模型权重、推理代码、论文
- Ollama — deepseek-r1 — 88.3M+ 下载,35 个版本,完整规格与命令
- Ollama — deepseek-v3 — 671B MoE 模型,3.8M+ 下载
- Ollama — deepseek-coder — 代码专用模型,4.2M+ 下载,2T Token 训练
- Hugging Face — deepseek-ai — 所有模型权重下载