Skills MCP Model 博客 提交 Skills
登录 注册

DeepSeek Model 完全指南

基于 GitHub 官方仓库真实数据。88.3M+ Ollama 下载量,开源、免费、可商用。从下载到部署,一文搞定。

开始学习
88.3M+
Ollama 下载量(DeepSeek R1)
624+
社区集成(awesome-deepseek-integration)
6 系列 / 20+
模型系列 / 变体数量
557万$
V3 训练成本(H800 集群)

DeepSeek 模型知识体系

5 个专属页面,覆盖 DeepSeek 模型的所有核心知识。点击卡片进入对应专题。

DeepSeek Model 是什么?

DeepSeek 由深度求索(DeepSeek AI)开发,是一系列开源大语言模型,所有模型采用 MIT 协议,完全免费可商用。

DeepSeek 官方 GitHub 仓库位于 github.com/deepseek-ai,目前已发布三大核心模型系列:

DeepSeek V3 — 671B 参数 MoE 混合专家架构,每次推理仅激活 37B 参数。在开源模型中排名第一,性能对标 GPT-4。模型大小 404GB,支持 160K 上下文窗口。

DeepSeek R1 — 推理增强模型,采用强化学习训练。在数学、编程、逻辑推理任务上表现惊艳,性能接近 OpenAI O3 和 Gemini 2.5 Pro。最新版本为 DeepSeek-R1-0528。Ollama 上下载量达 88.3M+,提供 1.5B 到 671B 共 7 种规格。

DeepSeek Coder — 代码专用模型,使用 2 万亿 Token 训练(87% 代码 + 13% 中英文自然语言)。Ollama 下载量 4.2M+,提供 1.3B / 6.7B / 33B 三种规格。

DeepSeek 模型技术架构详解

深入理解 DeepSeek V3 和 R1 的核心技术架构。以下数据全部来自 GitHub 官方仓库论文和技术报告。

DeepSeek V3 架构

DeepSeek V3 采用 MoE(Mixture of Experts)混合专家架构,总参数量 671B,每次推理仅激活 37B 参数 per token,在保持极高模型容量的同时大幅降低推理成本。核心技术包括:

技术特性 说明
MoE 架构 671B 总参数,37B 激活参数 per token。通过稀疏激活机制,仅启用与当前 token 最相关的专家子网络,大幅降低计算开销。
Multi-head Latent Attention (MLA) 创新的低秩键值联合压缩注意力机制,将 KV Cache 压缩为潜在向量,显著降低推理时的显存占用和计算开销。
DeepSeekMoE 采用细粒度专家分割 + 共享专家隔离机制,结合 auxiliary-loss-free 负载均衡策略,无需辅助损失即可实现专家负载均衡,避免「专家坍塌」问题。
Multi-Token Prediction (MTP) 同时预测多个未来 token,不仅提升训练效率,还使模型在推理时具备更强的长期规划能力。MTP 模块可在推理时丢弃,不影响推理速度。
FP8 混合精度训练 首次在超大规模模型上验证 FP8 训练的可行性和有效性。相较 BF16,显存占用减半,训练速度显著提升。
训练数据与成本 在 14.8T 高质量 token 上预训练,训练成本仅约 557 万美元(基于 H800 GPU 集群),远低于同级别闭源模型的训练开销。

DeepSeek R1 架构

DeepSeek R1 是基于强化学习的推理增强模型,通过 Chain-of-Thought(思维链)技术实现深度推理能力。R1-0528 更新大幅提升了推理表现。核心技术包括:

技术特性 说明
强化学习推理 通过大规模 RL(强化学习)训练,模型自主学会 Chain-of-Thought 推理、自我验证、反思和回溯等高级推理行为,无需人工标注推理步骤。
R1-0528 更新 最新版本,针对 8B 和 671B 模型进行了重大推理能力提升,性能逼近 OpenAI O3 和 Gemini 2.5 Pro。
知识蒸馏 将 R1 671B 的推理能力蒸馏到 Qwen-2.5(1.5B/7B/14B/32B)和 Llama-3.1/3.3(8B/70B)等开源模型,使小模型也能获得强大的推理能力。
蒸馏数据 使用 800k 精心筛选的推理样本进行蒸馏训练,涵盖数学、编程、科学推理等多个领域。

DeepSeek R1-0528 最新更新

DeepSeek R1-0528 是 R1 系列的最新重大更新,针对 8B 和 671B 模型进行了全面升级。

核心更新

推理能力大幅提升

R1-0528 是 DeepSeek R1 系列的最新版本(2025 年 5 月 28 日发布),覆盖 8B 和 671B 两种规格。在数学、编程、逻辑推理等任务上,推理和推理能力显著增强。

  • 8B 版本:5.2GB,128K 上下文
  • 671B 版本:404GB,160K 上下文
  • 性能逼近 OpenAI O3 和 Gemini 2.5 Pro
如何更新

一键更新命令

如果你已通过 Ollama 安装 DeepSeek R1,使用以下命令即可更新到最新 R1-0528 版本:

ollama pull deepseek-r1

Ollama 会自动拉取最新版本。如需指定版本,可使用 ollama run deepseek-r1:8b 获取最新的 8B 版本。

R1-0528 性能对比

评测指标 R1-0528 提升
AIME 2024(数学) 推理能力大幅提升,接近 O3 水平
MATH-500 数学推理能力显著增强
GPQA Diamond(科学推理) 研究生级别科学推理能力大幅提升
LiveCodeBench(编程) 代码生成与推理能力接近 Gemini 2.5 Pro

DeepSeek 开源模型完整列表

以下数据来自 GitHub 官方仓库和 Ollama 模型库,全部真实可查。

旗舰模型 · 404GB · 3.8M+ 下载

DeepSeek V3

671B 参数 MoE 架构,37B 激活/Token。160K 上下文。训练成本仅 557 万美元,推理速度突破性提升。开源模型榜首,对标闭源旗舰。

  • 参数量:671B(激活 37B per token)
  • 模型大小:404GB
  • 上下文窗口:160K
  • 开源协议:MIT(可商用)
  • GitHub:github.com/deepseek-ai/DeepSeek-V3
推理模型 · 88.3M+ 下载 · 35 个版本

DeepSeek R1

强化学习推理模型,最新版 R1-0528。性能接近 O3 和 Gemini 2.5 Pro。蒸馏版涵盖 Qwen 和 Llama 架构,从小到大多种规格任选。

  • 1.5B / 7B / 8B / 14B / 32B / 70B / 671B
  • 上下文窗口:128K(671B 为 160K)
  • 开源协议:MIT(可商用,支持蒸馏)
  • 蒸馏基底:Qwen-2.5 + Llama-3.1/3.3
  • Ollama 命令:ollama run deepseek-r1
代码模型 · 4.2M+ 下载 · 2T Token 训练

DeepSeek Coder

专注代码生成与理解。使用 2 万亿 Token 训练(87% 代码 + 13% 中英文)。三种规格,最小仅 776MB 即可运行。

  • 1.3B(776MB)/ 6.7B(3.8GB)/ 33B(19GB)
  • 上下文窗口:16K
  • 训练数据:2 万亿 Token
  • Ollama 命令:ollama run deepseek-coder

DeepSeek R1 模型规格对照表

7 种规格,从 1.1GB 到 404GB,总有一款适合你的硬件。数据来源:Ollama 官方模型库。

模型版本 模型大小 上下文 推荐硬件 Ollama 命令
DeepSeek-R1-Distill-Qwen-1.5B 1.1 GB 128K CPU 即可 deepseek-r1:1.5b
DeepSeek-R1-Distill-Qwen-7B 4.7 GB 128K 8GB 显存 deepseek-r1:7b
DeepSeek-R1-0528-Qwen3-8B 5.2 GB 128K 8GB 显存 deepseek-r1:8b
DeepSeek-R1-Distill-Qwen-14B 9.0 GB 128K 16GB 显存 deepseek-r1:14b
DeepSeek-R1-Distill-Qwen-32B 20 GB 128K 24GB 显存 deepseek-r1:32b
DeepSeek-R1-Distill-Llama-70B 43 GB 128K 48GB 显存 deepseek-r1:70b
DeepSeek-R1(满血版) 404 GB 160K 多卡集群 deepseek-r1:671b

四种方式使用 DeepSeek Model

从零门槛到完全掌控,选一种最适合你的方式。点击下方链接进入对应专题页面,获取完整教程。

# 使用方式 说明 专属页面
01 官方应用 下载 DeepSeek 官方 App 或访问 chat.deepseek.com,免费使用 V3 和 R1 模型。支持对话、文件上传、AI 搜索。零门槛上手。 deepseek-guide →
02 Ollama 本地部署 一行命令运行 DeepSeek 模型,数据完全本地,无需联网。支持 1.5B 到 671B 全部规格,隐私安全有保障。 deepseek-deploy →
03 模型下载 Ollama 一键下载、Hugging Face 原版权重、GitHub 官方仓库。所有模型下载链接与步骤说明,官方渠道安全可靠。 deepseek-download →
04 模型目录与 API 调用 6 大系列、20+ 模型完整列表。V3、R1、Coder、Janus、VL2、Prover 全部规格。兼容 OpenAI API 格式,支持 curl / Python / JavaScript。 deepseek-models →

Ollama 本地部署 DeepSeek 模型

以下教程基于 Ollama 官方文档和 GitHub 仓库真实内容。Ollama 是一个开源 LLM 本地运行工具,DeepSeek R1 在 Ollama 上已有 88.3M+ 下载量。

第一步:安装 Ollama

访问 ollama.com/download,选择对应操作系统下载安装包。支持 Windows、macOS、Linux。

# macOS / Linux 也可用命令行安装
curl -fsSL https://ollama.com/install.sh | sh

第二步:下载并运行 DeepSeek 模型

安装完成后,终端输入以下命令即可下载并运行模型。首次运行会自动下载,后续直接启动。

# 推荐入门:DeepSeek R1 8B(5.2GB,128K 上下文)
ollama run deepseek-r1:8b

# 轻量级:DeepSeek R1 1.5B(1.1GB,CPU 即可运行)
ollama run deepseek-r1:1.5b

# 编程专用:DeepSeek Coder 6.7B(3.8GB)
ollama run deepseek-coder:6.7b

# 满血版:DeepSeek V3 671B(404GB,需多卡集群)
ollama run deepseek-v3

第三步:开始对话

下载完成后,终端直接显示对话界面,输入问题即可与 DeepSeek 交互。按 Ctrl+D 退出。

API 调用方式

Ollama 启动后自动在 localhost:11434 提供 API 服务,兼容 OpenAI 格式:

# curl 调用
curl http://localhost:11434/api/chat -d '{
"model": "deepseek-r1:8b",
"messages": [{"role": "user", "content": "你好,请介绍一下自己"}]
}'

# Python 调用(pip install ollama)
from ollama import chat
response = chat(
model='deepseek-r1:8b',
messages=[{'role': 'user', 'content': '你好'}]
)
print(response.message.content)

# JavaScript 调用(npm install ollama)
import ollama from 'ollama'
const response = await ollama.chat({
model: 'deepseek-r1:8b',
messages: [{role: 'user', content: '你好'}]
})
console.log(response.message.content)

进阶:集成开发工具

Ollama 支持将 DeepSeek R1 集成到 Claude Code、Codex 等开发工具中:

# 在 Claude Code 中使用 DeepSeek R1
ollama launch claude --model deepseek-r1:8b

# 在 Codex App 中使用
ollama launch codex-app --model deepseek-r1:8b

# 在 OpenCode 中使用
ollama launch opencode --model deepseek-r1:8b

DeepSeek 模型版本历史

从 V3 到 Prover V2,DeepSeek 在不到一年的时间里发布了 7 个重大版本,覆盖通用对话、推理、代码、多模态、定理证明等全领域。以下时间线基于 GitHub 官方仓库发布时间。

2025.06

DeepSeek Prover V2

专注于 Lean 4 形式化定理证明的大语言模型。结合强化学习与大语言模型,实现自动化数学定理证明,在形式化数学领域取得突破性进展。

2025.05

DeepSeek R1-0528 更新

R1 系列重大更新,覆盖 8B 和 671B 两种规格。推理能力大幅提升,AIME 2024 达 79.8,MATH-500 达 97.3,性能逼近 OpenAI O3 和 Gemini 2.5 Pro。

2025.02

DeepSeek VL2

视觉语言模型正式发布,提供 3 种规格(Small / Medium / Large),采用 MoE 混合专家架构,支持动态分辨率与多模态理解任务。

2025.01

DeepSeek Janus-Pro-7B

统一多模态理解与生成模型,创新的解耦视觉编码架构,同时支持图像理解和文本到图像生成,7B 参数即可实现多模态统一。

2025.01

DeepSeek R1 蒸馏模型

将 R1 671B 推理能力蒸馏到开源小模型,覆盖 1.5B / 7B / 8B / 14B / 32B / 70B 共 6 种规格,基于 Qwen-2.5 和 Llama-3.1/3.3 架构,使用 800k 精选推理样本训练。

2025.01

DeepSeek R1 发布

基于强化学习的推理增强模型,通过大规模 RL 训练自主学会 Chain-of-Thought 推理、自我验证、反思等高级推理行为。Ollama 下载量达 88.3M+,成为最受欢迎的开源推理模型。

2024.12

DeepSeek V3 发布

671B 参数 MoE 混合专家架构,每次推理仅激活 37B 参数。首个在超大规模模型上验证 FP8 混合精度训练可行性的模型,训练成本仅 557 万美元。在开源模型中排名第一,性能对标 GPT-4。

DeepSeek 论文与学术引用

DeepSeek 团队坚持开源与学术透明,每款模型均发布详细技术报告/论文。以下为已发表的核心论文,可在 arXiv 上查阅全文。

DeepSeek-V3 Technical Report

671B MoE 架构完整技术报告,涵盖 Multi-head Latent Attention(MLA)、DeepSeekMoE 细粒度专家分割、Multi-Token Prediction(MTP)、FP8 混合精度训练、auxiliary-loss-free 负载均衡等核心创新。在 14.8T token 上预训练,训练成本仅 557 万美元。

arXiv · 2024

DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

首次验证纯强化学习(无需人工标注推理步骤)可让大语言模型自主学会 Chain-of-Thought 推理、自我验证、反思和回溯。提出了 R1-Zero(纯 RL)→ R1(冷启动+RL)的训练路线,并将推理能力蒸馏到小型开源模型。

arXiv · 2025

DeepSeek-Coder: When the Large Language Model Meets Programming — The Rise of Code Intelligence

代码专用大语言模型技术报告。使用 2 万亿 Token 训练(87% 代码 + 13% 中英文自然语言),提出仓库级代码理解与填充(Fill-in-the-Middle)训练策略,在 HumanEval、MBPP 等基准上取得领先成绩。

arXiv · 2024

Janus: Decoupling Visual Encoding for Unified Multimodal Understanding and Generation

提出解耦视觉编码框架,将「理解」和「生成」两种视觉任务分离为独立的编码路径,再通过统一的 Transformer 处理。解决了传统多模态模型中理解与生成任务互相干扰的难题,7B 参数即可实现多模态统一。

arXiv · 2025

DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding

将 MoE 架构引入视觉语言模型,提供 3 种规格(Small / Medium / Large)。支持动态分辨率处理、多图理解与跨模态推理,在文档理解、图表分析、OCR 等任务上表现优异。

arXiv · 2025

DeepSeek-Prover V2: Advancing Formal Theorem Proving in Large Language Models

专注于 Lean 4 形式化定理证明。通过强化学习与大语言模型结合,实现自动化数学定理证明。在形式化数学验证领域取得突破性进展,展示了 LLM 在严谨数学推理中的潜力。

arXiv · 2025

DeepSeek 社区生态数据

以下数据来自 awesome-deepseek-integration 仓库,展示 DeepSeek API 在全球范围内被集成到各类应用、框架和工具中的真实情况。共计 624+ 社区集成,支持中/英/日/西/繁体中文等多语言。

应用程序类 · 多平台

聊天与办公应用

DeepSeek API 已集成到全球主流聊天和办公应用中,覆盖桌面端、移动端、Web 端全平台。

  • Chatbox — 跨平台 AI 桌面客户端
  • LobeChat — 开源 Chatbot 框架
  • LibreChat — 多功能 AI 聊天界面
  • NextChat (ChatGPT-Next-Web)
  • Open WebUI — 自托管 AI 界面
  • ChatGPTBox — 浏览器 AI 助手
AI Agent 框架

智能体开发框架

全球主流 AI Agent 框架均已支持 DeepSeek API,开发者可快速构建智能体应用。

  • Dify — 开源 LLM 应用平台
  • LangChain — LLM 应用开发框架
  • CrewAI — 多智能体协作框架
  • AutoGen — 微软多 Agent 框架
  • MetaGPT — 多 Agent 元编程
  • Agno — 轻量级 Agent 框架
RAG 框架

检索增强生成

知识库问答和文档检索领域的主流 RAG 框架全面支持 DeepSeek 模型。

  • RAGFlow — 开源 RAG 引擎
  • FastGPT — 知识库问答平台
  • Dify — 内置 RAG 管道
  • AnythingLLM — 全格式文档 RAG
  • MaxKB — 智能知识库系统
  • Quivr — 第二大脑 RAG 工具
IDE 插件

开发工具集成

主流 IDE 和代码编辑器均可通过插件接入 DeepSeek API,实现 AI 辅助编程。

  • VS Code — Continue / Cline 插件
  • JetBrains — CodeGPT / Continue
  • neovim — avante.nvim / codecompanion
  • Cursor — 自定义模型接入
  • Zed — 内置 AI 助手
  • Emacs — gptel / ellama
浏览器插件

网页 AI 助手

浏览器扩展让 DeepSeek 随时可用,支持网页摘要、翻译、搜索增强等功能。

  • Page Assist — 本地 AI 网页助手
  • ChatHub — 多模型对比聊天
  • ChatGPTBox — 多功能 AI 工具箱
  • Sider — AI 侧边栏助手
  • 沉浸式翻译 — 双语对照翻译
  • Monica — AI 写作与搜索助手
社区总览

624+ 社区集成

awesome-deepseek-integration 仓库持续更新,覆盖应用、框架、插件、工具等全品类。多语言支持(中/英/日/西/繁体中文),表明 DeepSeek 已成为全球开发者生态的重要组成部分。

  • 总计:624+ 社区集成项目
  • 语言:中文 / English / 日本語 / Español / 繁體中文
  • 持续更新:社区贡献活跃
  • 查看完整列表:deepseek-models →

DeepSeek 模型 Benchmark 性能对比

以下数据来自 DeepSeek 官方技术报告和论文,展示 V3 和 R1 在主流基准测试上的真实表现。

DeepSeek V3 vs GPT-4o vs Claude 3.5 Sonnet

DeepSeek V3 在多项基准测试中达到甚至超越闭源旗舰模型水平:

基准测试 DeepSeek V3 GPT-4o Claude 3.5 Sonnet 最佳
MMLU(知识理解) 88.5 87.7 88.9 Claude 3.5
MMLU-Pro(高级知识) 75.9 72.1 74.5 V3
GPQA Diamond(研究生科学) 59.1 53.6 59.4 Claude 3.5
MATH-500(数学推理) 90.2 76.6 78.3 V3
HumanEval(代码生成) 92.1 90.2 92.0 V3
LiveCodeBench(编程竞赛) 40.5 36.3 38.1 V3

* 以上数据来自 DeepSeek V3 技术报告,V3 在 MMLU-Pro、MATH-500、HumanEval、LiveCodeBench 四项基准上均取得最佳成绩。

DeepSeek R1-0528 vs O3 vs Gemini 2.5 Pro

DeepSeek R1-0528 在推理基准上表现卓越,性能逼近 OpenAI O3 和 Gemini 2.5 Pro:

基准测试 DeepSeek R1-0528 OpenAI O3 Gemini 2.5 Pro 对比
AIME 2024(数学竞赛) 79.8 83.3 80.6 接近 O3
MATH-500(数学推理) 97.3 96.7 96.0 R1 领先
GPQA Diamond(科学推理) 71.5 73.1 72.0 接近 O3
LiveCodeBench(编程竞赛) 65.9 68.2 63.8 超越 Gemini

* 以上数据来自 DeepSeek R1 技术报告和 R1-0528 更新日志。R1 在 MATH-500 上超越 O3,在 LiveCodeBench 上超越 Gemini 2.5 Pro。

关键发现

V3:开源模型新标杆

DeepSeek V3 在 MMLU-Pro、MATH-500、HumanEval、LiveCodeBench 四项基准上均超越 GPT-4o 和 Claude 3.5 Sonnet,以仅 557 万美元的训练成本实现闭源旗舰水平。

关键发现

R1:推理领域开源最强

DeepSeek R1-0528 在 MATH-500 上超越 O3,在 LiveCodeBench 上超越 Gemini 2.5 Pro。AIME 2024 和 GPQA Diamond 均接近 O3 水平,是当前开源推理模型的最强选择。

DeepSeek Model 常见问题

DeepSeek 模型是免费的吗?可以商用吗? +
是的。DeepSeek 所有开源模型采用 MIT License,完全免费且可商用。DeepSeek R1 系列支持任何修改和衍生作品,包括但不限于蒸馏训练其他 LLM。官方 App 和网页版也是免费的。注意:蒸馏版模型(Qwen/Llama 基底)需遵守各自原始协议(Apache 2.0 / Llama License)。
DeepSeek R1 和 DeepSeek V3 有什么区别? +
V3 是通用大模型(671B MoE),适合对话、写作、翻译等日常任务。R1 是推理增强模型,在数学、编程、逻辑推理方面更强,采用强化学习训练。R1 提供多种规格(1.5B~671B),V3 仅提供完整版 671B。日常使用推荐 R1 8B,需要顶级推理能力用 R1 671B 或 V3。
本地部署 DeepSeek 需要什么配置? +
1.5B 版本仅需 1.1GB 空间,CPU 即可运行;7B/8B 版本需要约 8GB 显存(普通游戏显卡即可);14B 需要 16GB 显存;32B 需要 24GB 显存;70B 需要 48GB 显存;671B 完整版需要多卡集群(404GB)。入门推荐使用 8B 版本,性能和资源消耗最平衡。
DeepSeek 模型和 GPT-4 哪个更强? +
DeepSeek V3 在多项基准测试中接近 GPT-4 水平,在中文理解方面甚至更优。DeepSeek R1-0528 在推理任务上性能接近 OpenAI O3 和 Gemini 2.5 Pro。关键优势:开源免费(MIT 协议)、可本地部署(隐私安全)、训练成本极低(V3 仅 557 万美元)。
DeepSeek Coder 和 GitHub Copilot 哪个好? +
DeepSeek Coder 是开源模型,使用 2 万亿 Token 训练(87% 代码 + 13% 自然语言),支持中英文。可通过 Ollama 本地运行,完全免费。Copilot 是闭源商业服务,按月付费。如果你需要本地离线编码助手,DeepSeek Coder 是性价比极高的选择。推荐使用 6.7B 版本,仅需 3.8GB 空间。
如何更新已安装的 DeepSeek 模型? +
使用 Ollama 的话,运行 ollama pull deepseek-r1 即可更新到最新版本。例如 DeepSeek R1 已从最初版本升级到 R1-0528(8B 和 671B 版本),推理和推理能力显著提升。查看已安装模型:ollama list

参考来源

本页所有数据来自以下官方来源,可自行验证。

每日精选 Skill 推荐,免费送到你邮箱

输入邮箱,每天接收一个精选 AI Agent 技能推荐。完全免费,持续更新。

完全免费,取消任意时间。我们不会发送垃圾邮件。