Skills MCP Model 博客 提交 Skills
登录 注册

DeepSeek 开源模型完整列表

DeepSeek 已开源 6 大系列、20+ 个模型。全部 MIT 协议,免费可商用。一目了然的模型目录,帮你快速找到需要的模型。

查看模型列表

模型系列总览

DeepSeek 目前开源了以下 6 大模型系列,覆盖对话、推理、编程、多模态、视觉、数学证明等场景。

DeepSeek V3 — 通用大语言模型

当前 DeepSeek 最强通用模型。671B 参数 MoE 架构,每次推理仅激活 37B 参数,高效且性能强大。

模型名称 DeepSeek V3
参数量 671B(MoE,37B 激活/Token)
模型大小 404 GB
上下文窗口 160K tokens
训练成本 约 557 万美元(极低)
开源协议 MIT License(可商用)
Ollama 下载 ollama pull deepseek-v3(3.8M+ 下载)
GitHub github.com/deepseek-ai/DeepSeek-V3
适用场景 通用对话、写作、翻译、知识问答、内容创作

DeepSeek R1 — 推理增强模型

采用强化学习训练,在数学、编程、逻辑推理方面表现惊艳。R1 完整版 671B 参数为最强推理模型;蒸馏版将 R1 的推理能力迁移到 Qwen 和 Llama 等小模型上,让普通硬件也能运行。提供 1.5B 到 671B 共 7 种规格,是 Ollama 上下载量最高的模型。

模型名称 DeepSeek R1(最新版 R1-0528)
参数量 1.5B / 7B / 8B / 14B / 32B / 70B / 671B
模型大小 1.1GB ~ 404GB
上下文窗口 128K(671B 为 160K)
蒸馏基底 Qwen-2.5 + Llama-3.1/3.3
Ollama 下载量 88.3M+(35 个版本)
GitHub github.com/deepseek-ai/DeepSeek-R1
适用场景 数学解题、编程、逻辑推理、复杂问题分析

R1 蒸馏版完整规格与 Ollama 下载

R1 蒸馏版是将 R1 671B 的推理能力通过知识蒸馏迁移到小模型上,让你在消费级硬件上也能体验强大的推理能力。以下为全部可用版本:

模型版本 蒸馏基底 模型大小 上下文 推荐硬件 Ollama 命令
R1-0528-Qwen3-8B 最新 Qwen3 5.2GB 128K 8GB 显存 ollama run deepseek-r1:8b
R1-Distill-Qwen-1.5B Qwen-2.5 1.1GB 128K CPU 可运行 ollama run deepseek-r1:1.5b
R1-Distill-Qwen-7B Qwen-2.5 4.7GB 128K 8GB 显存 ollama run deepseek-r1:7b
R1-Distill-Qwen-14B Qwen-2.5 9.0GB 128K 16GB 显存 ollama run deepseek-r1:14b
R1-Distill-Qwen-32B Qwen-2.5 20GB 128K 24GB 显存 ollama run deepseek-r1:32b
R1-Distill-Llama-70B Llama-3.3 43GB 128K 48GB 显存 ollama run deepseek-r1:70b
R1-671B 完整版 原生 404GB 160K 多卡集群 ollama run deepseek-r1:671b

DeepSeek Coder — 代码专用模型

专注代码生成与理解。使用 2 万亿 Token 训练(87% 代码 + 13% 中英文自然语言),支持 FIM 代码补全。

模型版本 1.3B / 6.7B / 33B
模型大小 776MB / 3.8GB / 19GB
上下文窗口 16K tokens
训练数据 2 万亿 Token(87% 代码 + 13% 中英文)
Ollama 下载量 4.2M+
GitHub github.com/deepseek-ai/DeepSeek-Coder
适用场景 代码生成、代码补全、代码解释、Bug 修复、代码审查

DeepSeek Janus-Pro — 统一多模态理解与生成

DeepSeek Janus-Pro-7B 是 DeepSeek 最新开源的统一多模态模型,同时支持图像理解和文本到图像生成。其核心创新在于 解耦视觉编码(Decoupled Visual Encoding)技术——为"理解"和"生成"两条路径分别设计独立的视觉编码器,突破了传统统一多模态模型在理解和生成质量上的权衡困境。

解耦视觉编码架构

Janus-Pro 的核心创新是 Decoupled Visual Encoding——将视觉编码分为两条独立路径:

理解路径(Understanding Pathway)

使用 SigLIP 编码器提取图像的高层语义特征,专注于语义级别的视觉理解。该编码器擅长捕捉图像中的物体类别、场景关系、文字内容等高级语义信息,为图像问答、视觉推理、图像描述等任务提供高质量的特征表示。

生成路径(Generation Pathway)

使用 VQ Tokenizer(向量量化分词器)将图像转换为离散的视觉 token 序列,用于图像生成。VQ Tokenizer 将连续像素空间映射到离散的 codebook 索引,使得语言模型可以像生成文本 token 一样自回归地生成视觉 token,最终解码为图像。

两条路径共享同一个 Transformer 语言模型作为"大脑",但视觉编码各自独立。这种设计避免了传统方案中单一编码器在理解和生成任务上的冲突,让 Janus-Pro 在两个方向上都达到顶尖水平。

图像生成能力

Janus-Pro-7B 支持 384×384 分辨率的文本到图像生成。其生成流程如下:

  1. 用户输入文本描述(prompt)
  2. 语言模型将文本转换为视觉 token 序列(通过 VQ Tokenizer 的 codebook)
  3. 自回归生成离散的视觉 token,每个 token 对应 codebook 中的一个索引
  4. VQ Tokenizer 解码器将 token 序列重构为 384×384 RGB 图像

虽然分辨率(384×384)不及专用图像生成模型(如 SDXL 的 1024×1024),但作为统一多模态模型,Janus-Pro 在理解与生成兼顾的场景下表现优异,生成质量接近专用模型。

多模态理解能力

图像描述

Image Captioning

对任意图像生成准确、详细的自然语言描述。涵盖物体、场景、动作、颜色、空间关系等要素,支持中英文双语描述。

视觉问答

Visual Question Answering

针对图像内容回答自然语言问题。支持计数、比较、存在性判断、属性查询等多种问答类型,在 VQAv2、GQA 等基准上表现出色。

视觉推理

Visual Reasoning

对图像进行逻辑推理和因果分析。理解图像中隐含的关系、意图和事件因果链,支持"如果……会怎样"类的假设推理。

AI 绘画

Text-to-Image Generation

根据文本描述生成 384×384 分辨率图像。覆盖人物、场景、物体、抽象概念等多种主题,支持风格化描述。

模型版本 Janus(1.3B)/ Janus-Pro-7B(最新)/ JanusFlow
参数量 1.3B(Janus)/ 7B(Janus-Pro-7B)
核心架构 解耦视觉编码(Decoupled Visual Encoding)— 理解与生成路径独立
理解编码器 SigLIP 编码器 — 提取高层语义特征,用于视觉理解
生成编码器 VQ Tokenizer — 离散视觉 token 序列,用于图像生成
图像生成分辨率 384×384 像素
核心功能 统一多模态理解(图像描述/VQA/视觉推理)+ 文本到图像生成
开源协议 MIT License
Hugging Face huggingface.co/deepseek-ai/Janus-Pro-7B
GitHub github.com/deepseek-ai/Janus
适用场景 图像问答、图文理解、AI 绘画、多模态对话、视觉内容创作

推理代码示例

以下代码来自 GitHub 仓库 generation_inference.py,展示 Janus-Pro-7B 的多模态理解和图像生成:

import torch
from transformers import AutoModelForCausalLM
from janus.models import MultiModalityCausalLM, VLChatProcessor
from PIL import Image

# 1. 加载模型
model_path = "deepseek-ai/Janus-Pro-7B"
vl_chat_processor = VLChatProcessor.from_pretrained(model_path)
tokenizer = vl_chat_processor.tokenizer

vl_gpt = AutoModelForCausalLM.from_pretrained(
    model_path,
    trust_remote_code=True,
    torch_dtype=torch.bfloat16,
    device_map="auto"
).eval()

# 2. 多模态理解 — 图像问答
conversation = [
    {
        "role": "<|User|>",
        "content": "<image_placeholder>\n这张图片中有什么?请详细描述。",
        "images": ["images/demo.jpg"],
    },
    {"role": "<|Assistant|>", "content": ""},
]

prepare_inputs = vl_chat_processor(
    conversations=conversation,
    images=[Image.open("images/demo.jpg")],
    force_batchify=True
).to(vl_gpt.device)

inputs_embeds = vl_gpt.prepare_inputs_embeds(**prepare_inputs)
outputs = vl_gpt.language_model.generate(
    inputs_embeds=inputs_embeds,
    attention_mask=prepare_inputs.attention_mask,
    pad_token_id=tokenizer.eos_token_id,
    max_new_tokens=512,
    do_sample=False,
)
answer = tokenizer.decode(outputs[0], skip_special_tokens=True)
print(f"理解结果: {answer}")

# 3. 图像生成 — 文本到图像
gen_conversation = [
    {
        "role": "<|User|>",
        "content": "生成一张图片:一只可爱的橘猫坐在窗台上,阳光洒在它身上。",
    },
    {"role": "<|Assistant|>", "content": ""},
]

gen_inputs = vl_chat_processor(
    conversations=gen_conversation,
    force_batchify=True
).to(vl_gpt.device)

# 设置生成图像所需的特殊 token
gen_inputs_embeds = vl_gpt.prepare_inputs_embeds(**gen_inputs)
gen_outputs = vl_gpt.language_model.generate(
    inputs_embeds=gen_inputs_embeds,
    attention_mask=gen_inputs.attention_mask,
    pad_token_id=tokenizer.eos_token_id,
    max_new_tokens=2048,
    do_sample=True,
    temperature=0.8,
)

# 解码生成的视觉 token 为图像
generated_tokens = gen_outputs[0]
decoded_image = vl_gpt.gen_vision_model.decode_code(
    generated_tokens,
    shape=[384, 384]
)
decoded_image.save("generated_cat.png")
print("图像已保存为 generated_cat.png")
DeepSeek 模型完全指南 → 模型下载教程 →

DeepSeek VL2 — Mixture-of-Experts 视觉语言模型

DeepSeek VL2 是 DeepSeek 开源的 MoE(Mixture-of-Experts)视觉语言模型,采用混合专家架构,在保持高效推理的同时实现强大的视觉理解能力。该模型支持动态分辨率,可处理任意分辨率的图像,无需强制裁剪或缩放。

核心架构设计

DeepSeek VL2 采用 Mixture-of-Experts 视觉语言架构,由两大核心组件构成:

视觉编码器(Vision Encoder)

采用 SigLIP-SO400M + SAM-B 双编码器组合。SigLIP 负责高层次的语义理解,SAM-B 提供细粒度的像素级视觉特征。两者融合后可同时捕捉全局语义和局部细节,为动态分辨率处理和精确视觉定位奠定基础。

语言模型(Language Model)

使用 DeepSeekMoE 作为语言基座——DeepSeek 自研的混合专家模型,每次推理仅激活部分专家参数,实现高效计算。视觉特征通过 MLP 投影器与语言模型的 token embedding 空间对齐,实现视觉-语言跨模态理解。

动态分辨率技术

DeepSeek VL2 的核心创新之一是 动态分辨率(Dynamic Resolution)支持。传统视觉语言模型通常将图像强制裁剪或缩放为固定尺寸(如 224×224 或 336×336),导致小文字模糊、宽高比失真。VL2 通过以下机制解决了这一问题:

  • 自适应切块:根据图像原始宽高比和分辨率,自动将图像切分为多个子图块(tiles),每个子图块独立编码
  • 全局缩略图:同时保留一张全局缩略图,用于捕捉整体构图和上下文信息
  • 分辨率自适应:支持从低分辨率缩略图到高分辨率扫描件的任意分辨率输入,无需人工预处理
  • 动态 token 分配:根据图像内容复杂度,智能分配视觉 token 数量——简单图表使用较少 token,密集文档使用更多 token

三种规格对比

VL2 提供三种规格,满足不同场景需求。所有规格均采用 MIT License 开源:

规格 激活参数 总参数 推荐场景 硬件要求
VL2-Tiny 1.0B ~3.4B 移动端、边缘设备、轻量 OCR 4GB 显存
VL2-Small 2.8B ~8.1B 文档理解、图表分析、单卡部署 8GB 显存
VL2 4.5B ~13.5B 高精度 OCR、复杂推理、企业级部署 16GB 显存

关键能力

OCR 文字识别

高精度文字提取

支持中英文及多语言 OCR,从照片、截图、扫描件中准确提取文字。动态分辨率确保小字体清晰可辨,适合文档数字化场景。

图表理解

数据可视化解读

能够理解柱状图、折线图、饼图等可视化图表,提取数据趋势、数值关系和图表标题,并生成自然语言描述。

视觉定位

Visual Grounding

根据自然语言描述在图像中定位目标物体,输出精确的边界框坐标。支持指代表达理解(Referring Expression)和开放词汇检测。

文档问答

Document QA

对 PDF、合同、发票等文档进行问答交互。理解文档结构和排版,精准回答关于文档内容的问题,支持多页文档分析。

模型版本 VL2-Tiny(1.0B 激活)/ VL2-Small(2.8B 激活)/ VL2(4.5B 激活)
架构类型 Mixture-of-Experts 视觉语言模型(MoE VLM)
视觉编码器 SigLIP-SO400M + SAM-B(双编码器融合)
语言模型 DeepSeekMoE(混合专家语言模型)
动态分辨率 支持,可处理任意分辨率图像,自适应切块
训练数据 视觉-语言交错数据(vision-language interleaved data)
开源协议 MIT License
论文 DeepSeek_VL2_paper.pdf(GitHub)
GitHub github.com/deepseek-ai/DeepSeek-VL2
适用场景 图片内容识别、文档 OCR、截图分析、图表数据提取、视觉定位、文档问答

推理代码示例

from transformers import AutoModelForCausalLM

from deepseek_vl2.models import DeepseekVLV2Processor, DeepseekVLV2ForCausalLM
import torch

# 1. 加载模型与处理器
model_path = "deepseek-ai/deepseek-vl2-small"
vl_chat_processor = DeepseekVLV2Processor.from_pretrained(model_path)
tokenizer = vl_chat_processor.tokenizer

vl_gpt = DeepseekVLV2ForCausalLM.from_pretrained(
    model_path,
    trust_remote_code=True,
    torch_dtype=torch.bfloat16,
    device_map="auto"
).cuda().eval()

# 2. 多轮对话示例(支持动态分辨率图像)
conversation = [
    {
        "role": "User",
        "content": "<image>\n请描述这张图片的内容,并提取其中的文字。",
        "images": ["./document.png"]
    },
    {
        "role": "Assistant",
        "content": "这是一份财务报告..."
    },
    {
        "role": "User",
        "content": "<image>\n这张图表中的趋势是什么?",
        "images": ["./chart.png"]
    },
]

# 3. 准备输入并推理
prepare_inputs = vl_chat_processor(
    conversations=conversation,
    images=["./document.png", "./chart.png"],
    force_batchify=True
).to(device=vl_gpt.device, dtype=vl_gpt.dtype)

# 4. 生成回答
inputs_embeds = vl_gpt.prepare_inputs_embeds(**prepare_inputs)
outputs = vl_gpt.language_model.generate(
    inputs_embeds=inputs_embeds,
    attention_mask=prepare_inputs.attention_mask,
    max_new_tokens=512,
    do_sample=False,
)

answer = tokenizer.decode(outputs[0], skip_special_tokens=True)
print(answer)
DeepSeek 模型完全指南 → 模型下载教程 →

DeepSeek Prover V2 — 数学定理证明

专注于形式化数学定理证明的模型。在 Lean 4 证明助手中实现自动化证明,代表着 AI 在数学推理领域的前沿探索。

模型名称 DeepSeek Prover V2
基座模型 DeepSeekMath-Base 7B
证明系统 Lean 4
开源协议 MIT License
GitHub github.com/deepseek-ai/DeepSeek-Prover-V2
适用场景 数学定理证明、形式化验证、数学教育、学术研究

DeepSeek 开源模型快速对比

一张表看清所有 DeepSeek 开源模型的区别,快速找到你需要的模型。

模型系列 类型 参数量 最小规格 Ollama 下载量
DeepSeek V3 通用对话 671B 404GB 支持 3.8M+
DeepSeek R1 推理增强 1.5B~671B 1.1GB 支持 88.3M+
DeepSeek Coder 代码生成 1.3B~33B 776MB 支持 4.2M+
DeepSeek Janus 多模态 1.3B~7B ~800MB HuggingFace
DeepSeek VL2 视觉语言 1.0B~4.5B ~2GB HuggingFace
DeepSeek Prover V2 数学证明 7B ~15GB HuggingFace

DeepSeek 模型 Benchmark 性能排行

以下是 DeepSeek 核心模型在主流基准测试上的表现。数据来源:DeepSeek 官方技术报告。V3、R1(完整版 671B)、Coder(V2 版本)得分对比,让你一目了然各模型的强项。

Benchmark 类别 DeepSeek V3 DeepSeek R1 DeepSeek Coder
MMLU 通用知识 88.5 90.8 79.4
MMLU-Pro 进阶知识 75.9 84.0
GPQA Diamond 研究生级问答 59.1 71.5
MATH-500 数学推理 90.2 97.3
AIME 2024 数学竞赛 39.2 79.8
HumanEval 代码生成 82.6 96.3 81.1
LiveCodeBench 实战编程 49.2 65.9 43.8
数据说明

所有分数来自 DeepSeek 官方技术报告。V3 和 R1 为 671B 完整版得分,Coder 为 V2 版本得分。「—」表示官方未公开此项数据。R1 在推理和数学 Benchmark 上全面领先,V3 在通用任务上表现均衡。

关键结论

R1 在 AIME 2024 数学竞赛上得分是 V3 的 2 倍(79.8 vs 39.2);在 HumanEval 代码生成上达到 96.3%,接近满分。V3 性价比极高,以 557 万美元训练成本实现顶级性能。

DeepSeek 模型训练数据揭秘

DeepSeek 各模型的训练数据规模和构成,是理解模型能力边界的关键。以下整理了 DeepSeek 核心开源模型的训练数据详情,所有数据均来自 DeepSeek 官方技术报告和 GitHub 仓库。

模型 训练数据规模 数据构成 数据来源 训练方式
DeepSeek V3 14.8T tokens 多语言语料(中英为主,覆盖多语种) 互联网公开文本、书籍、学术论文、代码仓库 预训练 + 多阶段 SFT + RLHF
DeepSeek R1 V3 基座 + 800k 精选推理样本 强化学习训练数据 + 800k 精选推理样本(用于蒸馏) RL 自生成推理链 + 人工精选高质量推理样本 RL 强化学习 + 知识蒸馏
DeepSeek Coder 2T tokens 87% 代码 + 13% 中英文自然语言 GitHub 代码仓库、Stack Overflow、技术文档 预训练 + FIM(Fill-in-the-Middle)训练
DeepSeek VL2 视觉-语言交错数据 图像-文本对 + 图文交错文档 + 多模态指令数据 公开图像数据集、文档扫描件、图表数据 多模态预训练 + 视觉指令微调
DeepSeek Janus 多模态理解 + 图像生成数据 图像描述 / VQA / 文本-图像对 / 视觉推理数据 公开多模态数据集 + 合成图像生成数据 多模态预训练 + 解耦视觉编码训练
DeepSeek Prover V2 Lean 4 形式化证明数据 Lean 4 定理证明语料 + 形式化数学库 Mathlib 数学库 + 自动生成的形式化证明 预训练 + 证明搜索 + 强化学习
数据规模对比

V3 以 14.8T tokens 的训练数据量领跑,覆盖多语言和多领域。Coder V2 使用 2T tokens 专注代码领域训练。R1 在 V3 基座上通过 RL + 800k 精选推理样本 实现推理突破,数据效率极高。

关键洞察

DeepSeek Coder 的 87% 代码 + 13% 自然语言 配比是其成功的关键——高比例代码数据确保编程能力,少量自然语言数据保持对话流畅性。VL2 和 Janus 的视觉-语言交错数据是实现多模态理解的基础。

DeepSeek 模型开源社区影响力

DeepSeek 开源模型在全球 AI 社区产生了巨大影响力。以下是截至 2026 年中的关键社区数据,展示 DeepSeek 在 GitHub、Hugging Face、Ollama 等平台上的受欢迎程度。

GitHub 仓库星标

90,000+

DeepSeek V3

github.com/deepseek-ai/DeepSeek-V3

访问仓库 →
85,000+

DeepSeek R1

github.com/deepseek-ai/DeepSeek-R1

访问仓库 →
10,000+

DeepSeek Coder

github.com/deepseek-ai/DeepSeek-Coder

访问仓库 →

Hugging Face 平台数据

DeepSeek-V3 累计下载量最高,Hugging Face 月度下载量排名前列
DeepSeek-R1-Distill-Qwen-1.5B Hugging Face 上最受欢迎的蒸馏版,下载量极高
Janus-Pro-7B 多模态模型中最受欢迎,喜欢数(likes)持续增长
全系列模型 DeepSeek 在 Hugging Face 上发布了 30+ 个模型权重,涵盖所有系列

Ollama 平台下载量

88.3M+

DeepSeek R1

35 个版本规格,Ollama 下载量最高的模型之一

4.2M+

DeepSeek Coder

代码模型中最受欢迎的选择

3.8M+

DeepSeek V3

671B 完整版,单模型下载量创新高

100M+

全系列总下载量

DeepSeek 全系列在 Ollama 累计下载量突破 1 亿

Awesome DeepSeek Integration

社区维护的 Awesome DeepSeek Integration 项目已成为 DeepSeek 生态的重要入口,整合了 DeepSeek API 和开源模型在各类应用中的集成方案:

  • 624+ 次提交(commits),持续活跃更新
  • 覆盖 5 种语言的集成文档和示例代码
  • 涵盖聊天客户端、RAG 框架、Agent 平台、编程插件等 50+ 种集成方式
  • 社区贡献者和 Fork 数量持续增长,已成为 DeepSeek 生态的核心枢纽
github.com/deepseek-ai/awesome-deepseek-integration →

社区贡献生态

社区贡献

Fork 与 PR

DeepSeek 核心仓库累计获得数千次 Fork,社区提交了大量 PR 用于改进文档、修复 Bug、优化推理性能、添加新功能支持。

第三方集成

生态扩展

vLLM、SGLang、Ollama、LM Studio、llama.cpp 等主流推理框架均已原生支持 DeepSeek 模型,降低部署门槛。

社区教程

知识共享

全球开发者贡献了大量中英文教程、视频、博客文章,覆盖从入门到精通的各个层次,帮助更多人快速上手 DeepSeek。

开源生态

模型衍生

基于 DeepSeek 开源模型微调、蒸馏、合并的衍生模型不断涌现,覆盖医疗、法律、金融、教育等垂直领域。

模型下载教程 → 部署教程 →

了解更多

教程

DeepSeek 模型怎么用

零基础入门教程,四种方式手把手教你使用 DeepSeek 模型。

查看教程 →
下载

DeepSeek 模型下载

Ollama、Hugging Face、GitHub 三种下载方式,附完整命令和步骤。

查看下载 →
部署

DeepSeek Model 部署教程

Ollama、Docker、vLLM 三种部署方案,从单机到集群全覆盖。

查看部署 →
指南

DeepSeek Model 完全指南

从入门到精通,了解 DeepSeek 模型的所有知识。

查看指南 →

DeepSeek 模型选型指南

面对众多 DeepSeek 模型不知道怎么选?以下按场景、硬件、需求三个维度帮你快速找到最适合的模型。

按场景选择

日常对话

DeepSeek V3

通用对话、写作、翻译、知识问答首选。671B MoE 架构,回答质量高,覆盖面广。

硬件要求:404GB / 多卡集群
编程开发

DeepSeek Coder / R1

代码生成选 Coder 6.7B;复杂编程推理选 R1 32B。HumanEval 96.3%,代码能力顶尖。

推荐:Coder 6.7B(3.8GB)/ R1 32B(20GB)
数学推理

DeepSeek R1 / Prover V2

数学解题选 R1 32B+,AIME 2024 得分 79.8。形式化定理证明选 Prover V2。

推荐:R1 32B(20GB)/ Prover V2(~15GB)
多模态

DeepSeek Janus / VL2

图像理解+生成选 Janus-Pro-7B;纯视觉理解/OCR 选 VL2。解耦视觉编码,理解生成两不误。

推荐:Janus-Pro-7B / VL2-Small(2.8B)
学术研究

DeepSeek V3 / R1 / Prover

综合研究选 V3 或 R1;数学证明方向选 Prover V2。全部 MIT 协议,可自由用于学术发表。

推荐:R1 70B(43GB)/ V3(404GB)

按硬件选择

CPU 运行

R1-Distill-Qwen-1.5B

仅 1.1GB,无需显卡,纯 CPU 即可运行。适合低配设备尝鲜体验推理能力。

Ollama: ollama run deepseek-r1:1.5b
8GB 显存

R1-8B / R1-7B / Coder 6.7B

最推荐的入门配置。R1-0528-Qwen3-8B(5.2GB)为最新推理模型,Coder 6.7B(3.8GB)专注编程。

Ollama: ollama run deepseek-r1:8b
16GB 显存

R1-14B / Coder 33B

R1-Distill-Qwen-14B(9.0GB)推理能力显著提升;Coder 33B(19GB)需 16GB+ 显存。

Ollama: ollama run deepseek-r1:14b
24GB 显存

R1-32B

R1-Distill-Qwen-32B(20GB)是性能和资源的最佳平衡点。推理能力接近完整版,单卡可跑。

Ollama: ollama run deepseek-r1:32b
多卡集群

R1-70B / R1-671B / V3

R1-70B(43GB)需 48GB+;R1-671B 和 V3(404GB)需多卡集群。可用 vLLM 或 SGLang 部署。

推荐部署方案:vLLM 多卡部署教程

按需求选择

免费使用

所有开源模型

DeepSeek 全部开源模型均免费,MIT 协议可商用。官网 chat.deepseek.com 也提供免费使用。

免费使用教程 →
隐私安全

本地部署蒸馏版

数据不出本地,选 R1 8B/14B/32B 蒸馏版本地部署。Ollama 一键运行,无需联网。

本地部署教程 →
高性能

R1-671B / V3 完整版

追求最强性能,选 R1-671B(推理)或 V3(通用)。需多卡集群,推荐 vLLM 部署方案。

vLLM 部署教程 →
可定制

全系列开源模型

所有模型均可微调(LoRA/QLoRA)。选 R1 8B/14B 作为基座,用自有数据微调垂直领域模型。

模型微调指南 →

DeepSeek 开源模型常见问题

DeepSeek 所有模型都是开源的吗? +
DeepSeek 已开源的模型(V3、R1、Coder、Janus、VL2、Prover V2)全部采用 MIT License,完全开源可商用。但 DeepSeek 官网 chat.deepseek.com 上运行的模型是托管服务,使用了更深度的优化版本,并非与开源完全一致。开源模型的权重可以在 Hugging Face 和 GitHub 上免费下载。
DeepSeek R1 和 V3 的核心区别是什么? +
V3 是通用大语言模型,适合日常对话、写作、翻译等任务。R1 是推理增强模型,在数学、编程、逻辑推理方面更强。R1 采用强化学习训练,会展示"思考过程"(Chain of Thought)。R1 提供多种规格(1.5B~671B),V3 仅提供 671B 完整版。两个模型都开源,可以互补使用。
DeepSeek 开源模型可以商用吗? +
DeepSeek 自研模型(V3、R1 完整版、Coder、Janus、VL2、Prover)均采用 MIT License,允许商用、修改、分发。R1 蒸馏版模型基于 Qwen(Apache 2.0)和 Llama(Llama License),这些协议也允许商用,但需遵守各自条款。总体来说,所有 DeepSeek 开源模型都可以用于商业项目。
DeepSeek 会继续开源新模型吗? +
DeepSeek 一直积极推进开源。从 V2 到 V3,从 R1 初版到 R1-0528 更新,再到 Janus 系列、VL2 和 Prover V2,DeepSeek 持续发布新模型和改进版本。社区对于 DeepSeek V4 和 R2 的期待很高。关注 github.com/deepseek-ai 获取最新动态。
如何选择 DeepSeek 开源模型? +
日常对话选 V3 或 R1 8B;编程任务选 Coder 6.7B;数学推理选 R1 32B+;图像处理选 Janus 或 VL2;学术研究选 Prover V2。入门推荐 R1 8B,体积小(5.2GB)、效果好、配置要求低。如果硬件允许,R1 32B 是性能和资源的最佳平衡点。
开源模型和官网 model 有什么区别? +
官网 chat.deepseek.com 使用的是 DeepSeek 内部优化部署的版本,可能包含额外的后训练优化、系统提示词和更快的推理引擎。开源版本是模型权重,你可以自行部署和优化。官网版更方便(即开即用),开源版更灵活(可本地部署、微调、二次开发)。

每日精选 Skill 推荐,免费送到你邮箱

输入邮箱,每天接收一个精选 AI Agent 技能推荐。完全免费,持续更新。

完全免费,取消任意时间。我们不会发送垃圾邮件。