Skills MCP Model 博客 提交 Skills
登录 注册

DeepSeek 模型下载

全网最全的 DeepSeek 模型下载指南。Ollama 一行命令、Hugging Face 原版权重、官方 GitHub 仓库,所有渠道一步到位。

查看下载方式

DeepSeek 模型下载量排行榜

数据来源:Ollama 平台实时统计与 Hugging Face 官方下载数据。以下为 DeepSeek 开源模型在各平台的累计下载量(截至 2026 年 7 月)。

88.3M+
DeepSeek R1
推理模型 · 35 个版本
Ollama 平台下载量第一
4.2M+
DeepSeek Coder
代码模型 · 102 个版本
开发者最爱的代码模型
3.8M+
DeepSeek V3
旗舰 MoE 模型 · 5 个版本
671B 参数超大模型

提示:查看 DeepSeek 模型 了解各模型详细对比,或访问 DeepSeek 模型怎么用 获取使用指南。

三种下载方式

根据你的需求选择最合适的下载方式。新手推荐 Ollama,开发者推荐 Hugging Face。

Ollama 一键下载(最简单)

Ollama 是 DeepSeek 官方推荐的本地运行工具。DeepSeek R1 在 Ollama 上已有 88.3M+ 下载量,是下载 DeepSeek 模型最方便的方式。

第 1 步:安装 Ollama

访问 ollama.com/download,下载对应操作系统的安装包:

  • Windows:下载 .exe 安装包,双击安装
  • macOS:下载 .dmg 文件,拖入 Applications
  • Linux:运行 curl -fsSL https://ollama.com/install.sh | sh

第 2 步:下载 DeepSeek 模型

打开终端,输入以下命令即可下载对应模型。首次运行会自动下载,后续直接启动。

DeepSeek R1 系列(推理模型,推荐)

模型 大小 最低配置 下载命令
R1 1.5B 1.1 GB CPU ollama pull deepseek-r1:1.5b
R1 7B 4.7 GB 8GB 显存 ollama pull deepseek-r1:7b
R1 8B (推荐) 5.2 GB 8GB 显存 ollama pull deepseek-r1:8b
R1 14B 9.0 GB 16GB 显存 ollama pull deepseek-r1:14b
R1 32B 20 GB 24GB 显存 ollama pull deepseek-r1:32b
R1 70B 43 GB 48GB 显存 ollama pull deepseek-r1:70b
R1 671B 404 GB 多卡集群 ollama pull deepseek-r1:671b

其他模型系列

模型 大小 下载命令
DeepSeek V3 404 GB ollama pull deepseek-v3
DeepSeek Coder 776MB~19GB ollama pull deepseek-coder

DeepSeek V3 量化版本(Ollama 可用)

DeepSeek V3 是 671B 参数的 MoE 旗舰模型,Ollama 提供多种量化版本。注意:高精度版本(Q8_0 / FP16)默认上下文窗口仅为 4K,需手动调整配置。

模型标签 下载大小 上下文窗口 量化方式 下载命令
deepseek-v3:latest 推荐 404 GB 160K Q4_K_M ollama pull deepseek-v3
deepseek-v3:671b 404 GB 160K Q4_K_M ollama pull deepseek-v3:671b
deepseek-v3:671b-q4_K_M 404 GB 160K Q4_K_M ollama pull deepseek-v3:671b-q4_K_M
deepseek-v3:671b-q8_0 713 GB 4K 注意 Q8_0 ollama pull deepseek-v3:671b-q8_0
deepseek-v3:671b-fp16 1.3 TB 4K 注意 FP16 ollama pull deepseek-v3:671b-fp16

重要提示:Q8_0 和 FP16 版本默认上下文窗口仅为 4K(而非 160K),主要是因为高精度模型在 160K 上下文下显存需求巨大。如需更大上下文,建议使用 Q4_K_M 版本,或通过自定义 Modelfile 调整 num_ctx 参数。V3 模型最低需要约 400GB 显存/内存(多卡集群),普通个人电脑无法运行。

第 3 步:验证下载

# 查看已下载的模型列表
ollama list

# 运行模型测试
ollama run deepseek-r1:8b

第 4 步:理解模型量化(Quantization)

Ollama 下载的模型默认使用 Q4_K_M 量化,这是一种在模型大小和推理质量之间取得最佳平衡的量化方式。了解量化可以帮助你根据硬件配置选择最合适的模型版本。

什么是 Q4_K_M 量化?

Q4_K_M 是 Ollama 的默认量化格式,属于 GGUF 量化系列:

  • Q4:表示使用 4-bit 量化,将原始 FP16(16-bit)权重压缩到 4-bit,模型体积缩小约 75%
  • K:表示使用 K-quant 量化策略,对重要权重层使用更高精度(如 6-bit),对不重要的层使用更低精度
  • M:表示 Medium 大小,在 Q4_K_S(小)和 Q4_K_L(大)之间取得平衡
  • 效果:在几乎不损失推理质量的前提下,大幅降低显存占用和模型大小,是 Ollama 官方推荐的最佳选择

如何下载特定量化版本?

Ollama 支持指定具体的量化版本,在模型名后添加量化标签即可:

# 下载 Q4_K_M 量化版(默认,推荐)
ollama pull deepseek-r1:8b-q4_K_M

# 下载更小的 Q3_K_M 量化版(质量略降,体积更小)
ollama pull deepseek-r1:8b-q3_K_M

# 下载最高精度的 Q8_0 量化版(质量最高,体积最大)
ollama pull deepseek-r1:8b-q8_0

# 如果省略量化标签,默认下载 Q4_K_M
ollama pull deepseek-r1:8b

可用量化方式对比

GGUF 量化格式从低精度到高精度完整列表(高低排列):

量化格式 精度 体积比例 推荐场景
Q2_K 2-bit ~20% 极低配置,质量损失较大
Q3_K_S 3-bit ~25% 低配置,小体积优先
Q3_K_M 3-bit ~28% 低配置,中等质量
Q3_K_L 3-bit ~30% 低配置,较高质量
Q4_0 4-bit ~32% 经典 Q4 量化,兼容性好
Q4_K_S 4-bit ~35% 平衡配置,小体积
Q4_K_M 推荐 4-bit ~38% 推荐默认,最佳平衡
Q4_K_L 4-bit ~42% 偏好质量,体积稍大
Q5_0 5-bit ~45% 中高配置,经典 Q5
Q5_K_S 5-bit ~48% 中高配置,小体积
Q5_K_M 5-bit ~50% 高质量推理,推荐
Q6_K 6-bit ~60% 高配置,接近无损
Q8_0 8-bit ~70% 最高精度量化
FP16 16-bit 100% 原始精度,无损

体积比例以 FP16 原始模型为基准。日常使用推荐 Q4_K_M,如需最高质量可选 Q5_K_M 或 Q6_K。

更多模型对比和选型建议,请参考 DeepSeek 模型DeepSeek Model 部署教程

Ollama 高级下载技巧

掌握以下高级技巧,让 Ollama 下载更高效、更灵活。

并行下载多个模型

Ollama 支持同时下载多个模型,只需在多个终端窗口分别运行 ollama pull 命令即可。每个下载任务独立进行,互不影响。

# 终端 1:下载 R1 8B
ollama pull deepseek-r1:8b

# 终端 2:同时下载 Coder 6.7B
ollama pull deepseek-coder:6.7b

# 终端 3:同时下载 V3
ollama pull deepseek-v3

注意并行下载会分摊带宽,建议根据网络带宽合理分配,一般 2-3 个并行任务即可。

断点续传(恢复中断的下载)

Ollama 原生支持断点续传。如果下载过程中网络中断或手动取消,下次运行相同的 ollama pull 命令会自动从断点处继续下载,无需重新开始。

# 下载中断后,直接重新运行即可
ollama pull deepseek-r1:32b
# Ollama 会自动检测已下载的部分,从断点继续

大模型(如 70B/671B)下载时间较长,断点续传功能尤为重要。Ollama 会将已下载的层(layers)缓存到本地,只下载缺失的部分。

更改模型下载目录

默认情况下,Ollama 将模型存储在系统盘,大模型可能占用大量空间。通过设置 OLLAMA_MODELS 环境变量,可以将模型存储到其他磁盘。

# Linux / macOS — 在 ~/.bashrc 或 ~/.zshrc 中添加
export OLLAMA_MODELS=/data/ollama-models

# Windows PowerShell — 设置环境变量
[Environment]::SetEnvironmentVariable('OLLAMA_MODELS', 'D:\ollama-models', 'User')

# Windows CMD
setx OLLAMA_MODELS "D:\ollama-models"

# 设置后重启 Ollama 服务生效
# Linux: systemctl restart ollama
# macOS: 退出并重新打开 Ollama 应用
# Windows: 在任务栏退出 Ollama 后重新启动

通过代理下载

如果网络环境受限,可以通过设置 HTTP/HTTPS 代理让 Ollama 通过代理服务器下载模型。

# Linux / macOS — 设置代理环境变量后启动 Ollama
export HTTP_PROXY=http://127.0.0.1:7890
export HTTPS_PROXY=http://127.0.0.1:7890
ollama pull deepseek-r1:8b

# Windows PowerShell
$env:HTTP_PROXY="http://127.0.0.1:7890"
$env:HTTPS_PROXY="http://127.0.0.1:7890"
ollama pull deepseek-r1:8b

# 如果使用 systemd 管理 Ollama 服务,编辑服务文件
sudo systemctl edit ollama.service
# 添加以下内容:
# [Service]
# Environment="HTTP_PROXY=http://127.0.0.1:7890"
# Environment="HTTPS_PROXY=http://127.0.0.1:7890"
sudo systemctl daemon-reload
sudo systemctl restart ollama

验证模型完整性

下载完成后,可以通过以下方式验证模型文件的完整性,确保没有损坏。

# 查看模型详细信息(包括大小、量化方式、层数等)
ollama show deepseek-r1:8b

# 列出所有已下载模型,确认大小是否正确
ollama list

# 快速测试模型是否正常
ollama run deepseek-r1:8b "你好,请简单介绍一下自己"

# 查看模型文件的实际存储路径
# Linux/macOS
ls -lh ~/.ollama/models/blobs/
# Windows
dir C:\Users\%USERNAME%\.ollama\models\blobs\

使用指定摘要下载特定版本

Ollama 支持通过 SHA256 摘要(Digest)精确下载特定版本的模型,确保版本一致性。

# 查看模型的所有可用版本和摘要
ollama show deepseek-r1:8b

# 使用 SHA256 摘要精确下载特定版本
ollama pull deepseek-r1@sha256:xxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxx

# 示例:锁定特定版本,避免自动更新
# 这在生产环境中非常有用,确保所有节点运行相同版本

在企业或生产环境中,使用 SHA256 摘要可以确保所有部署节点使用完全一致的模型版本,避免因版本差异导致输出不一致。

更多 Ollama 使用技巧,请参考 DeepSeek Model 部署教程DeepSeek 模型怎么用

Hugging Face 下载原版权重

适合需要原始模型权重进行二次开发、微调(Fine-tuning)或研究用途的开发者。

DeepSeek 官方 Hugging Face 仓库

DeepSeek AI 官方在 Hugging Face 上发布了所有模型权重:

官方仓库

DeepSeek V3

671B MoE 旗舰模型,完整权重下载。支持 Transformers 和 vLLM 加载。

  • huggingface.co/deepseek-ai/DeepSeek-V3
  • 模型大小:404GB(完整版)
  • 授权协议:MIT
官方仓库

DeepSeek R1

推理增强模型,提供完整版和蒸馏版。支持 1.5B~671B 多种规格。

  • huggingface.co/deepseek-ai/DeepSeek-R1
  • 蒸馏版:Qwen-2.5 / Llama-3.x 基底
  • 授权协议:MIT
官方仓库

DeepSeek Coder

代码专用模型,2T Token 训练。提供 1.3B/6.7B/33B 三种规格。

  • huggingface.co/deepseek-ai/DeepSeek-Coder
  • 模型大小:776MB~19GB
  • 授权协议:MIT
官方仓库

DeepSeek Janus

多模态理解与生成模型,支持文生图和图像理解。最新版 Janus-Pro。

  • huggingface.co/deepseek-ai/Janus
  • 支持 7B 多模态
  • 授权协议:MIT

下载方法

# 方法一:使用 huggingface-cli(推荐)
pip install huggingface_hub
huggingface-cli download deepseek-ai/DeepSeek-R1 --local-dir ./DeepSeek-R1

# 方法二:使用 git clone(需要 git-lfs)
git lfs install
git clone https://huggingface.co/deepseek-ai/DeepSeek-R1

# 方法三:使用 Python 下载
from huggingface_hub import snapshot_download
snapshot_download(repo_id="deepseek-ai/DeepSeek-R1", local_dir="./DeepSeek-R1")

使用 Transformers 加载

from transformers import AutoTokenizer, AutoModelForCausalLM

model_name = "deepseek-ai/DeepSeek-R1-Distill-Qwen-7B"
tokenizer = AutoTokenizer.from_pretrained(model_name)
model = AutoModelForCausalLM.from_pretrained(
model_name,
torch_dtype="auto",
device_map="auto"
)

Hugging Face 模型下载完整指南

深入了解 Hugging Face 上 DeepSeek 所有官方仓库、多种下载方式、国内镜像加速以及模型文件结构说明。

DeepSeek 官方 Hugging Face 全部仓库

DeepSeek AI 在 Hugging Face 上维护了多个官方仓库,涵盖所有模型系列和蒸馏版本:

仓库名称 模型类型 大小 协议
deepseek-ai/DeepSeek-V3 671B MoE ~687GB MIT
deepseek-ai/DeepSeek-R1 671B MoE 推理 ~720GB MIT
deepseek-ai/DeepSeek-R1-Distill-Qwen-1.5B 1.5B 蒸馏 ~3.5GB MIT
deepseek-ai/DeepSeek-R1-Distill-Qwen-7B 7B 蒸馏 ~15GB MIT
deepseek-ai/DeepSeek-R1-Distill-Qwen-14B 14B 蒸馏 ~30GB MIT
deepseek-ai/DeepSeek-R1-Distill-Qwen-32B 32B 蒸馏 ~65GB MIT
deepseek-ai/DeepSeek-R1-Distill-Llama-8B 8B 蒸馏 ~16GB MIT
deepseek-ai/DeepSeek-R1-Distill-Llama-70B 70B 蒸馏 ~140GB MIT
deepseek-ai/DeepSeek-Coder-V2 代码 MoE ~240GB MIT
deepseek-ai/Janus-Pro-7B 多模态 ~15GB MIT

四种下载方式详解

方式一:huggingface-cli(推荐)

Hugging Face 官方命令行工具,支持断点续传和多线程下载,是下载大模型的最佳方式。

# 安装 huggingface-cli
pip install -U huggingface_hub

# 下载完整仓库
huggingface-cli download deepseek-ai/DeepSeek-R1 --local-dir ./DeepSeek-R1

# 下载蒸馏版(推荐入门)
huggingface-cli download deepseek-ai/DeepSeek-R1-Distill-Qwen-7B --local-dir ./R1-Distill-7B

# 排除某些大文件以节省空间
huggingface-cli download deepseek-ai/DeepSeek-R1 --local-dir ./DeepSeek-R1 --exclude "*.bin"

方式二:Git Clone + Git LFS

适合需要 Git 版本管理的开发者,可以跟踪模型更新。

# 安装 git-lfs
git lfs install

# 克隆仓库(大文件通过 LFS 下载)
git clone https://huggingface.co/deepseek-ai/DeepSeek-R1

# 如果 LFS 文件下载失败,手动拉取
cd DeepSeek-R1
git lfs pull

方式三:Python snapshot_download

在 Python 代码中直接下载,适合在 Jupyter Notebook 或脚本中使用。

from huggingface_hub import snapshot_download

# 下载到指定目录
snapshot_download(
repo_id="deepseek-ai/DeepSeek-R1-Distill-Qwen-7B",
local_dir="./deepseek-r1-distill",
resume_download=True, # 支持断点续传
max_workers=4 # 多线程下载
)

方式四:wget 直接下载

适合只需要单个文件的场景,无需安装任何工具。

# 下载单个模型文件
wget https://huggingface.co/deepseek-ai/DeepSeek-R1-Distill-Qwen-7B/resolve/main/model.safetensors

# 批量下载(需要先获取文件列表)
# 替换 huggingface.co 为 hf-mirror.com 以加速(见下方)

国内加速下载:使用 hf-mirror.com

Hugging Face 官方服务器在海外,国内下载速度可能较慢。hf-mirror.com 是 Hugging Face 的国内镜像站,可以大幅提升下载速度。

方法一:设置环境变量(推荐)

设置后所有 Hugging Face 工具自动使用镜像:

# Linux / macOS
export HF_ENDPOINT=https://hf-mirror.com

# Windows PowerShell
$env:HF_ENDPOINT = "https://hf-mirror.com"

# 然后正常使用 huggingface-cli 下载
huggingface-cli download deepseek-ai/DeepSeek-R1-Distill-Qwen-7B --local-dir ./model

方法二:替换 URL 前缀

将 huggingface.co 替换为 hf-mirror.com:

# 原始链接
# https://huggingface.co/deepseek-ai/DeepSeek-R1

# 镜像链接
# https://hf-mirror.com/deepseek-ai/DeepSeek-R1

# 使用 git clone 镜像
git clone https://hf-mirror.com/deepseek-ai/DeepSeek-R1

方法三:Python 中使用镜像

from huggingface_hub import snapshot_download
import os

os.environ["HF_ENDPOINT"] = "https://hf-mirror.com"

snapshot_download(
repo_id="deepseek-ai/DeepSeek-R1-Distill-Qwen-7B",
local_dir="./model"
)

模型文件结构说明

下载完成后,Hugging Face 仓库目录通常包含以下文件:

文件名 说明 是否必需
model.safetensors / model-00001-of-000XX.safetensors 模型权重文件(SafeTensors 格式),大模型会分片存储 必需
config.json 模型架构配置文件(层数、隐藏层大小、注意力头数等) 必需
tokenizer.json / tokenizer_config.json 分词器文件和配置,用于文本编码/解码 必需
generation_config.json 生成参数配置(温度、top_p、max_length 等默认值) 可选
model.safetensors.index.json 分片权重索引文件,记录每个权重分片的位置 分片时必需
README.md 模型说明文档,包含使用方法和注意事项 可选
LICENSE 授权协议文件 可选

更多 Hugging Face 使用技巧和模型部署方案,请参考 DeepSeek Model 部署教程DeepSeek Model

ModelScope 国内下载(魔搭社区)

ModelScope(魔搭社区)是阿里巴巴推出的 AI 模型开源平台,国内下载速度远超 Hugging Face。DeepSeek 官方已在 ModelScope 上建立了镜像仓库,国内用户推荐优先使用。

什么是 ModelScope?

ModelScope(魔搭社区)是国内最大的 AI 模型开源平台之一,由阿里巴巴达摩院发起。对于国内用户来说,ModelScope 相比 Hugging Face 有以下优势:

  • 下载速度极快:服务器部署在国内,下载速度可达 50MB/s+,远超 Hugging Face 直连
  • 无需代理:国内网络直连,无需配置代理或镜像站
  • 官方镜像:DeepSeek 官方在 ModelScope 上维护了所有模型的镜像仓库
  • 完全免费:与 Hugging Face 一样,模型下载完全免费
  • 文件结构一致:与 Hugging Face 仓库结构完全相同,可直接用于 Transformers 加载

DeepSeek 官方 ModelScope 仓库

仓库名称 模型类型 大小 链接
deepseek-ai/DeepSeek-V3 671B MoE ~687GB modelscope.cn/models/deepseek-ai/DeepSeek-V3
deepseek-ai/DeepSeek-R1 671B 推理 ~720GB modelscope.cn/models/deepseek-ai/DeepSeek-R1
deepseek-ai/DeepSeek-R1-Distill-Qwen-7B 7B 蒸馏 ~15GB modelscope.cn/models/deepseek-ai/DeepSeek-R1-Distill-Qwen-7B
deepseek-ai/DeepSeek-Coder-V2 代码 MoE ~240GB modelscope.cn/models/deepseek-ai/DeepSeek-Coder-V2

三种下载方式

方式一:ModelScope SDK(推荐)

使用 ModelScope 官方 Python SDK 下载,支持断点续传和多线程加速,是国内下载大模型的最佳方式。

# 安装 ModelScope SDK
pip install modelscope

# 下载完整模型(自动从国内节点下载)
from modelscope import snapshot_download

snapshot_download(
model_id="deepseek-ai/DeepSeek-R1-Distill-Qwen-7B",
cache_dir="./deepseek-models",
revision="master"
)

# 下载 V3 完整版(需要约 687GB 磁盘空间)
snapshot_download(
model_id="deepseek-ai/DeepSeek-V3",
cache_dir="./deepseek-models"
)

方式二:Git Clone

ModelScope 支持 Git 协议,可直接使用 git clone 克隆仓库。

# 安装 git-lfs
git lfs install

# 克隆 ModelScope 仓库(国内速度极快)
git clone https://www.modelscope.cn/deepseek-ai/DeepSeek-R1-Distill-Qwen-7B.git

# 如果 LFS 文件下载失败,手动拉取
cd DeepSeek-R1-Distill-Qwen-7B
git lfs pull

方式三:网页直接下载

访问 ModelScope 网页,在模型页面直接点击下载按钮。适合只需下载单个文件或小模型的场景。

# 访问 ModelScope 网页
# https://modelscope.cn/models/deepseek-ai/DeepSeek-R1-Distill-Qwen-7B/files
# 在文件列表中,点击单个文件即可下载

ModelScope vs Hugging Face 对比

对比维度 ModelScope(魔搭) Hugging Face
国内下载速度 极快(50MB/s+) 较慢(需镜像或代理)
网络要求 直连,无需代理 可能需要代理或 hf-mirror.com
文件结构 与 Hugging Face 完全一致 标准 SafeTensors 格式
SDK 支持 modelscope Python SDK huggingface_hub Python SDK
模型数量 数千个模型 数十万个模型(全球最大)
社区活跃度 国内活跃 全球最活跃
推荐用户 国内用户首选 海外用户 / 国际协作

国内用户建议优先使用 ModelScope 下载模型,速度更快且无需配置。下载后的文件结构与 Hugging Face 完全一致,可直接使用 Transformers 加载。更多信息请参考 DeepSeek Model 部署教程DeepSeek Model

GitHub 官方仓库

DeepSeek 官方 GitHub 仓库包含模型权重、推理代码、技术论文和配置文档。

GitHub 仓库

DeepSeek V3

旗舰模型完整代码和文档。包含模型架构说明、推理示例、性能基准测试结果。

GitHub 仓库

DeepSeek R1

推理模型官方仓库。包含训练方法说明、蒸馏模型、推理示例。

GitHub 仓库

DeepSeek Coder

代码模型官方仓库。2T Token 训练,支持多种编程语言。

模型文件格式说明

了解不同模型文件格式的区别,帮助你根据使用场景选择最合适的格式和精度。

GGUF 格式(Ollama 使用)

GGUF(GPT-Generated Unified Format)是 llama.cpp 项目推出的模型文件格式,专为高效本地推理设计。Ollama 底层使用 llama.cpp,因此所有通过 Ollama 下载的模型都是 GGUF 格式。

GGUF 格式特点

  • 单文件存储:模型权重、配置、分词器全部打包在一个 .gguf 文件中,方便传输和管理
  • 内置量化:支持多种量化精度(Q2_K 到 Q8_0),可根据硬件资源灵活选择
  • CPU 推理优化:针对 CPU 推理做了深度优化,无需 GPU 也能运行
  • 内存映射:支持 mmap() 内存映射加载,零拷贝启动,加载速度极快
  • 跨平台兼容:Windows、macOS、Linux 通用,无需额外依赖
  • 适用场景:本地推理、个人使用、低配置设备、快速部署

SafeTensors 格式(Hugging Face 使用)

SafeTensors 是由 Hugging Face 推出的安全模型权重存储格式,现已成为 Hugging Face 平台的默认格式。所有 DeepSeek 官方 Hugging Face 仓库均使用 SafeTensors 格式。

SafeTensors 格式特点

  • 安全性:相比传统的 pickle 格式(.pt/.bin),SafeTensors 不会执行任意代码,杜绝了模型文件中的恶意代码风险
  • 零拷贝加载:支持内存映射,加载大模型时无需额外内存拷贝
  • 懒加载:支持按需加载部分权重,不需要一次性将整个模型加载到内存
  • 分片支持:大模型可拆分为多个 .safetensors 文件,便于分布式存储和加载
  • 框架无关:PyTorch、TensorFlow、JAX 等主流框架均可读取
  • 适用场景:模型训练、微调(Fine-tuning)、研究开发、生产部署

FP16、FP32 与量化模型的区别

模型精度直接影响模型大小、推理速度和输出质量。以下是对比说明:

精度类型 每个参数占用 7B 模型大小 质量 适用场景
FP32 32 bit (4 bytes) ~28 GB 原始精度 研究、训练、最高精度要求
FP16 16 bit (2 bytes) ~14 GB 几乎无损 标准部署、微调、Hugging Face 默认
Q8_0 8 bit (1 byte) ~7 GB 极轻微损失 高质量本地推理
Q6_K 6 bit ~5.6 GB 接近无损 高配置本地推理
Q5_K_M 5 bit ~4.7 GB 高质量 推荐的高质量量化
Q4_K_M 推荐 4 bit ~4.0 GB 良好 Ollama 默认,日常使用最佳
Q3_K_M 3 bit ~3.2 GB 可接受 低配置设备
Q2_K 2 bit ~2.5 GB 明显损失 极低配置,应急使用

以上大小以 7B 参数模型为例估算。实际大小会因模型架构和分词器大小略有差异。

如何选择格式和精度?

根据你的需求快速选择最合适的方案:

个人日常使用

选择 GGUF + Q4_K_M,通过 Ollama 下载。体积小、速度快、质量好,8GB 显存即可流畅运行 7B/8B 模型。

模型研究与微调

选择 SafeTensors + FP16,从 Hugging Face 下载原始权重。保留完整精度,支持 PyTorch/TensorFlow 训练。

高性能推理

选择 GGUF + Q5_K_M 或 Q6_K,在质量几乎无损的前提下,体积比 FP16 减少约 40-50%。

低配置设备

选择 GGUF + Q3_K_M 或 Q4_K_S,更小的体积适合 4-6GB 显存设备,或纯 CPU 推理场景。

更多部署方案和硬件选型建议,请参考 DeepSeek Model 部署教程DeepSeek Model

下载速度优化指南

不同下载渠道的速度、稳定性和适用场景各有不同。根据你的网络环境和地理位置,选择最优的下载方式。

下载渠道 国内速度 稳定性 推荐地区 适用场景
Ollama 官方
registry.ollama.ai
中等
5-20 MB/s
稳定
CDN 全球加速
海外 / 全球通用 一键下载,开箱即用
新手首选
Hugging Face
+ hf-mirror.com
较快
10-40 MB/s(镜像)
稳定
镜像站维护良好
中国(需镜像) 开发研究,微调训练
需原始权重
ModelScope 魔搭 推荐
modelscope.cn
极快
20-50+ MB/s
稳定
阿里云 CDN
中国最佳 国内用户首选
直连高速,无需配置
GitHub Releases
github.com
较慢
1-5 MB/s
一般
偶尔受限
海外 / 需代理 获取源码和文档
非模型权重下载

不同场景的最佳选择

国内用户 · 日常使用

首选 Ollama 官方,速度稳定。如需下载原始权重,用 ModelScopeHugging Face + hf-mirror.com

海外用户

直接使用 Ollama 官方Hugging Face 官方,CDN 全球加速,下载速度通常很快。

研究开发 · 需要原始权重

国内:ModelScope SDK 下载。海外:Hugging Face CLI。都需要完整 FP16/FP32 权重。

大模型(70B+)下载

务必使用支持断点续传的方式。Ollama 和 ModelScope SDK 都原生支持。大文件下载建议夜间进行,避免网络高峰。

提速技巧总结

  • 使用国内镜像:Hugging Face 设置 HF_ENDPOINT=https://hf-mirror.com,速度提升 5-10 倍
  • 优先 ModelScope:国内用户下载原始权重,ModelScope 速度最快,直连无需代理
  • Ollama 设置代理:如直连较慢,设置 HTTP_PROXY 环境变量通过代理加速
  • 避开高峰时段:大文件下载建议在凌晨或上午进行,避开晚高峰(20:00-23:00)
  • 多线程下载:Hugging Face CLI 和 ModelScope SDK 均支持多线程,可设置 max_workers 参数
  • 使用有线网络:Wi-Fi 下载大文件可能不稳定,建议使用有线网络连接

更多下载技巧和部署方案,请参考 DeepSeek Model 部署教程DeepSeek 模型怎么用DeepSeek 模型

下载后验证与使用

下载完成后,建议验证模型完整性,确保文件没有损坏。

Ollama 验证

# 查看下载的模型信息(大小、量化方式、修改时间)
ollama list

# 查看模型详细信息
ollama show deepseek-r1:8b

Hugging Face 验证

# 检查模型文件完整性
ls -lh ./DeepSeek-R1/

# 使用 Python 快速测试
python -c "from transformers import AutoTokenizer; t = AutoTokenizer.from_pretrained('./DeepSeek-R1'); print('下载成功')"

下载遇到问题?

  • 下载速度慢:Hugging Face 可使用镜像站 hf-mirror.com 加速下载
  • Ollama 下载失败:检查网络连接,或使用代理。Ollama 支持断点续传,重新运行命令即可继续
  • 磁盘空间不足:选择更小的模型规格(如 1.5B 仅需 1.1GB)
  • 需要更多帮助:查看我们的 DeepSeek 模型怎么用DeepSeek Model 部署教程

DeepSeek 模型下载常见问题

DeepSeek 模型下载需要付费吗? +
完全免费。DeepSeek 所有开源模型采用 MIT 协议,模型权重可以免费下载使用,包括商用。Ollama 平台下载也是完全免费的。你只需要有足够的磁盘空间和网络流量。
哪个模型最适合我? +
入门推荐 R1 8B(5.2GB),配置要求低,效果出色。日常使用足够。如果电脑配置较低,选 1.5B(1.1GB)。如果需要最强推理能力且有高端显卡,选 32B 或 70B。编程场景推荐 DeepSeek Coder 6.7B。
Ollama 下载的模型存在哪里? +
macOS:~/.ollama/models/;Linux:/usr/share/ollama/.ollama/models/;Windows:C:\Users\你的用户名\.ollama\models\。如需更改存储位置,可设置 OLLAMA_MODELS 环境变量。查看帮助:ollama --help。
如何删除已下载的模型释放空间? +
使用 Ollama 的话,运行 ollama rm 模型名 即可删除。例如:ollama rm deepseek-r1:70b。先用 ollama list 查看已安装的模型列表。
Ollama 和 Hugging Face 下载有什么区别? +
Ollama 下载的是量化后的模型(通常为 Q4_K_M 量化),体积更小,开箱即用,适合直接使用。Hugging Face 下载的是原始权重(FP16/FP32),体积更大,但精度更高,适合二次开发、微调或研究。日常使用推荐 Ollama,研究和开发推荐 Hugging Face。
下载的模型可以商用吗? +
是的。DeepSeek 开源模型(V3、R1、Coder、Janus)均采用 MIT License,允许商用、修改、分发。注意:R1 蒸馏版模型基于 Qwen 和 Llama 架构,需同时遵守各自原始协议(Apache 2.0 / Llama License),但均允许商用。

每日精选 Skill 推荐,免费送到你邮箱

输入邮箱,每天接收一个精选 AI Agent 技能推荐。完全免费,持续更新。

完全免费,取消任意时间。我们不会发送垃圾邮件。