DeepSeek 模型下载
全网最全的 DeepSeek 模型下载指南。Ollama 一行命令、Hugging Face 原版权重、官方 GitHub 仓库,所有渠道一步到位。
查看下载方式DeepSeek 模型下载量排行榜
数据来源:Ollama 平台实时统计与 Hugging Face 官方下载数据。以下为 DeepSeek 开源模型在各平台的累计下载量(截至 2026 年 7 月)。
提示:查看 DeepSeek 模型 了解各模型详细对比,或访问 DeepSeek 模型怎么用 获取使用指南。
三种下载方式
根据你的需求选择最合适的下载方式。新手推荐 Ollama,开发者推荐 Hugging Face。
Ollama 一键下载(最简单)
Ollama 是 DeepSeek 官方推荐的本地运行工具。DeepSeek R1 在 Ollama 上已有 88.3M+ 下载量,是下载 DeepSeek 模型最方便的方式。
第 1 步:安装 Ollama
访问 ollama.com/download,下载对应操作系统的安装包:
- Windows:下载 .exe 安装包,双击安装
- macOS:下载 .dmg 文件,拖入 Applications
- Linux:运行
curl -fsSL https://ollama.com/install.sh | sh
第 2 步:下载 DeepSeek 模型
打开终端,输入以下命令即可下载对应模型。首次运行会自动下载,后续直接启动。
DeepSeek R1 系列(推理模型,推荐)
| 模型 | 大小 | 最低配置 | 下载命令 |
| R1 1.5B | 1.1 GB | CPU | ollama pull deepseek-r1:1.5b |
| R1 7B | 4.7 GB | 8GB 显存 | ollama pull deepseek-r1:7b |
| R1 8B (推荐) | 5.2 GB | 8GB 显存 | ollama pull deepseek-r1:8b |
| R1 14B | 9.0 GB | 16GB 显存 | ollama pull deepseek-r1:14b |
| R1 32B | 20 GB | 24GB 显存 | ollama pull deepseek-r1:32b |
| R1 70B | 43 GB | 48GB 显存 | ollama pull deepseek-r1:70b |
| R1 671B | 404 GB | 多卡集群 | ollama pull deepseek-r1:671b |
其他模型系列
| 模型 | 大小 | 下载命令 |
| DeepSeek V3 | 404 GB | ollama pull deepseek-v3 |
| DeepSeek Coder | 776MB~19GB | ollama pull deepseek-coder |
DeepSeek V3 量化版本(Ollama 可用)
DeepSeek V3 是 671B 参数的 MoE 旗舰模型,Ollama 提供多种量化版本。注意:高精度版本(Q8_0 / FP16)默认上下文窗口仅为 4K,需手动调整配置。
| 模型标签 | 下载大小 | 上下文窗口 | 量化方式 | 下载命令 |
| deepseek-v3:latest 推荐 | 404 GB | 160K | Q4_K_M | ollama pull deepseek-v3 |
| deepseek-v3:671b | 404 GB | 160K | Q4_K_M | ollama pull deepseek-v3:671b |
| deepseek-v3:671b-q4_K_M | 404 GB | 160K | Q4_K_M | ollama pull deepseek-v3:671b-q4_K_M |
| deepseek-v3:671b-q8_0 | 713 GB | 4K 注意 | Q8_0 | ollama pull deepseek-v3:671b-q8_0 |
| deepseek-v3:671b-fp16 | 1.3 TB | 4K 注意 | FP16 | ollama pull deepseek-v3:671b-fp16 |
重要提示:Q8_0 和 FP16 版本默认上下文窗口仅为 4K(而非 160K),主要是因为高精度模型在 160K 上下文下显存需求巨大。如需更大上下文,建议使用 Q4_K_M 版本,或通过自定义 Modelfile 调整 num_ctx 参数。V3 模型最低需要约 400GB 显存/内存(多卡集群),普通个人电脑无法运行。
第 3 步:验证下载
# 查看已下载的模型列表
ollama list
# 运行模型测试
ollama run deepseek-r1:8b
第 4 步:理解模型量化(Quantization)
Ollama 下载的模型默认使用 Q4_K_M 量化,这是一种在模型大小和推理质量之间取得最佳平衡的量化方式。了解量化可以帮助你根据硬件配置选择最合适的模型版本。
什么是 Q4_K_M 量化?
Q4_K_M 是 Ollama 的默认量化格式,属于 GGUF 量化系列:
- Q4:表示使用 4-bit 量化,将原始 FP16(16-bit)权重压缩到 4-bit,模型体积缩小约 75%
- K:表示使用 K-quant 量化策略,对重要权重层使用更高精度(如 6-bit),对不重要的层使用更低精度
- M:表示 Medium 大小,在 Q4_K_S(小)和 Q4_K_L(大)之间取得平衡
- 效果:在几乎不损失推理质量的前提下,大幅降低显存占用和模型大小,是 Ollama 官方推荐的最佳选择
如何下载特定量化版本?
Ollama 支持指定具体的量化版本,在模型名后添加量化标签即可:
# 下载 Q4_K_M 量化版(默认,推荐)
ollama pull deepseek-r1:8b-q4_K_M
# 下载更小的 Q3_K_M 量化版(质量略降,体积更小)
ollama pull deepseek-r1:8b-q3_K_M
# 下载最高精度的 Q8_0 量化版(质量最高,体积最大)
ollama pull deepseek-r1:8b-q8_0
# 如果省略量化标签,默认下载 Q4_K_M
ollama pull deepseek-r1:8b
可用量化方式对比
GGUF 量化格式从低精度到高精度完整列表(高低排列):
| 量化格式 | 精度 | 体积比例 | 推荐场景 |
Q2_K |
2-bit | ~20% | 极低配置,质量损失较大 |
Q3_K_S |
3-bit | ~25% | 低配置,小体积优先 |
Q3_K_M |
3-bit | ~28% | 低配置,中等质量 |
Q3_K_L |
3-bit | ~30% | 低配置,较高质量 |
Q4_0 |
4-bit | ~32% | 经典 Q4 量化,兼容性好 |
Q4_K_S |
4-bit | ~35% | 平衡配置,小体积 |
Q4_K_M 推荐 |
4-bit | ~38% | 推荐默认,最佳平衡 |
Q4_K_L |
4-bit | ~42% | 偏好质量,体积稍大 |
Q5_0 |
5-bit | ~45% | 中高配置,经典 Q5 |
Q5_K_S |
5-bit | ~48% | 中高配置,小体积 |
Q5_K_M |
5-bit | ~50% | 高质量推理,推荐 |
Q6_K |
6-bit | ~60% | 高配置,接近无损 |
Q8_0 |
8-bit | ~70% | 最高精度量化 |
FP16 |
16-bit | 100% | 原始精度,无损 |
体积比例以 FP16 原始模型为基准。日常使用推荐 Q4_K_M,如需最高质量可选 Q5_K_M 或 Q6_K。
更多模型对比和选型建议,请参考 DeepSeek 模型 和 DeepSeek Model 部署教程。
Ollama 高级下载技巧
掌握以下高级技巧,让 Ollama 下载更高效、更灵活。
并行下载多个模型
Ollama 支持同时下载多个模型,只需在多个终端窗口分别运行 ollama pull 命令即可。每个下载任务独立进行,互不影响。
# 终端 1:下载 R1 8B
ollama pull deepseek-r1:8b
# 终端 2:同时下载 Coder 6.7B
ollama pull deepseek-coder:6.7b
# 终端 3:同时下载 V3
ollama pull deepseek-v3
注意并行下载会分摊带宽,建议根据网络带宽合理分配,一般 2-3 个并行任务即可。
断点续传(恢复中断的下载)
Ollama 原生支持断点续传。如果下载过程中网络中断或手动取消,下次运行相同的 ollama pull 命令会自动从断点处继续下载,无需重新开始。
# 下载中断后,直接重新运行即可
ollama pull deepseek-r1:32b
# Ollama 会自动检测已下载的部分,从断点继续
大模型(如 70B/671B)下载时间较长,断点续传功能尤为重要。Ollama 会将已下载的层(layers)缓存到本地,只下载缺失的部分。
更改模型下载目录
默认情况下,Ollama 将模型存储在系统盘,大模型可能占用大量空间。通过设置 OLLAMA_MODELS 环境变量,可以将模型存储到其他磁盘。
# Linux / macOS — 在 ~/.bashrc 或 ~/.zshrc 中添加
export OLLAMA_MODELS=/data/ollama-models
# Windows PowerShell — 设置环境变量
[Environment]::SetEnvironmentVariable('OLLAMA_MODELS', 'D:\ollama-models', 'User')
# Windows CMD
setx OLLAMA_MODELS "D:\ollama-models"
# 设置后重启 Ollama 服务生效
# Linux: systemctl restart ollama
# macOS: 退出并重新打开 Ollama 应用
# Windows: 在任务栏退出 Ollama 后重新启动
通过代理下载
如果网络环境受限,可以通过设置 HTTP/HTTPS 代理让 Ollama 通过代理服务器下载模型。
# Linux / macOS — 设置代理环境变量后启动 Ollama
export HTTP_PROXY=http://127.0.0.1:7890
export HTTPS_PROXY=http://127.0.0.1:7890
ollama pull deepseek-r1:8b
# Windows PowerShell
$env:HTTP_PROXY="http://127.0.0.1:7890"
$env:HTTPS_PROXY="http://127.0.0.1:7890"
ollama pull deepseek-r1:8b
# 如果使用 systemd 管理 Ollama 服务,编辑服务文件
sudo systemctl edit ollama.service
# 添加以下内容:
# [Service]
# Environment="HTTP_PROXY=http://127.0.0.1:7890"
# Environment="HTTPS_PROXY=http://127.0.0.1:7890"
sudo systemctl daemon-reload
sudo systemctl restart ollama
验证模型完整性
下载完成后,可以通过以下方式验证模型文件的完整性,确保没有损坏。
# 查看模型详细信息(包括大小、量化方式、层数等)
ollama show deepseek-r1:8b
# 列出所有已下载模型,确认大小是否正确
ollama list
# 快速测试模型是否正常
ollama run deepseek-r1:8b "你好,请简单介绍一下自己"
# 查看模型文件的实际存储路径
# Linux/macOS
ls -lh ~/.ollama/models/blobs/
# Windows
dir C:\Users\%USERNAME%\.ollama\models\blobs\
使用指定摘要下载特定版本
Ollama 支持通过 SHA256 摘要(Digest)精确下载特定版本的模型,确保版本一致性。
# 查看模型的所有可用版本和摘要
ollama show deepseek-r1:8b
# 使用 SHA256 摘要精确下载特定版本
ollama pull deepseek-r1@sha256:xxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxx
# 示例:锁定特定版本,避免自动更新
# 这在生产环境中非常有用,确保所有节点运行相同版本
在企业或生产环境中,使用 SHA256 摘要可以确保所有部署节点使用完全一致的模型版本,避免因版本差异导致输出不一致。
更多 Ollama 使用技巧,请参考 DeepSeek Model 部署教程 和 DeepSeek 模型怎么用。
Hugging Face 下载原版权重
适合需要原始模型权重进行二次开发、微调(Fine-tuning)或研究用途的开发者。
DeepSeek 官方 Hugging Face 仓库
DeepSeek AI 官方在 Hugging Face 上发布了所有模型权重:
DeepSeek V3
671B MoE 旗舰模型,完整权重下载。支持 Transformers 和 vLLM 加载。
- huggingface.co/deepseek-ai/DeepSeek-V3
- 模型大小:404GB(完整版)
- 授权协议:MIT
DeepSeek R1
推理增强模型,提供完整版和蒸馏版。支持 1.5B~671B 多种规格。
- huggingface.co/deepseek-ai/DeepSeek-R1
- 蒸馏版:Qwen-2.5 / Llama-3.x 基底
- 授权协议:MIT
DeepSeek Coder
代码专用模型,2T Token 训练。提供 1.3B/6.7B/33B 三种规格。
- huggingface.co/deepseek-ai/DeepSeek-Coder
- 模型大小:776MB~19GB
- 授权协议:MIT
DeepSeek Janus
多模态理解与生成模型,支持文生图和图像理解。最新版 Janus-Pro。
- huggingface.co/deepseek-ai/Janus
- 支持 7B 多模态
- 授权协议:MIT
下载方法
# 方法一:使用 huggingface-cli(推荐)
pip install huggingface_hub
huggingface-cli download deepseek-ai/DeepSeek-R1 --local-dir ./DeepSeek-R1
# 方法二:使用 git clone(需要 git-lfs)
git lfs install
git clone https://huggingface.co/deepseek-ai/DeepSeek-R1
# 方法三:使用 Python 下载
from huggingface_hub import snapshot_download
snapshot_download(repo_id="deepseek-ai/DeepSeek-R1", local_dir="./DeepSeek-R1")
使用 Transformers 加载
from transformers import AutoTokenizer, AutoModelForCausalLM
model_name = "deepseek-ai/DeepSeek-R1-Distill-Qwen-7B"
tokenizer = AutoTokenizer.from_pretrained(model_name)
model = AutoModelForCausalLM.from_pretrained(
model_name,
torch_dtype="auto",
device_map="auto"
)
Hugging Face 模型下载完整指南
深入了解 Hugging Face 上 DeepSeek 所有官方仓库、多种下载方式、国内镜像加速以及模型文件结构说明。
DeepSeek 官方 Hugging Face 全部仓库
DeepSeek AI 在 Hugging Face 上维护了多个官方仓库,涵盖所有模型系列和蒸馏版本:
| 仓库名称 | 模型类型 | 大小 | 协议 |
deepseek-ai/DeepSeek-V3 |
671B MoE | ~687GB | MIT |
deepseek-ai/DeepSeek-R1 |
671B MoE 推理 | ~720GB | MIT |
deepseek-ai/DeepSeek-R1-Distill-Qwen-1.5B |
1.5B 蒸馏 | ~3.5GB | MIT |
deepseek-ai/DeepSeek-R1-Distill-Qwen-7B |
7B 蒸馏 | ~15GB | MIT |
deepseek-ai/DeepSeek-R1-Distill-Qwen-14B |
14B 蒸馏 | ~30GB | MIT |
deepseek-ai/DeepSeek-R1-Distill-Qwen-32B |
32B 蒸馏 | ~65GB | MIT |
deepseek-ai/DeepSeek-R1-Distill-Llama-8B |
8B 蒸馏 | ~16GB | MIT |
deepseek-ai/DeepSeek-R1-Distill-Llama-70B |
70B 蒸馏 | ~140GB | MIT |
deepseek-ai/DeepSeek-Coder-V2 |
代码 MoE | ~240GB | MIT |
deepseek-ai/Janus-Pro-7B |
多模态 | ~15GB | MIT |
四种下载方式详解
方式一:huggingface-cli(推荐)
Hugging Face 官方命令行工具,支持断点续传和多线程下载,是下载大模型的最佳方式。
# 安装 huggingface-cli
pip install -U huggingface_hub
# 下载完整仓库
huggingface-cli download deepseek-ai/DeepSeek-R1 --local-dir ./DeepSeek-R1
# 下载蒸馏版(推荐入门)
huggingface-cli download deepseek-ai/DeepSeek-R1-Distill-Qwen-7B --local-dir ./R1-Distill-7B
# 排除某些大文件以节省空间
huggingface-cli download deepseek-ai/DeepSeek-R1 --local-dir ./DeepSeek-R1 --exclude "*.bin"
方式二:Git Clone + Git LFS
适合需要 Git 版本管理的开发者,可以跟踪模型更新。
# 安装 git-lfs
git lfs install
# 克隆仓库(大文件通过 LFS 下载)
git clone https://huggingface.co/deepseek-ai/DeepSeek-R1
# 如果 LFS 文件下载失败,手动拉取
cd DeepSeek-R1
git lfs pull
方式三:Python snapshot_download
在 Python 代码中直接下载,适合在 Jupyter Notebook 或脚本中使用。
from huggingface_hub import snapshot_download
# 下载到指定目录
snapshot_download(
repo_id="deepseek-ai/DeepSeek-R1-Distill-Qwen-7B",
local_dir="./deepseek-r1-distill",
resume_download=True, # 支持断点续传
max_workers=4 # 多线程下载
)
方式四:wget 直接下载
适合只需要单个文件的场景,无需安装任何工具。
# 下载单个模型文件
wget https://huggingface.co/deepseek-ai/DeepSeek-R1-Distill-Qwen-7B/resolve/main/model.safetensors
# 批量下载(需要先获取文件列表)
# 替换 huggingface.co 为 hf-mirror.com 以加速(见下方)
国内加速下载:使用 hf-mirror.com
Hugging Face 官方服务器在海外,国内下载速度可能较慢。hf-mirror.com 是 Hugging Face 的国内镜像站,可以大幅提升下载速度。
方法一:设置环境变量(推荐)
设置后所有 Hugging Face 工具自动使用镜像:
# Linux / macOS
export HF_ENDPOINT=https://hf-mirror.com
# Windows PowerShell
$env:HF_ENDPOINT = "https://hf-mirror.com"
# 然后正常使用 huggingface-cli 下载
huggingface-cli download deepseek-ai/DeepSeek-R1-Distill-Qwen-7B --local-dir ./model
方法二:替换 URL 前缀
将 huggingface.co 替换为 hf-mirror.com:
# 原始链接
# https://huggingface.co/deepseek-ai/DeepSeek-R1
# 镜像链接
# https://hf-mirror.com/deepseek-ai/DeepSeek-R1
# 使用 git clone 镜像
git clone https://hf-mirror.com/deepseek-ai/DeepSeek-R1
方法三:Python 中使用镜像
from huggingface_hub import snapshot_download
import os
os.environ["HF_ENDPOINT"] = "https://hf-mirror.com"
snapshot_download(
repo_id="deepseek-ai/DeepSeek-R1-Distill-Qwen-7B",
local_dir="./model"
)
模型文件结构说明
下载完成后,Hugging Face 仓库目录通常包含以下文件:
| 文件名 | 说明 | 是否必需 |
model.safetensors / model-00001-of-000XX.safetensors |
模型权重文件(SafeTensors 格式),大模型会分片存储 | 必需 |
config.json |
模型架构配置文件(层数、隐藏层大小、注意力头数等) | 必需 |
tokenizer.json / tokenizer_config.json |
分词器文件和配置,用于文本编码/解码 | 必需 |
generation_config.json |
生成参数配置(温度、top_p、max_length 等默认值) | 可选 |
model.safetensors.index.json |
分片权重索引文件,记录每个权重分片的位置 | 分片时必需 |
README.md |
模型说明文档,包含使用方法和注意事项 | 可选 |
LICENSE |
授权协议文件 | 可选 |
更多 Hugging Face 使用技巧和模型部署方案,请参考 DeepSeek Model 部署教程 和 DeepSeek Model。
ModelScope 国内下载(魔搭社区)
ModelScope(魔搭社区)是阿里巴巴推出的 AI 模型开源平台,国内下载速度远超 Hugging Face。DeepSeek 官方已在 ModelScope 上建立了镜像仓库,国内用户推荐优先使用。
什么是 ModelScope?
ModelScope(魔搭社区)是国内最大的 AI 模型开源平台之一,由阿里巴巴达摩院发起。对于国内用户来说,ModelScope 相比 Hugging Face 有以下优势:
- 下载速度极快:服务器部署在国内,下载速度可达 50MB/s+,远超 Hugging Face 直连
- 无需代理:国内网络直连,无需配置代理或镜像站
- 官方镜像:DeepSeek 官方在 ModelScope 上维护了所有模型的镜像仓库
- 完全免费:与 Hugging Face 一样,模型下载完全免费
- 文件结构一致:与 Hugging Face 仓库结构完全相同,可直接用于 Transformers 加载
DeepSeek 官方 ModelScope 仓库
| 仓库名称 | 模型类型 | 大小 | 链接 |
deepseek-ai/DeepSeek-V3 |
671B MoE | ~687GB | modelscope.cn/models/deepseek-ai/DeepSeek-V3 |
deepseek-ai/DeepSeek-R1 |
671B 推理 | ~720GB | modelscope.cn/models/deepseek-ai/DeepSeek-R1 |
deepseek-ai/DeepSeek-R1-Distill-Qwen-7B |
7B 蒸馏 | ~15GB | modelscope.cn/models/deepseek-ai/DeepSeek-R1-Distill-Qwen-7B |
deepseek-ai/DeepSeek-Coder-V2 |
代码 MoE | ~240GB | modelscope.cn/models/deepseek-ai/DeepSeek-Coder-V2 |
三种下载方式
方式一:ModelScope SDK(推荐)
使用 ModelScope 官方 Python SDK 下载,支持断点续传和多线程加速,是国内下载大模型的最佳方式。
# 安装 ModelScope SDK
pip install modelscope
# 下载完整模型(自动从国内节点下载)
from modelscope import snapshot_download
snapshot_download(
model_id="deepseek-ai/DeepSeek-R1-Distill-Qwen-7B",
cache_dir="./deepseek-models",
revision="master"
)
# 下载 V3 完整版(需要约 687GB 磁盘空间)
snapshot_download(
model_id="deepseek-ai/DeepSeek-V3",
cache_dir="./deepseek-models"
)
方式二:Git Clone
ModelScope 支持 Git 协议,可直接使用 git clone 克隆仓库。
# 安装 git-lfs
git lfs install
# 克隆 ModelScope 仓库(国内速度极快)
git clone https://www.modelscope.cn/deepseek-ai/DeepSeek-R1-Distill-Qwen-7B.git
# 如果 LFS 文件下载失败,手动拉取
cd DeepSeek-R1-Distill-Qwen-7B
git lfs pull
方式三:网页直接下载
访问 ModelScope 网页,在模型页面直接点击下载按钮。适合只需下载单个文件或小模型的场景。
# 访问 ModelScope 网页
# https://modelscope.cn/models/deepseek-ai/DeepSeek-R1-Distill-Qwen-7B/files
# 在文件列表中,点击单个文件即可下载
ModelScope vs Hugging Face 对比
| 对比维度 | ModelScope(魔搭) | Hugging Face |
| 国内下载速度 | 极快(50MB/s+) | 较慢(需镜像或代理) |
| 网络要求 | 直连,无需代理 | 可能需要代理或 hf-mirror.com |
| 文件结构 | 与 Hugging Face 完全一致 | 标准 SafeTensors 格式 |
| SDK 支持 | modelscope Python SDK |
huggingface_hub Python SDK |
| 模型数量 | 数千个模型 | 数十万个模型(全球最大) |
| 社区活跃度 | 国内活跃 | 全球最活跃 |
| 推荐用户 | 国内用户首选 | 海外用户 / 国际协作 |
国内用户建议优先使用 ModelScope 下载模型,速度更快且无需配置。下载后的文件结构与 Hugging Face 完全一致,可直接使用 Transformers 加载。更多信息请参考 DeepSeek Model 部署教程 和 DeepSeek Model。
GitHub 官方仓库
DeepSeek 官方 GitHub 仓库包含模型权重、推理代码、技术论文和配置文档。
DeepSeek V3
旗舰模型完整代码和文档。包含模型架构说明、推理示例、性能基准测试结果。
- github.com/deepseek-ai/DeepSeek-V3
- Stars: 90k+
- 包含推理代码和论文
DeepSeek R1
推理模型官方仓库。包含训练方法说明、蒸馏模型、推理示例。
- github.com/deepseek-ai/DeepSeek-R1
- Stars: 85k+
- 强化学习训练细节
DeepSeek Coder
代码模型官方仓库。2T Token 训练,支持多种编程语言。
- github.com/deepseek-ai/DeepSeek-Coder
- Stars: 10k+
- 支持 FIM 代码补全
模型文件格式说明
了解不同模型文件格式的区别,帮助你根据使用场景选择最合适的格式和精度。
GGUF 格式(Ollama 使用)
GGUF(GPT-Generated Unified Format)是 llama.cpp 项目推出的模型文件格式,专为高效本地推理设计。Ollama 底层使用 llama.cpp,因此所有通过 Ollama 下载的模型都是 GGUF 格式。
GGUF 格式特点
- 单文件存储:模型权重、配置、分词器全部打包在一个 .gguf 文件中,方便传输和管理
- 内置量化:支持多种量化精度(Q2_K 到 Q8_0),可根据硬件资源灵活选择
- CPU 推理优化:针对 CPU 推理做了深度优化,无需 GPU 也能运行
- 内存映射:支持 mmap() 内存映射加载,零拷贝启动,加载速度极快
- 跨平台兼容:Windows、macOS、Linux 通用,无需额外依赖
- 适用场景:本地推理、个人使用、低配置设备、快速部署
SafeTensors 格式(Hugging Face 使用)
SafeTensors 是由 Hugging Face 推出的安全模型权重存储格式,现已成为 Hugging Face 平台的默认格式。所有 DeepSeek 官方 Hugging Face 仓库均使用 SafeTensors 格式。
SafeTensors 格式特点
- 安全性:相比传统的 pickle 格式(.pt/.bin),SafeTensors 不会执行任意代码,杜绝了模型文件中的恶意代码风险
- 零拷贝加载:支持内存映射,加载大模型时无需额外内存拷贝
- 懒加载:支持按需加载部分权重,不需要一次性将整个模型加载到内存
- 分片支持:大模型可拆分为多个 .safetensors 文件,便于分布式存储和加载
- 框架无关:PyTorch、TensorFlow、JAX 等主流框架均可读取
- 适用场景:模型训练、微调(Fine-tuning)、研究开发、生产部署
FP16、FP32 与量化模型的区别
模型精度直接影响模型大小、推理速度和输出质量。以下是对比说明:
| 精度类型 | 每个参数占用 | 7B 模型大小 | 质量 | 适用场景 |
| FP32 | 32 bit (4 bytes) | ~28 GB | 原始精度 | 研究、训练、最高精度要求 |
| FP16 | 16 bit (2 bytes) | ~14 GB | 几乎无损 | 标准部署、微调、Hugging Face 默认 |
| Q8_0 | 8 bit (1 byte) | ~7 GB | 极轻微损失 | 高质量本地推理 |
| Q6_K | 6 bit | ~5.6 GB | 接近无损 | 高配置本地推理 |
| Q5_K_M | 5 bit | ~4.7 GB | 高质量 | 推荐的高质量量化 |
| Q4_K_M 推荐 | 4 bit | ~4.0 GB | 良好 | Ollama 默认,日常使用最佳 |
| Q3_K_M | 3 bit | ~3.2 GB | 可接受 | 低配置设备 |
| Q2_K | 2 bit | ~2.5 GB | 明显损失 | 极低配置,应急使用 |
以上大小以 7B 参数模型为例估算。实际大小会因模型架构和分词器大小略有差异。
如何选择格式和精度?
根据你的需求快速选择最合适的方案:
个人日常使用
选择 GGUF + Q4_K_M,通过 Ollama 下载。体积小、速度快、质量好,8GB 显存即可流畅运行 7B/8B 模型。
模型研究与微调
选择 SafeTensors + FP16,从 Hugging Face 下载原始权重。保留完整精度,支持 PyTorch/TensorFlow 训练。
高性能推理
选择 GGUF + Q5_K_M 或 Q6_K,在质量几乎无损的前提下,体积比 FP16 减少约 40-50%。
低配置设备
选择 GGUF + Q3_K_M 或 Q4_K_S,更小的体积适合 4-6GB 显存设备,或纯 CPU 推理场景。
更多部署方案和硬件选型建议,请参考 DeepSeek Model 部署教程 和 DeepSeek Model。
下载速度优化指南
不同下载渠道的速度、稳定性和适用场景各有不同。根据你的网络环境和地理位置,选择最优的下载方式。
| 下载渠道 | 国内速度 | 稳定性 | 推荐地区 | 适用场景 |
| Ollama 官方 registry.ollama.ai |
中等 5-20 MB/s |
稳定 CDN 全球加速 |
海外 / 全球通用 | 一键下载,开箱即用 新手首选 |
| Hugging Face + hf-mirror.com |
较快 10-40 MB/s(镜像) |
稳定 镜像站维护良好 |
中国(需镜像) | 开发研究,微调训练 需原始权重 |
| ModelScope 魔搭 推荐 modelscope.cn |
极快 20-50+ MB/s |
稳定 阿里云 CDN |
中国最佳 | 国内用户首选 直连高速,无需配置 |
| GitHub Releases github.com |
较慢 1-5 MB/s |
一般 偶尔受限 |
海外 / 需代理 | 获取源码和文档 非模型权重下载 |
不同场景的最佳选择
国内用户 · 日常使用
首选 Ollama 官方,速度稳定。如需下载原始权重,用 ModelScope 或 Hugging Face + hf-mirror.com。
海外用户
直接使用 Ollama 官方 和 Hugging Face 官方,CDN 全球加速,下载速度通常很快。
研究开发 · 需要原始权重
国内:ModelScope SDK 下载。海外:Hugging Face CLI。都需要完整 FP16/FP32 权重。
大模型(70B+)下载
务必使用支持断点续传的方式。Ollama 和 ModelScope SDK 都原生支持。大文件下载建议夜间进行,避免网络高峰。
提速技巧总结
- 使用国内镜像:Hugging Face 设置
HF_ENDPOINT=https://hf-mirror.com,速度提升 5-10 倍 - 优先 ModelScope:国内用户下载原始权重,ModelScope 速度最快,直连无需代理
- Ollama 设置代理:如直连较慢,设置
HTTP_PROXY环境变量通过代理加速 - 避开高峰时段:大文件下载建议在凌晨或上午进行,避开晚高峰(20:00-23:00)
- 多线程下载:Hugging Face CLI 和 ModelScope SDK 均支持多线程,可设置
max_workers参数 - 使用有线网络:Wi-Fi 下载大文件可能不稳定,建议使用有线网络连接
更多下载技巧和部署方案,请参考 DeepSeek Model 部署教程、DeepSeek 模型怎么用 和 DeepSeek 模型。
下载后验证与使用
下载完成后,建议验证模型完整性,确保文件没有损坏。
Ollama 验证
# 查看下载的模型信息(大小、量化方式、修改时间)
ollama list
# 查看模型详细信息
ollama show deepseek-r1:8b
Hugging Face 验证
# 检查模型文件完整性
ls -lh ./DeepSeek-R1/
# 使用 Python 快速测试
python -c "from transformers import AutoTokenizer; t = AutoTokenizer.from_pretrained('./DeepSeek-R1'); print('下载成功')"
下载遇到问题?
- 下载速度慢:Hugging Face 可使用镜像站 hf-mirror.com 加速下载
- Ollama 下载失败:检查网络连接,或使用代理。Ollama 支持断点续传,重新运行命令即可继续
- 磁盘空间不足:选择更小的模型规格(如 1.5B 仅需 1.1GB)
- 需要更多帮助:查看我们的 DeepSeek 模型怎么用 和 DeepSeek Model 部署教程
DeepSeek 模型下载常见问题
ollama rm 模型名 即可删除。例如:ollama rm deepseek-r1:70b。先用 ollama list 查看已安装的模型列表。