DeepSeek 开源模型完整列表
DeepSeek 已开源 6 大系列、20+ 个模型。全部 MIT 协议,免费可商用。一目了然的模型目录,帮你快速找到需要的模型。
查看模型列表模型系列总览
DeepSeek 目前开源了以下 6 大模型系列,覆盖对话、推理、编程、多模态、视觉、数学证明等场景。
DeepSeek V3 — 通用大语言模型
当前 DeepSeek 最强通用模型。671B 参数 MoE 架构,每次推理仅激活 37B 参数,高效且性能强大。
| 模型名称 | DeepSeek V3 |
| 参数量 | 671B(MoE,37B 激活/Token) |
| 模型大小 | 404 GB |
| 上下文窗口 | 160K tokens |
| 训练成本 | 约 557 万美元(极低) |
| 开源协议 | MIT License(可商用) |
| Ollama 下载 | ollama pull deepseek-v3(3.8M+ 下载) |
| GitHub | github.com/deepseek-ai/DeepSeek-V3 |
| 适用场景 | 通用对话、写作、翻译、知识问答、内容创作 |
DeepSeek R1 — 推理增强模型
采用强化学习训练,在数学、编程、逻辑推理方面表现惊艳。R1 完整版 671B 参数为最强推理模型;蒸馏版将 R1 的推理能力迁移到 Qwen 和 Llama 等小模型上,让普通硬件也能运行。提供 1.5B 到 671B 共 7 种规格,是 Ollama 上下载量最高的模型。
| 模型名称 | DeepSeek R1(最新版 R1-0528) |
| 参数量 | 1.5B / 7B / 8B / 14B / 32B / 70B / 671B |
| 模型大小 | 1.1GB ~ 404GB |
| 上下文窗口 | 128K(671B 为 160K) |
| 蒸馏基底 | Qwen-2.5 + Llama-3.1/3.3 |
| Ollama 下载量 | 88.3M+(35 个版本) |
| GitHub | github.com/deepseek-ai/DeepSeek-R1 |
| 适用场景 | 数学解题、编程、逻辑推理、复杂问题分析 |
R1 蒸馏版完整规格与 Ollama 下载
R1 蒸馏版是将 R1 671B 的推理能力通过知识蒸馏迁移到小模型上,让你在消费级硬件上也能体验强大的推理能力。以下为全部可用版本:
| 模型版本 | 蒸馏基底 | 模型大小 | 上下文 | 推荐硬件 | Ollama 命令 |
|---|---|---|---|---|---|
| R1-0528-Qwen3-8B 最新 | Qwen3 | 5.2GB | 128K | 8GB 显存 | ollama run deepseek-r1:8b |
| R1-Distill-Qwen-1.5B | Qwen-2.5 | 1.1GB | 128K | CPU 可运行 | ollama run deepseek-r1:1.5b |
| R1-Distill-Qwen-7B | Qwen-2.5 | 4.7GB | 128K | 8GB 显存 | ollama run deepseek-r1:7b |
| R1-Distill-Qwen-14B | Qwen-2.5 | 9.0GB | 128K | 16GB 显存 | ollama run deepseek-r1:14b |
| R1-Distill-Qwen-32B | Qwen-2.5 | 20GB | 128K | 24GB 显存 | ollama run deepseek-r1:32b |
| R1-Distill-Llama-70B | Llama-3.3 | 43GB | 128K | 48GB 显存 | ollama run deepseek-r1:70b |
| R1-671B 完整版 | 原生 | 404GB | 160K | 多卡集群 | ollama run deepseek-r1:671b |
DeepSeek Coder — 代码专用模型
专注代码生成与理解。使用 2 万亿 Token 训练(87% 代码 + 13% 中英文自然语言),支持 FIM 代码补全。
| 模型版本 | 1.3B / 6.7B / 33B |
| 模型大小 | 776MB / 3.8GB / 19GB |
| 上下文窗口 | 16K tokens |
| 训练数据 | 2 万亿 Token(87% 代码 + 13% 中英文) |
| Ollama 下载量 | 4.2M+ |
| GitHub | github.com/deepseek-ai/DeepSeek-Coder |
| 适用场景 | 代码生成、代码补全、代码解释、Bug 修复、代码审查 |
DeepSeek Janus-Pro — 统一多模态理解与生成
DeepSeek Janus-Pro-7B 是 DeepSeek 最新开源的统一多模态模型,同时支持图像理解和文本到图像生成。其核心创新在于 解耦视觉编码(Decoupled Visual Encoding)技术——为"理解"和"生成"两条路径分别设计独立的视觉编码器,突破了传统统一多模态模型在理解和生成质量上的权衡困境。
解耦视觉编码架构
Janus-Pro 的核心创新是 Decoupled Visual Encoding——将视觉编码分为两条独立路径:
使用 SigLIP 编码器提取图像的高层语义特征,专注于语义级别的视觉理解。该编码器擅长捕捉图像中的物体类别、场景关系、文字内容等高级语义信息,为图像问答、视觉推理、图像描述等任务提供高质量的特征表示。
使用 VQ Tokenizer(向量量化分词器)将图像转换为离散的视觉 token 序列,用于图像生成。VQ Tokenizer 将连续像素空间映射到离散的 codebook 索引,使得语言模型可以像生成文本 token 一样自回归地生成视觉 token,最终解码为图像。
两条路径共享同一个 Transformer 语言模型作为"大脑",但视觉编码各自独立。这种设计避免了传统方案中单一编码器在理解和生成任务上的冲突,让 Janus-Pro 在两个方向上都达到顶尖水平。
图像生成能力
Janus-Pro-7B 支持 384×384 分辨率的文本到图像生成。其生成流程如下:
- 用户输入文本描述(prompt)
- 语言模型将文本转换为视觉 token 序列(通过 VQ Tokenizer 的 codebook)
- 自回归生成离散的视觉 token,每个 token 对应 codebook 中的一个索引
- VQ Tokenizer 解码器将 token 序列重构为 384×384 RGB 图像
虽然分辨率(384×384)不及专用图像生成模型(如 SDXL 的 1024×1024),但作为统一多模态模型,Janus-Pro 在理解与生成兼顾的场景下表现优异,生成质量接近专用模型。
多模态理解能力
Image Captioning
对任意图像生成准确、详细的自然语言描述。涵盖物体、场景、动作、颜色、空间关系等要素,支持中英文双语描述。
Visual Question Answering
针对图像内容回答自然语言问题。支持计数、比较、存在性判断、属性查询等多种问答类型,在 VQAv2、GQA 等基准上表现出色。
Visual Reasoning
对图像进行逻辑推理和因果分析。理解图像中隐含的关系、意图和事件因果链,支持"如果……会怎样"类的假设推理。
Text-to-Image Generation
根据文本描述生成 384×384 分辨率图像。覆盖人物、场景、物体、抽象概念等多种主题,支持风格化描述。
| 模型版本 | Janus(1.3B)/ Janus-Pro-7B(最新)/ JanusFlow |
| 参数量 | 1.3B(Janus)/ 7B(Janus-Pro-7B) |
| 核心架构 | 解耦视觉编码(Decoupled Visual Encoding)— 理解与生成路径独立 |
| 理解编码器 | SigLIP 编码器 — 提取高层语义特征,用于视觉理解 |
| 生成编码器 | VQ Tokenizer — 离散视觉 token 序列,用于图像生成 |
| 图像生成分辨率 | 384×384 像素 |
| 核心功能 | 统一多模态理解(图像描述/VQA/视觉推理)+ 文本到图像生成 |
| 开源协议 | MIT License |
| Hugging Face | huggingface.co/deepseek-ai/Janus-Pro-7B |
| GitHub | github.com/deepseek-ai/Janus |
| 适用场景 | 图像问答、图文理解、AI 绘画、多模态对话、视觉内容创作 |
推理代码示例
以下代码来自 GitHub 仓库 generation_inference.py,展示 Janus-Pro-7B 的多模态理解和图像生成:
import torch from transformers import AutoModelForCausalLM from janus.models import MultiModalityCausalLM, VLChatProcessor from PIL import Image # 1. 加载模型 model_path = "deepseek-ai/Janus-Pro-7B" vl_chat_processor = VLChatProcessor.from_pretrained(model_path) tokenizer = vl_chat_processor.tokenizer vl_gpt = AutoModelForCausalLM.from_pretrained( model_path, trust_remote_code=True, torch_dtype=torch.bfloat16, device_map="auto" ).eval() # 2. 多模态理解 — 图像问答 conversation = [ { "role": "<|User|>", "content": "<image_placeholder>\n这张图片中有什么?请详细描述。", "images": ["images/demo.jpg"], }, {"role": "<|Assistant|>", "content": ""}, ] prepare_inputs = vl_chat_processor( conversations=conversation, images=[Image.open("images/demo.jpg")], force_batchify=True ).to(vl_gpt.device) inputs_embeds = vl_gpt.prepare_inputs_embeds(**prepare_inputs) outputs = vl_gpt.language_model.generate( inputs_embeds=inputs_embeds, attention_mask=prepare_inputs.attention_mask, pad_token_id=tokenizer.eos_token_id, max_new_tokens=512, do_sample=False, ) answer = tokenizer.decode(outputs[0], skip_special_tokens=True) print(f"理解结果: {answer}") # 3. 图像生成 — 文本到图像 gen_conversation = [ { "role": "<|User|>", "content": "生成一张图片:一只可爱的橘猫坐在窗台上,阳光洒在它身上。", }, {"role": "<|Assistant|>", "content": ""}, ] gen_inputs = vl_chat_processor( conversations=gen_conversation, force_batchify=True ).to(vl_gpt.device) # 设置生成图像所需的特殊 token gen_inputs_embeds = vl_gpt.prepare_inputs_embeds(**gen_inputs) gen_outputs = vl_gpt.language_model.generate( inputs_embeds=gen_inputs_embeds, attention_mask=gen_inputs.attention_mask, pad_token_id=tokenizer.eos_token_id, max_new_tokens=2048, do_sample=True, temperature=0.8, ) # 解码生成的视觉 token 为图像 generated_tokens = gen_outputs[0] decoded_image = vl_gpt.gen_vision_model.decode_code( generated_tokens, shape=[384, 384] ) decoded_image.save("generated_cat.png") print("图像已保存为 generated_cat.png")
DeepSeek VL2 — Mixture-of-Experts 视觉语言模型
DeepSeek VL2 是 DeepSeek 开源的 MoE(Mixture-of-Experts)视觉语言模型,采用混合专家架构,在保持高效推理的同时实现强大的视觉理解能力。该模型支持动态分辨率,可处理任意分辨率的图像,无需强制裁剪或缩放。
核心架构设计
DeepSeek VL2 采用 Mixture-of-Experts 视觉语言架构,由两大核心组件构成:
采用 SigLIP-SO400M + SAM-B 双编码器组合。SigLIP 负责高层次的语义理解,SAM-B 提供细粒度的像素级视觉特征。两者融合后可同时捕捉全局语义和局部细节,为动态分辨率处理和精确视觉定位奠定基础。
使用 DeepSeekMoE 作为语言基座——DeepSeek 自研的混合专家模型,每次推理仅激活部分专家参数,实现高效计算。视觉特征通过 MLP 投影器与语言模型的 token embedding 空间对齐,实现视觉-语言跨模态理解。
动态分辨率技术
DeepSeek VL2 的核心创新之一是 动态分辨率(Dynamic Resolution)支持。传统视觉语言模型通常将图像强制裁剪或缩放为固定尺寸(如 224×224 或 336×336),导致小文字模糊、宽高比失真。VL2 通过以下机制解决了这一问题:
- 自适应切块:根据图像原始宽高比和分辨率,自动将图像切分为多个子图块(tiles),每个子图块独立编码
- 全局缩略图:同时保留一张全局缩略图,用于捕捉整体构图和上下文信息
- 分辨率自适应:支持从低分辨率缩略图到高分辨率扫描件的任意分辨率输入,无需人工预处理
- 动态 token 分配:根据图像内容复杂度,智能分配视觉 token 数量——简单图表使用较少 token,密集文档使用更多 token
三种规格对比
VL2 提供三种规格,满足不同场景需求。所有规格均采用 MIT License 开源:
| 规格 | 激活参数 | 总参数 | 推荐场景 | 硬件要求 |
|---|---|---|---|---|
| VL2-Tiny | 1.0B | ~3.4B | 移动端、边缘设备、轻量 OCR | 4GB 显存 |
| VL2-Small | 2.8B | ~8.1B | 文档理解、图表分析、单卡部署 | 8GB 显存 |
| VL2 | 4.5B | ~13.5B | 高精度 OCR、复杂推理、企业级部署 | 16GB 显存 |
关键能力
高精度文字提取
支持中英文及多语言 OCR,从照片、截图、扫描件中准确提取文字。动态分辨率确保小字体清晰可辨,适合文档数字化场景。
数据可视化解读
能够理解柱状图、折线图、饼图等可视化图表,提取数据趋势、数值关系和图表标题,并生成自然语言描述。
Visual Grounding
根据自然语言描述在图像中定位目标物体,输出精确的边界框坐标。支持指代表达理解(Referring Expression)和开放词汇检测。
Document QA
对 PDF、合同、发票等文档进行问答交互。理解文档结构和排版,精准回答关于文档内容的问题,支持多页文档分析。
| 模型版本 | VL2-Tiny(1.0B 激活)/ VL2-Small(2.8B 激活)/ VL2(4.5B 激活) |
| 架构类型 | Mixture-of-Experts 视觉语言模型(MoE VLM) |
| 视觉编码器 | SigLIP-SO400M + SAM-B(双编码器融合) |
| 语言模型 | DeepSeekMoE(混合专家语言模型) |
| 动态分辨率 | 支持,可处理任意分辨率图像,自适应切块 |
| 训练数据 | 视觉-语言交错数据(vision-language interleaved data) |
| 开源协议 | MIT License |
| 论文 | DeepSeek_VL2_paper.pdf(GitHub) |
| GitHub | github.com/deepseek-ai/DeepSeek-VL2 |
| 适用场景 | 图片内容识别、文档 OCR、截图分析、图表数据提取、视觉定位、文档问答 |
推理代码示例
from transformers import AutoModelForCausalLM from deepseek_vl2.models import DeepseekVLV2Processor, DeepseekVLV2ForCausalLM import torch # 1. 加载模型与处理器 model_path = "deepseek-ai/deepseek-vl2-small" vl_chat_processor = DeepseekVLV2Processor.from_pretrained(model_path) tokenizer = vl_chat_processor.tokenizer vl_gpt = DeepseekVLV2ForCausalLM.from_pretrained( model_path, trust_remote_code=True, torch_dtype=torch.bfloat16, device_map="auto" ).cuda().eval() # 2. 多轮对话示例(支持动态分辨率图像) conversation = [ { "role": "User", "content": "<image>\n请描述这张图片的内容,并提取其中的文字。", "images": ["./document.png"] }, { "role": "Assistant", "content": "这是一份财务报告..." }, { "role": "User", "content": "<image>\n这张图表中的趋势是什么?", "images": ["./chart.png"] }, ] # 3. 准备输入并推理 prepare_inputs = vl_chat_processor( conversations=conversation, images=["./document.png", "./chart.png"], force_batchify=True ).to(device=vl_gpt.device, dtype=vl_gpt.dtype) # 4. 生成回答 inputs_embeds = vl_gpt.prepare_inputs_embeds(**prepare_inputs) outputs = vl_gpt.language_model.generate( inputs_embeds=inputs_embeds, attention_mask=prepare_inputs.attention_mask, max_new_tokens=512, do_sample=False, ) answer = tokenizer.decode(outputs[0], skip_special_tokens=True) print(answer)
DeepSeek Prover V2 — 数学定理证明
专注于形式化数学定理证明的模型。在 Lean 4 证明助手中实现自动化证明,代表着 AI 在数学推理领域的前沿探索。
| 模型名称 | DeepSeek Prover V2 |
| 基座模型 | DeepSeekMath-Base 7B |
| 证明系统 | Lean 4 |
| 开源协议 | MIT License |
| GitHub | github.com/deepseek-ai/DeepSeek-Prover-V2 |
| 适用场景 | 数学定理证明、形式化验证、数学教育、学术研究 |
DeepSeek 开源模型快速对比
一张表看清所有 DeepSeek 开源模型的区别,快速找到你需要的模型。
| 模型系列 | 类型 | 参数量 | 最小规格 | Ollama | 下载量 |
|---|---|---|---|---|---|
| DeepSeek V3 | 通用对话 | 671B | 404GB | 支持 | 3.8M+ |
| DeepSeek R1 | 推理增强 | 1.5B~671B | 1.1GB | 支持 | 88.3M+ |
| DeepSeek Coder | 代码生成 | 1.3B~33B | 776MB | 支持 | 4.2M+ |
| DeepSeek Janus | 多模态 | 1.3B~7B | ~800MB | HuggingFace | — |
| DeepSeek VL2 | 视觉语言 | 1.0B~4.5B | ~2GB | HuggingFace | — |
| DeepSeek Prover V2 | 数学证明 | 7B | ~15GB | HuggingFace | — |
DeepSeek 模型 Benchmark 性能排行
以下是 DeepSeek 核心模型在主流基准测试上的表现。数据来源:DeepSeek 官方技术报告。V3、R1(完整版 671B)、Coder(V2 版本)得分对比,让你一目了然各模型的强项。
| Benchmark | 类别 | DeepSeek V3 | DeepSeek R1 | DeepSeek Coder |
|---|---|---|---|---|
| MMLU | 通用知识 | 88.5 | 90.8 | 79.4 |
| MMLU-Pro | 进阶知识 | 75.9 | 84.0 | — |
| GPQA Diamond | 研究生级问答 | 59.1 | 71.5 | — |
| MATH-500 | 数学推理 | 90.2 | 97.3 | — |
| AIME 2024 | 数学竞赛 | 39.2 | 79.8 | — |
| HumanEval | 代码生成 | 82.6 | 96.3 | 81.1 |
| LiveCodeBench | 实战编程 | 49.2 | 65.9 | 43.8 |
所有分数来自 DeepSeek 官方技术报告。V3 和 R1 为 671B 完整版得分,Coder 为 V2 版本得分。「—」表示官方未公开此项数据。R1 在推理和数学 Benchmark 上全面领先,V3 在通用任务上表现均衡。
R1 在 AIME 2024 数学竞赛上得分是 V3 的 2 倍(79.8 vs 39.2);在 HumanEval 代码生成上达到 96.3%,接近满分。V3 性价比极高,以 557 万美元训练成本实现顶级性能。
DeepSeek 模型训练数据揭秘
DeepSeek 各模型的训练数据规模和构成,是理解模型能力边界的关键。以下整理了 DeepSeek 核心开源模型的训练数据详情,所有数据均来自 DeepSeek 官方技术报告和 GitHub 仓库。
| 模型 | 训练数据规模 | 数据构成 | 数据来源 | 训练方式 |
|---|---|---|---|---|
| DeepSeek V3 | 14.8T tokens | 多语言语料(中英为主,覆盖多语种) | 互联网公开文本、书籍、学术论文、代码仓库 | 预训练 + 多阶段 SFT + RLHF |
| DeepSeek R1 | V3 基座 + 800k 精选推理样本 | 强化学习训练数据 + 800k 精选推理样本(用于蒸馏) | RL 自生成推理链 + 人工精选高质量推理样本 | RL 强化学习 + 知识蒸馏 |
| DeepSeek Coder | 2T tokens | 87% 代码 + 13% 中英文自然语言 | GitHub 代码仓库、Stack Overflow、技术文档 | 预训练 + FIM(Fill-in-the-Middle)训练 |
| DeepSeek VL2 | 视觉-语言交错数据 | 图像-文本对 + 图文交错文档 + 多模态指令数据 | 公开图像数据集、文档扫描件、图表数据 | 多模态预训练 + 视觉指令微调 |
| DeepSeek Janus | 多模态理解 + 图像生成数据 | 图像描述 / VQA / 文本-图像对 / 视觉推理数据 | 公开多模态数据集 + 合成图像生成数据 | 多模态预训练 + 解耦视觉编码训练 |
| DeepSeek Prover V2 | Lean 4 形式化证明数据 | Lean 4 定理证明语料 + 形式化数学库 | Mathlib 数学库 + 自动生成的形式化证明 | 预训练 + 证明搜索 + 强化学习 |
V3 以 14.8T tokens 的训练数据量领跑,覆盖多语言和多领域。Coder V2 使用 2T tokens 专注代码领域训练。R1 在 V3 基座上通过 RL + 800k 精选推理样本 实现推理突破,数据效率极高。
DeepSeek Coder 的 87% 代码 + 13% 自然语言 配比是其成功的关键——高比例代码数据确保编程能力,少量自然语言数据保持对话流畅性。VL2 和 Janus 的视觉-语言交错数据是实现多模态理解的基础。
DeepSeek 模型开源社区影响力
DeepSeek 开源模型在全球 AI 社区产生了巨大影响力。以下是截至 2026 年中的关键社区数据,展示 DeepSeek 在 GitHub、Hugging Face、Ollama 等平台上的受欢迎程度。
GitHub 仓库星标
Hugging Face 平台数据
| DeepSeek-V3 | 累计下载量最高,Hugging Face 月度下载量排名前列 |
| DeepSeek-R1-Distill-Qwen-1.5B | Hugging Face 上最受欢迎的蒸馏版,下载量极高 |
| Janus-Pro-7B | 多模态模型中最受欢迎,喜欢数(likes)持续增长 |
| 全系列模型 | DeepSeek 在 Hugging Face 上发布了 30+ 个模型权重,涵盖所有系列 |
Ollama 平台下载量
DeepSeek R1
35 个版本规格,Ollama 下载量最高的模型之一
DeepSeek Coder
代码模型中最受欢迎的选择
DeepSeek V3
671B 完整版,单模型下载量创新高
全系列总下载量
DeepSeek 全系列在 Ollama 累计下载量突破 1 亿
Awesome DeepSeek Integration
社区维护的 Awesome DeepSeek Integration 项目已成为 DeepSeek 生态的重要入口,整合了 DeepSeek API 和开源模型在各类应用中的集成方案:
- 624+ 次提交(commits),持续活跃更新
- 覆盖 5 种语言的集成文档和示例代码
- 涵盖聊天客户端、RAG 框架、Agent 平台、编程插件等 50+ 种集成方式
- 社区贡献者和 Fork 数量持续增长,已成为 DeepSeek 生态的核心枢纽
社区贡献生态
Fork 与 PR
DeepSeek 核心仓库累计获得数千次 Fork,社区提交了大量 PR 用于改进文档、修复 Bug、优化推理性能、添加新功能支持。
生态扩展
vLLM、SGLang、Ollama、LM Studio、llama.cpp 等主流推理框架均已原生支持 DeepSeek 模型,降低部署门槛。
知识共享
全球开发者贡献了大量中英文教程、视频、博客文章,覆盖从入门到精通的各个层次,帮助更多人快速上手 DeepSeek。
模型衍生
基于 DeepSeek 开源模型微调、蒸馏、合并的衍生模型不断涌现,覆盖医疗、法律、金融、教育等垂直领域。
了解更多
DeepSeek 模型选型指南
面对众多 DeepSeek 模型不知道怎么选?以下按场景、硬件、需求三个维度帮你快速找到最适合的模型。
按场景选择
DeepSeek V3
通用对话、写作、翻译、知识问答首选。671B MoE 架构,回答质量高,覆盖面广。
DeepSeek Coder / R1
代码生成选 Coder 6.7B;复杂编程推理选 R1 32B。HumanEval 96.3%,代码能力顶尖。
DeepSeek R1 / Prover V2
数学解题选 R1 32B+,AIME 2024 得分 79.8。形式化定理证明选 Prover V2。
DeepSeek Janus / VL2
图像理解+生成选 Janus-Pro-7B;纯视觉理解/OCR 选 VL2。解耦视觉编码,理解生成两不误。
DeepSeek V3 / R1 / Prover
综合研究选 V3 或 R1;数学证明方向选 Prover V2。全部 MIT 协议,可自由用于学术发表。
按硬件选择
R1-Distill-Qwen-1.5B
仅 1.1GB,无需显卡,纯 CPU 即可运行。适合低配设备尝鲜体验推理能力。
ollama run deepseek-r1:1.5bR1-8B / R1-7B / Coder 6.7B
最推荐的入门配置。R1-0528-Qwen3-8B(5.2GB)为最新推理模型,Coder 6.7B(3.8GB)专注编程。
ollama run deepseek-r1:8bR1-14B / Coder 33B
R1-Distill-Qwen-14B(9.0GB)推理能力显著提升;Coder 33B(19GB)需 16GB+ 显存。
ollama run deepseek-r1:14bR1-32B
R1-Distill-Qwen-32B(20GB)是性能和资源的最佳平衡点。推理能力接近完整版,单卡可跑。
ollama run deepseek-r1:32bR1-70B / R1-671B / V3
R1-70B(43GB)需 48GB+;R1-671B 和 V3(404GB)需多卡集群。可用 vLLM 或 SGLang 部署。