Skills MCP Model 博客 提交 Skills
登录 注册

DeepSeek-V3

DeepSeek 推出的文本模型 · 发布于 2024-12

开源 文本 开源 API 可用

DeepSeek-V3 是 DeepSeek 的旗舰 MoE 模型,总参数量达 671B,每次推理仅激活 37B 参数。它采用多头潜在注意力(MLA)和 DeepSeekMoE 架构,训练成本仅 557 万美元,却达到了与 GPT-4o、Claude 3.5 Sonnet 相当的性能水平。在数学和编码任务中表现尤为突出,是开源社区最具影响力的模型之一。

核心特性

  • MoE 高效架构
  • MLA 注意力机制
  • 极低训练成本
  • 完全开源

核心优势

  • 性价比极高
  • 数学和编码能力突出
  • 开源可商用
参数量
671B (37B 激活)
上下文窗口
128K tokens
API 支持
开源状态
开源
发布日期
2024-12
提供商
DeepSeek

输入 ¥1.00/1M tokens,输出 ¥4.00/1M tokens(API);开源免费

MMLU 88.5%, HumanEval 93.5%, MATH 90.2%, 性能接近 GPT-4o

← 返回大模型全景图

每日精选 Skill 推荐,免费送到你邮箱

输入邮箱,每天接收一个精选 AI Agent 技能推荐。完全免费,持续更新。

完全免费,取消任意时间。我们不会发送垃圾邮件。