DeepSeek-V3
DeepSeekの文本モデル · リリース日 2024-12
オープンソース
文本
开源
API 可用
模型简介
DeepSeek-V3はDeepSeekのフラッグシップMoEモデルで、総パラメータ数は671B、各推論で37Bのパラメータのみをアクティブにします。マルチヘッド潜在注意(MLA)とDeepSeekMoEアーキテクチャを採用し、トレーニングコストはわずか557万ドルでありながら、GPT-4oやClaude 3.5 Sonnetに匹敵する性能を達成しています。数学とコーディングタスクで特に優れており、オープンソースコミュニティで最も影響力のあるモデルの1つです。
核心特性
- MoE 高效架构
- MLA 注意力机制
- 极低训练成本
- 完全开源
核心优势
- 性价比极高
- 数学和编码能力突出
- 开源可商用
技术规格
参数量
671B (37B 激活)
上下文窗口
128K tokens
API 支持
はい
开源状态
オープンソース
发布日期
2024-12
提供商
DeepSeek
价格信息
输入 ¥1.00/1M tokens,输出 ¥4.00/1M tokens(API);开源免费
基准测试
MMLU 88.5%, HumanEval 93.5%, MATH 90.2%, 性能接近 GPT-4o