DeepSeek V4 定价一览
DeepSeek V4 系列是目前市场上性价比最高的顶级模型:
| deepseek-v4-flash | deepseek-v4-pro | |
|---|---|---|
| 输入(缓存命中) | ¥0.02/M tokens | ¥0.025/M tokens |
| 输入(缓存未命中) | ¥1/M tokens | ¥3/M tokens |
| 输出 | ¥2/M tokens | ¥6/M tokens |
| 上下文 | 1M tokens | |
| 最大输出 | 384K tokens | |
对比 GPT-5(输入 $5/输出 $20/百万 tokens),DeepSeek V4 Flash 成本仅为 GPT-5 的 1/25。
缓存机制详解
DeepSeek 的上下文缓存(Context Caching)自动生效,无需手动配置:
- 当 API 请求中的 system prompt + 历史消息 与之前的请求重复时自动命中
- 命中后输入价格从 ¥1 降至 ¥0.02(98% 节省)
- 缓存保持时间约 5-10 分钟,适合高频对话场景
最大化缓存命中的策略
# 策略1:固定 System Prompt——所有请求共用同一个 system prompt
# 策略2:批量处理——多个问题共用 system prompt
# 策略3:长对话中前面的消息自动缓存Flash vs Pro 选型指南
| 场景 | 推荐模型 | 理由 |
|---|---|---|
| 日常对话、客服 | Flash | 成本低,质量足够 |
| 代码生成、复杂推理 | Pro | 编码和推理更精准 |
| 高并发、大规模部署 | Flash | 2500 并发 vs 500 并发 |
| 预算敏感 | Flash | 价格仅为 Pro 的 1/3 |
| 需要最高质量 | Pro | 复杂任务准确率更高 |
Token 优化技巧
- 精简 System Prompt:去掉不必要的描述,保留核心指令
- 限制输出长度:使用 max_tokens 参数控制
- 清理历史消息:只保留最近 N 轮对话,超出部分摘要化
- 监控用量:在 DeepSeek 平台定期查看 token 消耗报表
费用预估
以 1000 token 输入 + 500 token 输出为例:缓存未命中约 ¥0.002;缓存命中约 ¥0.00102。日调用 1 万次,每次 3000 tokens 输出,约 ¥60/天(Flash 缓存命中)。