DeepSeek V4 定价一览

DeepSeek V4 系列是目前市场上性价比最高的顶级模型:

deepseek-v4-flashdeepseek-v4-pro
输入(缓存命中)¥0.02/M tokens¥0.025/M tokens
输入(缓存未命中)¥1/M tokens¥3/M tokens
输出¥2/M tokens¥6/M tokens
上下文1M tokens
最大输出384K tokens

对比 GPT-5(输入 $5/输出 $20/百万 tokens),DeepSeek V4 Flash 成本仅为 GPT-5 的 1/25

缓存机制详解

DeepSeek 的上下文缓存(Context Caching)自动生效,无需手动配置:

  • 当 API 请求中的 system prompt + 历史消息 与之前的请求重复时自动命中
  • 命中后输入价格从 ¥1 降至 ¥0.02(98% 节省)
  • 缓存保持时间约 5-10 分钟,适合高频对话场景

最大化缓存命中的策略

# 策略1:固定 System Prompt——所有请求共用同一个 system prompt
# 策略2:批量处理——多个问题共用 system prompt
# 策略3:长对话中前面的消息自动缓存

Flash vs Pro 选型指南

场景推荐模型理由
日常对话、客服Flash成本低,质量足够
代码生成、复杂推理Pro编码和推理更精准
高并发、大规模部署Flash2500 并发 vs 500 并发
预算敏感Flash价格仅为 Pro 的 1/3
需要最高质量Pro复杂任务准确率更高

Token 优化技巧

  • 精简 System Prompt:去掉不必要的描述,保留核心指令
  • 限制输出长度:使用 max_tokens 参数控制
  • 清理历史消息:只保留最近 N 轮对话,超出部分摘要化
  • 监控用量:在 DeepSeek 平台定期查看 token 消耗报表

费用预估

以 1000 token 输入 + 500 token 输出为例:缓存未命中约 ¥0.002;缓存命中约 ¥0.00102。日调用 1 万次,每次 3000 tokens 输出,约 ¥60/天(Flash 缓存命中)。