deepseek-flash

一句话

四家里速度第二快(208.9 tok/s)、缓存最便宜(折扣 98%)、总 token 消耗最省;短板是高难推理(HLE 36.8)和长程任务稳定性,以及 552B 参数带来的自部署高门槛。

定位

DeepSeek 全新模型结构系列中最小尺寸的模型,原生多模态视觉理解。官方称在性能、费用、速度、总用时上全面超越 V4 Pro,因此 V4 Pro 已被有序下线——访问 deepseek-v4-pro 会路由到 V4.1 Flash 并按 Flash 单价计费。

规格

项目值
发布时间2026-09-10
开放权重是(MIT),HuggingFace deepseek-ai/DeepSeek-V4.1-Flash
总参数552B MoE
激活参数输入 8B / 输出 16B(非对称)
架构Causal-Encoder-Decoder(输入输出不对称)+ CSA2 + Engram
上下文1M
最大输出384K
输入模态文本、图像
思考控制非思考 / 思考(默认),支持 FIM 仅非思考模式
KV Cache约 890 字节/token,相比初代缩小 437 倍;HBM 需求降至 1/4、SSD 需求降至 1/8
并发限制2500

模型名兼容

请使用 deepseek-flash。旧名 deepseek-v4-flash、deepseek-v4-flash-vision-exp 仍可调用,但对应模型已下线,请求由 V4.1 Flash 提供服务并按 Flash 价计费。

价格(元/百万 tokens)

项目空闲时段高峰时段
输入(缓存命中)0.020.04
输入(缓存未命中)12
输出48
  • 空闲价为高峰价的一半。 高峰时段 = 北京时间周一至周五 9:00–12:00、14:00–18:00(不含中国法定节假日);其余时间含周末与法定节假日全天均为空闲价。
  • 缓存命中价低到 0.02 元,配合 KV Cache 压缩,长会话 Agent 场景的缓存命中费用占比显著下降。

独立评测(Artificial Analysis,max 档)

指标值
智能指数39(开源权重模型第 7/117)
输出速度208.9 tok/s(同类中位数 69)
混合价1.20
每任务成本$0.27
缓存折扣98%(四家最高)
输出啰嗦度250M tokens(同类中位数 140M,非常啰嗦)

厂商自报跑分

基准分数参照
DeepSWE74.2Claude Opus 5 为 74.0、GPT-5.6 Sol 为 73.0
Terminal-Bench 2.190.6—
Terminal-Bench 3.030同一模型换测试版本后大幅回落
HLE36.8落后 Claude Opus 5 约 20 分

优缺点

优势

  • 速度 208.9 tok/s,且缓存折扣 98%,长会话成本优势明显。
  • 网易智能三题实测(3D 停车游戏 / 电商下单 / 预约系统)全部通过,V4 Flash 有两题分别出现 3D 场景倒置、重启后订单读不到的问题。
  • 生成耗时约为 V4 Flash 的三到四成,输出 token 少 14.4%、总 token 少 44.7%。
  • 腾讯 WorkBuddy / CodeBuddy 与 OpenCode 已全量接入;MIT 许可。

风险

  • HLE 36.8:高难学术推理是明确弱项。
  • 长程任务稳定性存疑:Terminal-Bench 从 2.1 的 90.6 掉到 3.0 的 30,同一模型换测试版本后崩落。
  • 自部署门槛极高:552B、约 480GiB 权重,社区反馈量化后仍可能慢到 1 tok/s 级,一句话要等 74 秒。
  • 输出啰嗦(250M tokens),刊例价虽低但实际用量偏大。

适用场景

  • ✅ 长会话 Agent、缓存命中为主的场景(成本最优)
  • ✅ 对生成速度敏感的交互式编码与工具调用
  • ✅ 廉价批量生成
  • ⚠️ 不适合高难推理任务;不适合本地自部署

相关