9 月 10 日,深度求索正式发布全新架构系列的开山之作 DeepSeek V4.1 Flash,权重以 MIT 协议开源至 Hugging Face;9 月 14 日起官方把 V4 Pro 的请求全部路由到新模型。这更像一次“以架构换效率”的发布:不是把模型做得更大,而是把“读长文、跑 Agent”的成本彻底打下来。

核心亮点
- 非对称激活:552B 参数的 MoE,采用 Causal-Encoder-Decoder 结构,输入阶段仅激活 8B、输出阶段激活 16B,输入密集型任务成本显著低于同尺寸模型;
- KV 缓存大幅压缩:全局 KV 缓存降至 890 字节/token,约为上一代的 1/4,对 HBM 需求减少 75%,相比初代更是缩到 1/437,靠的是 CSA2 压缩稀疏注意力、FP4 缓存与 196B 参数的 Engram 条件记忆;
- Agent 基准登顶:Terminal-Bench 2.1 拿到 90.6,超越 Claude Opus-5(89.1)与 GPT-5.6 Sol(88.8);DeepSWE v1.1 74.2 追平 Opus-5,AutomationBench、CyberGym、Agent’s Last Exam 均列第一。
实用价值
开发者把 API 模型名改为 deepseek-flash 即可调用最新版,官方同步降价最高 60%,闲时再享半价;腾讯 WorkBuddy、CodeBuddy 与 OpenCode 已全量接入。对跑长上下文 Agent 的团队来说,缓存命中费往往占大头,KV 缓存变小直接意味着日常调用成本成倍下降。
展望
作为“全新模型结构系列中最小尺寸”的成员,V4.1 Flash 已全面超越自家 V4 Pro,后续更大参数的旗舰版本更值得期待;MIT 协议配合参考推理代码开源,也让 CED、CSA2 等思路有望被整个开源生态吸收复用。