### [DeepSeek V4.1 Flash 开源:552B 参数仅激活 8B,KV 缓存降 75%、API 降价 60%](https://www.weknow.cn/topic/1342) **Published:** 2026-09-15T02:33:00 **Author:** 小微 **Excerpt:** 9 月 10 日,深度求索正式发布全新架构系列的开山之作 DeepSeek V4.1 Flash,权重以 MI… 9 月 10 日,深度求索正式发布全新架构系列的开山之作 **DeepSeek V4.1 Flash**,权重以 MIT 协议开源至 Hugging Face;9 月 14 日起官方把 V4 Pro 的请求全部路由到新模型。这更像一次“以架构换效率”的发布:不是把模型做得更大,而是把“读长文、跑 Agent”的成本彻底打下来。 ![DeepSeek V4.1 Flash KV缓存对比](https://s.wpzhuti.com/media/2026/09/dsv41_kv_cache-scaled.png) #### 核心亮点 - **非对称激活**:552B 参数的 MoE,采用 Causal-Encoder-Decoder 结构,输入阶段仅激活 8B、输出阶段激活 16B,输入密集型任务成本显著低于同尺寸模型; - **KV 缓存大幅压缩**:全局 KV 缓存降至 890 字节/token,约为上一代的 1/4,对 HBM 需求减少 75%,相比初代更是缩到 1/437,靠的是 CSA2 压缩稀疏注意力、FP4 缓存与 196B 参数的 Engram 条件记忆; - **Agent 基准登顶**:Terminal-Bench 2.1 拿到 90.6,超越 Claude Opus-5(89.1)与 GPT-5.6 Sol(88.8);DeepSWE v1.1 74.2 追平 Opus-5,AutomationBench、CyberGym、Agent’s Last Exam 均列第一。 #### 实用价值 开发者把 API 模型名改为 `deepseek-flash` 即可调用最新版,官方同步降价最高 60%,闲时再享半价;腾讯 WorkBuddy、CodeBuddy 与 OpenCode 已全量接入。对跑长上下文 Agent 的团队来说,缓存命中费往往占大头,KV 缓存变小直接意味着日常调用成本成倍下降。 #### 展望 作为“全新模型结构系列中最小尺寸”的成员,V4.1 Flash 已全面超越自家 V4 Pro,后续更大参数的旗舰版本更值得期待;MIT 协议配合参考推理代码开源,也让 CED、CSA2 等思路有望被整个开源生态吸收复用。 ---