端侧 AI 芯片的算力竞赛
NPU 算力翻倍之外,内存带宽才是真正的瓶颈。
算力数字之外
厂商发布会上的 NPU 算力(TOPS)年年翻倍,但端侧模型的实际推理速度提升远没有这么快。瓶颈在内存带宽。
大模型推理是访存密集型任务:每生成一个 token,都要把全部权重读一遍。带宽跟不上时,算力再高也是空转。
几个可参考的指标
- 带宽/算力比:低于
0.5 GB/s per TOPS的芯片,跑 7B 模型基本吃不满算力 - 统一内存:CPU/GPU/NPU 共享内存池能省下大量拷贝开销
- 稀疏支持:硬件层面的结构化稀疏,是少数能同时降算力和降访存的方案
选型时别只看 TOPS,把目标模型跑一遍实测 token/s 才有意义。
评论0





暂无评论,期待您的发言...