端侧 AI 芯片的算力竞赛

Admin
202阅读
0评论
0点赞

NPU 算力翻倍之外,内存带宽才是真正的瓶颈。

算力数字之外

厂商发布会上的 NPU 算力(TOPS)年年翻倍,但端侧模型的实际推理速度提升远没有这么快。瓶颈在内存带宽。

大模型推理是访存密集型任务:每生成一个 token,都要把全部权重读一遍。带宽跟不上时,算力再高也是空转。

几个可参考的指标

  • 带宽/算力比:低于 0.5 GB/s per TOPS 的芯片,跑 7B 模型基本吃不满算力
  • 统一内存:CPU/GPU/NPU 共享内存池能省下大量拷贝开销
  • 稀疏支持:硬件层面的结构化稀疏,是少数能同时降算力和降访存的方案

选型时别只看 TOPS,把目标模型跑一遍实测 token/s 才有意义。

上一篇暂无更多文章
下一篇新版 Windows 11 界面曝光:老窗口将用 WinUI 3 重写
评论0

暂无评论,期待您的发言...

发表评论