返回报告库
EXK-B-013·B 级报告·前沿科技与产业趋势

算力、显存、带宽:AI 硬件三个关键词科普

半导体与算力 · 半导体与算力。当前权限:全文开放

Access Policy
等级
B
阅读权限
全文开放
解锁方式
已解锁
BEX-K前沿科技与产业趋势半导体与算力引流跨界
Report Content

报告正文

算力、显存、带宽:AI硬件仨词,卡脖子的常是最不起眼那个

朋友买了台顶配显卡跑大模型,兴冲冲发朋友圈:这算力,起飞!结果实测下来,模型吐字慢得像在思考人生。他百思不得其解:钱都花在算力上了,怎么还这么肉?

先把结论撂这儿,省得你也跟着交学费:决定一块AI芯片"行不行"的,从来不是单一指标,而是三个词的配合——算力(算得多快)、显存(装得下多大模型)、带宽(数据搬得多快)。而真正拖后腿的,往往是最没存在感的那个:带宽。

一个厨房,把三个词讲透

别被术语吓住,把AI芯片想成一个后厨,一切就清楚了。

算力,就是厨师的手速。 切菜、颠勺多快,决定一秒能出多少道菜。对应到芯片,就是每秒能做多少次浮点运算(FLOPS)——手速越快,算得越猛。

显存,就是案板的大小。 案板越大,能同时摊开的食材越多。模型的参数、运算中间产生的数据,都得先摊在这块"案板"上;案板不够大,再大的模型根本摆不下、跑不起来。

带宽,就是传菜员往返仓库和案板的速度。 食材不会自己飞到厨师手边,得有人从仓库一趟趟端过来。搬得越快,厨师越不用等。

一道菜要上桌,三个环节缺一不可。而多数人买芯片,眼里只有"厨师手速"这一个数字。

手速再快,也架不住传菜员太慢

问题就出在这儿。厨师的手速一路狂飙,传菜员的脚程却几乎原地踏步。

加州大学伯克利分校一篇被广泛引用的研究(《AI and Memory Wall》)测算过一个扎心的对比:过去约20年里,芯片的峰值算力涨了约6万倍,而显存带宽只涨了约100倍——两者差了几百倍。换句话说,厨师快了6万倍,传菜员才快了100倍。

结果就是:厨师站在案板前,颠勺的手停下来,干等着下一批食材被端上来。这段"干等"的时间,学界叫它"内存墙"(Memory Wall)。你的显卡不是不够猛,是它猛的那部分,正被活活饿着。

所以大模型生成文字慢,很多时候不是算力不够,而是数据搬运跟不上——带宽,才是那个藏在暗处的真瓶颈。

EXK-B-013 封面

案板也在悄悄"不够用"

顺带说个更隐蔽的麻烦:案板(显存容量)也快摊不下了。

同一篇研究给出的另一组对比是:大模型的参数规模,大约每两年翻约410倍;可单块GPU的显存容量,每两年才翻约2倍。菜越做越大,案板却几乎没怎么变大——大到一定程度,一张案板根本摆不下,只能把菜拆开、摊到好几张案板上一起做,环节之间的搬运又成了新的负担。

于是你会发现,AI硬件的世界里,从来没有"一招鲜"。 算力、显存、带宽像一只木桶的三块板,最短的那块决定装多少水。光堆手速,案板和传菜员跟不上,钱一样打水漂。

说到底,卡的是同一件事

看到这你大概咂摸出味儿了:这三个词,本质上考验的是同一件东西——芯片的设计与制造功力。

手速要快,靠的是先进制程把晶体管塞得更密;案板要大、传菜员要快,靠的是把高带宽显存(HBM)这类关键部件堆叠、封装到芯片旁边。每一样,都是硬碰硬的工艺门槛。而这些门槛,恰恰是当下"卡脖子"最要命的地方——为什么一块高端AI芯片这么难造、又这么金贵,答案全藏在这三个词背后的产业链里。

这条链子,从最上游的算力设计,到国产芯片正在艰难爬坡的每一环,才是真正决定AI能跑多远的东西。

想把算力这盘大棋、国产芯片到底走到哪一步看明白? 我们做了份《算力革命与国产芯片·全景研究》——公众号后台回复「芯片」,拿去看。

算力、显存、带宽:AI硬件仨词,卡脖子的常是最不起眼那个|经纬智汇能源研究|经纬智汇