报告正文
AI 一火,显卡就断货:它到底图显卡什么?
每次大模型上新,科技圈先狂欢,然后就是同一出戏——显卡被抢空。游戏玩家骂骂咧咧,云厂商排队加价,连黄仁勋都说租他家的卡"极其困难"。
一个搞聊天、写代码、画图的软件,凭啥能把全世界的显卡都掏空?
一句话说透:AI 的活儿,是"一大片"简单计算
先给结论,省得你往玄学上想:AI 干的不是什么高深活儿,就是海量的、彼此不相干的简单计算堆在一起。GPU(显卡)的本事,是一次能算一大片;CPU 再聪明,一次也就算几个。 活儿的形状和显卡的长相刚好对上了,仅此而已。
展开说:一个教授,干不过一千个小学生
大模型的核心动作,翻来覆去就是矩阵乘法——一大堆数字排成方阵,两两相乘再相加。这活儿的特点是:又多又笨,还互不打扰。每个小格子怎么算,跟隔壁没关系,完全可以同时开工。
CPU 好比一位数学教授:单个脑子极强,逻辑、判断、调度样样精通,但同时也就顾得过来几个、几十个任务,一件一件排队处理。
GPU 呢,是一千个只会算加减法的小学生:单拎一个不值一提,可它一张卡里塞了成千上万个计算核心。碰上"把一百万道加法同时做完"这种题,教授还在埋头算第三道,一千个小学生早就交卷了。所以真到了训练、推理这种大力出奇迹的场合,GPU 能比 CPU 快出几十上百倍。
光算得快还不够。这么多小学生同时干活,草稿纸得管够、还得递得快——这就是显存和带宽:显存是能摊开多大的草稿纸,带宽是数据在草稿纸和脑子之间来回搬的速度。模型越大、聊得越长,草稿纸就得越大、搬得就得越快,缺哪个都得卡壳。这也是为什么顶级 AI 卡宁可用上贵得离谱的高带宽显存(HBM),也要把这条路修宽。
这就是"卡脖子"的地方
麻烦在于:这种卡,又难造、又难拼、还特别费。
先说难造。一张 AI 旗舰卡,得用最顶尖的芯片制程,一颗芯片上塞进几百上亿个晶体管,全球有本事流片的工厂就那么一两家。再说难拼——光有芯片不行,还得靠高端封装把芯片和 HBM 显存粘在一起,而 HBM 全世界能量产的就三家,先进封装产能更是常年吃紧,等于两道闸门一起卡着出货。
于是就出现了魔幻场面:一个大模型训练起来,动辄要上万张顶级 GPU 连成集群同时开跑。有钱不一定买得到,买到了还得先解决电——这些卡是出了名的电老虎,一个大集群的胃口顶得上一座小城市。算法和数据大家都能追,唯独算力是一道实打实、绕不过去的护城河。
!EXK-B-014 封面 > 画面:左侧一位西装教授(靛蓝 #3B3A52 剪影)对着一道题冥思苦想;右侧密密麻麻一千个金色小人(金 #C6A24C)举着"加法完成"的小牌子已交卷。中间一块发烫的方形芯片,四周晶体管电路如城市灯网向外延展,暗示"算得完,但造不够、供不上"。整体金 #C6A24C + 靛 #3B3A52 双色,科技冷调里透一点抢购的焦灼感。
从"吃显卡",到"谁来造这块芯片"
看到这你大概回过味了:AI 之所以贵、之所以抢,根子不在软件,而在那块又难造又难供的芯片上。谁掌握了先进制程、掌握了高带宽显存和封装,谁就攥住了整个 AI 时代的水龙头。
而这恰恰是最让人睡不着的问题——这条从芯片到算力的命脉,我们自己能修到哪一步?国产芯片,究竟卡在哪、又追到了哪?
想把"算力这道护城河"从头到尾看明白? 我们做了份《算力革命与国产芯片·全景研究》——公众号后台回「芯片」,拿去看。