报告正文
训练一个大模型烧多少钱?大头你八成想不到
朋友圈又刷屏了:某某大模型发布,性能炸裂。评论区总有个灵魂拷问跟着冒出来——"这玩意儿训一次,得烧多少钱啊?"
打住,先把话说明白:训练一个头部大模型,花的不是"几台服务器"的钱,是"一座工厂"的钱。 而且这笔账里最贵的那一项,多半不是你以为的"请一堆天才程序员",而是那批昼夜不息、闷声吃电的显卡。今天不吹参数、不比谁更强,就把这张账单摊开,看看钱都花哪儿去了。
最大的那口锅:算力,也就是显卡
一句话,训练大模型最烧钱的,是算力——说白了就是 GPU(高性能显卡)。
它凭什么最贵?两条。一是单卡就死贵:主流训练卡一张的价格,够买辆不错的家用车,而且这几年被抢到水涨船高。二是得成千上万张一起上:训一个前沿模型,动不动就是"万卡集群"起步,一堆卡并排连着,昼夜连轴转上好几周甚至几个月。
自己买,是一笔以千万计的硬件投入;租云上的算力,按卡按小时计费,跑一整轮下来同样是天文数字。所以你看到的那些惊人成本,六七成都压在算力这一项上,其余的加起来才是零头。
第二口锅:电费,电表转得你心慌
几千上万张卡 7×24 小时连轴跑,本身就是一台巨型"电老虎"。GPU 满载发热,还得配一整套散热制冷——这又是一份电。
一次前沿模型的完整训练,耗电量能顶得上成千上万户家庭一个月的用电。电费本身是硬成本,散热、机房、供电改造还得再叠一层。这也是为什么大厂建智算中心,第一件事往往是先去找"电便宜、能供得上"的地方——电,在这门生意里是实打实的原料。
第三口锅:数据和人,喂进去的也是钱
模型不是凭空变聪明的,得拿海量数据喂。早期互联网上的免费文本,好薅的基本被薅光了,如今高质量、干净、合规的数据越来越稀缺,采购、清洗、合规审查,每一步都在花钱。
人力也不便宜,但花法和你想的不太一样。顶尖研究员的薪资固然高,可还有一块常被忽略的开销:人工标注。让模型"说人话、懂分寸"的那道对齐工序(业内叫 RLHF),背后是大量人力一条条打分、比对、纠偏。这块的开销,能占到早期训练总成本的一成多。

到底多少钱?区间大到离谱,还年年在变
那一张总账单,究竟是多少?
老实说——没有标准答案,因为区间大得离谱。 头部前沿模型训一次,业内公认已经是数千万到上亿美元的量级,个别估算还要更高。但同一句话得配个前提:这数字变得飞快。
一方面,模型越做越大,成本水涨船高;另一方面,架构和训练方法一优化,成本又能被硬生生打下去——某些新模型靠算法革新,把单次训练的花销砍到同级别的零头。所以任何一个"某模型花了 X 亿"的说法,都只是某个时间点、某种算法、某种口径下的快照,换个月份可能就不作数了。记住量级和构成就好,别死磕某个具体数字。
别以为训完就完事:推理才是长期的碎钞机
最容易被忽略的一点:训练是一次性投入,用起来才是无底洞。
模型训好后,每一次你跟它对话、让它写东西,都要消耗算力——这叫"推理"。单次不贵,架不住用户海量、天天在用。当一个模型有了上亿用户,光是"回答问题"这件事,日积月累烧掉的钱,长期看甚至能盖过当初训练的花费。
所以行业里有句话越来越响:训练决定你"能不能造出来",推理决定你"用不用得起"。 前者是造车,后者是这车一辈子的油费——而且这油箱永远填不满。
顺便说个更大的事
看到这你大概品出味儿了:算力、电力、数据、人力、推理——这几笔账拆开看是技术问题,合起来其实是一道成本与回报的生意题。
而这道题最难的考场,不在聊天框里,在工业和能源这类重资产行业:那里既是用电大户、又是算力买家,既要模型落地、又得把每一分算力和电费都算到骨头里。谁能把这本成本账真正算平、算出正回报,谁就摸到了商业化的拐点。
想看大模型在工业能源里怎么把成本账算平、拐点到底在哪? 我们做了份《AI 大模型工业能源落地全景与商业化拐点研究》——公众号后台回「AI」,拿去看。
注:本文数据与关键论断均经多源联网核查,完整来源档案备索——关注公众号「经纬智汇」可获取。