返回报告库
EXK-B-003·B 级报告·前沿科技与产业趋势

什么是参数,越多越好吗

AI 大模型与行业落地 · AI 大模型与行业落地。当前权限:全文开放

Access Policy
等级
B
阅读权限
全文开放
解锁方式
已解锁
BEX-K前沿科技与产业趋势AI 大模型与行业落地引流跨界
Report Content

报告正文

动不动就"千亿参数",参数越多的大模型就一定越强吗

发布会上,厂商最爱亮的一个数字就是"参数"——千亿、万亿,一个比一个吓人,仿佛这串零后面每多一个,模型就自动聪明一截。你也默默点头:参数多,肯定强呗。

打住。先把结论直给你,省得你被发布会的气氛带走:参数,说白了就是模型身上能拧的"旋钮"数量。旋钮多,确实有更大的底子——但强不强,从来不是光看旋钮个数。数据干不干净、训练到不到位、架构巧不巧,样样都能定生死。真到落地,还得看划不划算。

参数到底是个啥?就俩字:旋钮

你可以把大模型想成一台有无数旋钮的机器。喂进去一句话,它靠这些旋钮的组合,"拧"出下一个字该是什么。这些能被训练反复调整的数值,就是参数(也叫权重)。

所谓"千亿参数",就是这台机器身上有上千亿个旋钮可以调。旋钮越多,理论上它能记住的花样、能拟合的规律就越复杂——这就是大家常听的"规模定律"(Scaling Law):在数据、算力、参数一起往上堆的时候,模型表现确实会跟着变好,而且好得挺有规律。

但请注意这句话里的隐藏条件:是"一起往上堆"。参数单拎出来往死里加,另外两样跟不上,就是虚胖。

三个"想当然",全是纸上谈兵

误区一:参数越多,就一定越强。 研究界早就发现"边际递减"——参数翻倍,本事往往翻不了倍,堆到后面越加越不划算。更扎心的是 DeepMind 2022 年那个经典案例:一个 700 亿参数的模型 Chinchilla,因为喂饱了数据,正面打赢了 1750 亿参数的 GPT-3 和 2700 亿参数的 Gopher。参数少了一大半,照样赢。

误区二:光靠堆参数就能变聪明。 不存在的。参数是"脑容量",但脑容量大 ≠ 会办事。模型这颗"脑子"聪不聪明,很大程度看你喂它什么"教材"——"数据洗得净,模型才会命硬"。1TB 的高质量语料,价值可能远超 100TB 的垃圾网页。数据、算力、架构,任何一环拖后腿,参数再多也是空转。

误区三:小模型注定打不过大模型。 也不绝对。这两年流行"把模型做小、把数据做大":用高质量数据、知识蒸馏这些手段,几十亿参数的小模型也能在特定任务上打出高阶表现。当然别神化它——业内专家也提醒,这类小模型多是站在大模型肩膀上"摘果子",复杂通用任务上仍追不平顶级大模型。但"小而精"能打,是实打实的。

这对用 AI 的人意味着啥

一句话:别再拿参数量当选型的唯一标尺。

  • 挑模型先问"它在我这活儿上干得怎样",而不是"它有几个 B";
  • 参数越大,推理越烧显存、越慢、越贵——训练是一次性的,推理是天天在花钱的
  • 很多真实场景里,一个反应快、够用、便宜的小模型,比一个又大又慢的"全能选手"更值。

挑食的该是你的任务,不是那串参数数字。

EXK-B-003 主视觉

顺便说个你可能好奇的

看到这你大概会嘀咕:既然参数不是越多越好,那厂商图啥还拼命卷规模?

因为对做通用大模型的巨头来说,规模在多数时候仍是护城河——但对要把 AI 用进业务里的企业,逻辑完全不同:它们要的不是参数榜第一,而是在自己那摊活儿上,性价比最高的那一个

于是真正值钱的问题,从"谁的参数多",变成了:大模型到底怎么落到一个行业里,才既跑得动、又赚得回来? 尤其在工业、能源这种投入大、算账狠的领域,拐点到底在哪。

想把 AI 大模型在工业能源里的落地路径和商业化拐点看明白? 我们做了份《AI大模型工业能源落地全景与商业化拐点研究》——公众号后台回「AI」,拿去看。

动不动就"千亿参数",参数越多的大模型就一定越强吗|经纬智汇能源研究|经纬智汇