大家好,我是双越。wangEditor 作者,前百度 滴滴 资深前端工程师,慕课网精英讲师,PMP,前端面试派 作者。
我正致力于两个项目的开发和升级,感兴趣的可以私信我,加入项目小组。
本文是一场关于芯片、电力、人才和野心的真实成本推演。
第一章:野心的起点
张三,39岁,靠传统制造业赚到了人生第一桶金——账上躺着10亿元人民币,折合约1.4亿美元。
2025年初的一个深夜,他刷到 DeepSeek 一夜爆红登顶美区 App Store 的新闻,又看到朋友圈里人都在聊"大模型改变世界"。他心里冒出一个念头:
"我也想做一个属于自己的大模型,要做,就做世界级的。"
10亿元,在传统行业里是能盖一座工厂、买下一条产业链的巨款。但在 AI 这个赛道里,这笔钱到底能买到什么?
带着这个问题,张三决定亲自算一笔账。本文就是他这趟"算账之旅"的完整记录。
剩余预算:10亿元
第二章:第一笔钱花在哪?组队
张三做的第一件事很朴素——挖人。他很快发现,这行的人力成本完全刷新了他的认知。
一支哪怕是"迷你版"的前沿模型团队,至少需要这几类人:
| 角色 | 职责 | 年总包(含股权) |
|---|---|---|
| 预训练架构研究员 | 决定模型"底子"——架构设计、规模化定律调优 | 58万-150万美元 |
| 后训练/RLHF工程师 | 用强化学习教模型推理、写代码、遵循指令 | 65万-110万美元 |
| 基础设施/系统工程师 | 管理集群、优化分布式训练框架 | 60万-90万美元 |
| 数据标注/评审团队 | 从普通标注到领域专家评审 | 时薪15-1000美元不等 |
这是国外的价格,国内即便再便宜,也不会太低,年薪至少百万起步,还得给股权。
张三算了一笔账:如果只挖几十个人的核心研究团队,再配几百人规模的数据标注团伙,一年人力开销保守估计也要5000万到1亿元人民币。
更让他心塞的是,这些顶尖人才极度稀缺,行业里正在打一场"挖人大战"——同一个人在不同实验室之间跳槽,薪酬包一年内能上下浮动几十万。招人这件事,比想象中难十倍,贵十倍。
剩余预算:约9亿元(组建团队第一年后)
第三章:第二笔钱花在哪?抢芯片
团队搭好了,张三开始采购算力,这才发现"缺芯"不是新闻标题那么简单。
一张卡到底贵在哪
他原以为芯片贵是因为"计算核心"值钱,一查成本结构才发现完全不是这么回事——以一颗售价约2.7万美元的旗舰 AI 芯片模组为例:
| 组成部分 | 成本占比 |
|---|---|
| 逻辑芯片本身 | 约300美元 |
| HBM 高带宽内存 | 约1,350美元(最大头) |
| 先进封装(CoWoS) | 约750美元 |
| 测试/组装 | 约920美元 |
真正贵的不是芯片,是贴在芯片旁边的内存,以及把两者粘在一起的封装工艺。
想买还不一定买得到
张三满怀信心地去找供应商下单,得到的回复是:
- 台积电的 CoWoS 先进封装产能,已经被少数几家 AI 芯片龙头锁定了85%以上,留给他这种新玩家的份额不到15%,排期普遍要等到一年以后
- HBM4 内存目前量产良率只有约25%,产能被头部客户提前锁死
- 就算钱到位,也未必能排上队
自建还是租云?
张三面前摆着两条路:
- 自建集群:需要巨额资本开支,还要解决拿地、接电、建冷却系统的问题,一个1吉瓦级数据中心光是硬件部分的年化成本就要几十亿美元级别——远超他的预算
- 云端租算力:短期灵活,但大规模长期训练下来,租金总额往往比自建更贵
思来想去,张三决定放弃自建,转向云端按需租用,但即便如此,能租到的算力规模也远不及头部大厂——他排在长长的等待队列里。
剩余预算:算力预付款已经吃掉大半,约剩3-4亿元
第四章:真正开训,才知道"烧钱"是什么概念
好不容易凑够了一批算力,张三准备开训,结果被一份成本清单彻底浇灭了热情。
按照行业公开信息拼凑出的费米估算,训练一个2026年"前沿级"大模型(硬件折旧+电力+研发人力),粗估成本落在:
| 成本项 | 占比 | 粗估金额 |
|---|---|---|
| 硬件采购/折旧 | 47%-67% | 约2亿-6亿美元 |
| 电力 | 2%-6% | 约1500万-3000万美元 |
| 研发人力/实验 | 29%-49% | 约2亿-5亿美元 |
| 合计 | 约5亿-11亿美元 |
换算成人民币,就是35亿到77亿元人民币——而张三手里,这时候已经不到4亿元人民币了。
有个反差细节让张三印象深刻:电力其实只占训练总成本的2%-6%,是所有人聊起 AI 都会提到"缺电",但真正烧钱的大头是芯片采购和研发人力,不是电费。
更扎心的是,训练不是一次就能成功的——中间会有失败重跑、反复调参,预算还要再打折扣。
剩余预算:接近归零
第五章:算账时刻——10亿元买不到"下一个GPT"
张三把自己的账本和行业真实量级摆在一起,得出了这张对比表:
| 对象 | 训练成本量级 | 张三的10亿元(约1.4亿美元)够吗? |
|---|---|---|
| GPT-4(2023) | 约0.8-1亿美元 | 勉强够,但已经是2023年的技术水平 |
| 2026年前沿模型(GPT-5/Gemini Ultra档) | 2亿-5亿美元 | 不够 |
| 更前沿的下一代模型 | 10亿-30亿美元 | 差一个数量级 |
| Anthropic/OpenAI 年化训练总支出 | 数十亿到上百亿美元 | 完全不在一个量级 |
结论很清楚:张三的10亿元人民币,在"造下一个GPT"这条赛道上,连入场券都算不上。
这不是他不够努力,而是这个游戏的规则本身——frontier 模型是资本、算力、电力、人才四重壁垒叠加的巨头游戏。
此时张三面临选择:退场,还是换个打法?
第六章:调整战略——中国式"降维打法"给张三的启发
张三没有放弃,他开始研究:同样缺芯片、缺算力,DeepSeek、Qwen 这些中国团队是怎么在夹缝里做出有竞争力的模型的?他总结出三条现实路径:
路径一:把算法效率榨到极致
不追求最大参数规模,而是把每一分算力用到刀刃上——比如用更高效的混合精度训练方法、更精巧的模型架构,用更少的算力办更多的事。这条路径的天花板是有的:一旦软件层面的优化空间被榨干,真正卡脖子的还是芯片本身的架构和性能,但作为起步阶段,性价比极高。
路径二:站在开源巨人的肩膀上
不从零开始训练,而是基于市面上已有的优秀开源模型做继续预训练+精细化微调。这样能把成本从"数亿美元"直接砍到"几十万到几百万美元"级别——这是普通玩家真正能负担得起的路线。
路径三:垂直场景聚焦,不做通用模型
不和巨头正面竞争"通用能力天花板",而是死磕某一个垂直领域(法律、医疗、编程、某个行业的专业知识),用高质量的行业数据和场景壁垒,做出一个在细分领域比通用大模型更好用的产品。
张三想起一句话:中国团队的策略往往是"总体落后但局部领先"——不追求全面对标,而是找准一两个点做出真正的优势。
张三的决定:放弃"造神"执念,改做"某垂直领域最强开源微调模型+行业解决方案"。
第七章:调整后的预算重新分配
用这个更现实的目标,张三重新做了一次预算分配(假设重新拿到10亿元额度):
| 预算项 | 占比 | 金额 | 说明 |
|---|---|---|---|
| 核心团队(10-20人) | 20% | 2亿元 | 聚焦微调、RLHF、垂直领域数据工程 |
| 算力(云端租用为主) | 35% | 3.5亿元 | 增量预训练+多轮后训练迭代 |
| 垂直领域数据采买/标注 | 25% | 2.5亿元 | 行业专家评审成本高,是重点投入 |
| 基础设施/工程 | 10% | 1亿元 | 推理优化、部署、监控系统 |
| 市场/运营/合规 | 10% | 1亿元 | 获客、行业资质、安全合规 |
这个预算结构,才是10亿元人民币在今天的 AI 行业里能撑起的、相对现实的方案。
剩余预算:按新计划从头规划,10亿元变得"够用"
第八章:做出来之后,效果大概什么水平?
张三诚实地给自己降低了预期:
- 不会达到 GPT-5、Claude Opus 这个级别的通用能力——这是几十亿美元、上千人团队、数年积累的结果,不是10亿元能追平的
- 但在选定的垂直领域(比如法律合同审查、某个行业的客服场景),依靠更贴合场景的数据和更聚焦的调优,完全有可能做到"专业能力超过通用大模型,响应速度更快,成本更低"
- 这个模型对外可能不需要"最强",只需要在张三选定的场景里"最好用"
第九章:能不能赚钱?——回到"按量付费能不能覆盖成本"
模型做出来了,张三面对最后一个也是最现实的问题:能不能赚钱?
行业现实给了他一个重要参考:即便是头部公司,情况也很复杂——纯推理的单位经济学已经能转正(部分头部模型的推理毛利率能达到70%-85%),但公司整体常年亏损,直到最近才有公司实现单季度运营利润转正。这说明: "跑得动"和"赚得到钱"是两件事。
张三对比了几种变现路径:
| 变现路径 | 优势 | 劣势 | 对张三是否适合 |
|---|---|---|---|
| 通用 API 按量付费 | 潜在市场大 | 要和巨头拼价格战,大概率拼不过 | 不适合 |
| 订阅制 C端产品 | 现金流稳定 | 获客成本高,需要巨大流量 | 不适合(体量不够) |
| 企业定制化方案 | 客单价高,粘性强 | 交付周期长,需要行业资源 | 适合 |
| 开源+云托管/商业支持服务 | 建立生态,降低获客成本 | 变现周期长 | 可以作为补充 |
张三最终决定,主攻企业定制化方案——把模型能力包装成某个行业的整体解决方案卖给企业客户,同时把底座模型开源出去建立技术声誉,用商业支持服务作为长尾收入。
第十章:尾声——张三悟出的道理
算完这笔账,张三合上笔记本,得出了几个结论:
- 10亿元在今天的 AI 行业,不是"能不能做成事"的问题,而是"能做多大的事"的问题。 造下一个 GPT 不可能,但做一个真正有价值的垂直生意,完全可行。
- Frontier 模型是资本、电力、政策、顶尖人才四重壁垒叠加的巨头游戏,普通玩家如果非要正面竞争,大概率是烧光钱铩羽而归。
- 真正的机会在于"用好别人造好的轮子,在垂直场景里做深做透" ——这也是很多务实的创业者正在走的路。
10亿元造不出下一个 GPT,但能造出一个真正有价值的生意。
如果你手里也有一笔钱,想投身 AI 行业,你会怎么选?是像最初的张三一样赌一把"造神",还是从一开始就选择垂直领域,把每一分钱都花在刀刃上?