AI 2026-07-28 1

为什么大多数公司不自己训练大模型?驳「一本万利」的幻觉

老张

资深系统架构师

封面-为什么大多数公司不自己训练大模型

为什么大多数公司不自己训练大模型?驳「一本万利」的幻觉

"咱们自己训练一个大模型吧,一次投入,后续调用全是免费的,长远看比调 API 划算太多了!"

—— 某公司产品会上,产品经理慷慨激昂。

这话听起来是不是很耳熟?

我参加过不少 AI 相关的技术评审会,几乎每一场都会有人抛出这个观点。乍一看逻辑没毛病:训练花一笔钱,训练完就不需要再付 API 费用了,用的人越多越划算,典型的"一次投入、长期收益"。

但这个推理有一个致命的漏洞——它把大模型的成本结构理解成了"买房"(一次性首付,后续只有物业费),而实际上它是"养游艇"(购买只是开始,维护才是无底洞)。

今天这篇,咱们把这笔账算清楚。

一、先讲清楚:我们说的"自己训练"是指什么?

在讨论之前,先把概念对齐。大多数人口中的"自己训练大模型",根据雄心壮志的程度,大概分三个层级:

层级一:从零训练。 像 LLaMA、Qwen、DeepSeek 那样,从随机权重开始,在万亿 token 级别的数据上训练几个月。这是最贵的方式。

层级二:基座模型 + 继续预训练。 拿一个开源基座模型(比如 LLaMA-3、Qwen2.5),在自己领域的海量数据上继续训练。比从零便宜,但成本仍然极高。

层级三:基座模型 + 微调(Fine-tuning)。 拿开源模型,用几万到几十万条标注数据做 SFT(监督微调),或者用 RLHF 对齐。这是比较现实的方案。

很多说"自己训练"的人,想的是层级一,以为花几百万就能得到 GPT-4 级别的模型——这是最大的误解。

二、训练一本万利?先看这笔账

2.1 从零训练的成本

训练一个 70B 级别的大模型(大约是 LLaMA-3-70B 的水平),需要:

  • 算力:约 500 万 GPU 小时(以 H100 为基准)
  • 时间:即使你有 1000 张 H100,也要连续跑约 20 天
  • 电力:约 2-3 GWh(够一个普通家庭用 200 年)
  • 网络带宽:数据中心内部互联带宽,远超普通公司的 IT 基础设施

按当前 H100 云租赁价格(约 $2-3/卡/小时):

算力成本 ≈ 500万 小时 × $2.5/小时 = $1250 万 ≈ 9000 万人民币

这还只是 GPU 租赁费用。不包括:

  • 数据采集和清洗(几百万到几千万)
  • 标注团队(几十人到上百人)
  • 网络工程师、运维工程师、算法研究员(年薪百万级别的团队)
  • 实验失败的沉没成本(第一次就成功的概率 ≈ 0)

结论:从零训练一个 70B 模型,真实总成本在 1.5-3 亿人民币之间。

2.2 那 7B 小模型呢?

"那我们不用 70B,训练一个小一点的 7B 模型总可以吧?"

可以。训练 7B 模型的成本大约是 70B 的 1/30:

  • 算力:约 15 万 GPU 小时
  • 云成本:约 $40 万 ≈ 300 万人民币
  • 加上数据、团队、实验,总成本约 800-1500 万人民币

看起来比 70B 便宜很多。但问题是:一个 7B 模型在大多数生产任务上的表现,能打平 GPT-4 或 Claude 吗? 不能。

你花了一千多万,得到一个在某些任务上勉强可用的小模型,而在复杂推理、代码生成、多轮对话上被 API 产品吊打。

2.3 那微调呢?

微调的成本确实低很多。用 LLaMA-3-70B 做 SFT:

  • 数据:几千到几万条高质量标注数据
  • 算力:几十到几百 GPU 小时
  • 成本:几万到几十万人民币

这是相对现实的方案。但微调也有自己的坑,后面会说。

三、最大的谎言:「后续免费」

这位产品同学最大的认知偏差在于——他以为训练的产出是"买断制"的。

大模型不像买台服务器,买了就能免费用到报废。模型是消耗品:

3.1 推理成本是持续且巨大的

很多人觉得"训练贵推理便宜"。恰恰相反,对于一个在生产环境大规模使用的模型,推理成本往往远超训练成本

算一笔账:

假设你的模型每天处理 100 万次请求(这对很多公司来说不算多)

70B 模型单次推理 ≈ $0.003(以 H100 推理成本计)
每天推理成本 ≈ 100万 × $0.003 = $3000
每年推理成本 ≈ $3000 × 365 = $109.5 万 ≈ 800 万人民币

注意,这只是推理的 GPU 成本,不包括带宽、存储、工程维护。

而调用 GPT-4o 的 API 价格是 $2.5/百万输入 token,$10/百万输出 token。如果你的场景是短文本推理(每次 500 token 左右),100 万次调用大约花费 $1250/天。

自己部署和调 API 的成本差距,并没有想象中那么大。 而且 API 厂商还在持续降价(2024-2026 年大模型 API 价格已经降了 90%+),自部署模型的成本优势窗口越来越窄。

3.2 模型会过时

模型不是房子,不会增值。你花几千万训练出来的模型,半年后 Meta 开源了个更强的,一年后你训练时用的数据分布变了,模型表现就开始下滑。

要么你持续投入迭代(又是几千万),要么你的模型竞争力持续下降,最终被开源社区和商业 API 甩开。

3.3 数据漂移(Data Drift)

现实世界的业务数据在变化。用户的提问方式在变,产品功能在变,行业术语在变。一个 2025 年训练好的模型,到了 2026 年,对很多新问题的理解力明显下降。

解决数据漂移需要持续的:数据采集 → 清洗 → 标注 → 微调 → 评估 → 上线。这是一条永不停歇的流水线,不是一次性的。

四、你以为只需算力?你还需要这些

很多公司高估了自己拥有的资源,低估了训练大模型的门槛。

4.1 数据——真正的大山

大模型训练需要的是高质量、大规模、多样化的数据。不是把公司内部文档堆一堆就能用的。

你需要什么 你有多少
万亿 token 级别的通用文本 几乎没有(得去买或爬)
领域专业知识(结构化/半结构化) 可能有 GB 级,但远不够训练
高质量对话数据(指令+回复) 需要自己标注,成本每条约 $1-5
多语言数据 取决于业务范围
代码/推理/数学数据 需要合成或采购
合规审核数据 如果没做,上线就等着出问题

很多公司说"我们有行业数据",实际拿出来的数据量级是 GB 级别。而大模型训练需要的数据量级是 TB 到 PB 级别

4.2 人才——最稀缺的资源

一个能训练大模型的团队,至少需要:

  • 算法研究员:懂 Transformer 架构、训练策略、模型评估。年薪 100-300 万。
  • 数据工程师:能处理 PB 级数据 pipeline。年薪 60-120 万。
  • 机器学习工程师:能编写和调试分布式训练代码。年薪 80-150 万。
  • 运维工程师:管理 GPU 集群,处理故障恢复。年薪 60-100 万。
  • 标注团队经理:管理标注流程和质量。年薪 40-60 万。

一个最小配置的训练团队(10-15人),年薪支出在 1000-2000 万。这还没算招聘周期和人员流动。

2026 年的现实是:能独立训练大模型的算法工程师,全球就那么几千人,大部分在头部 AI 公司和顶级高校。你招不到。

4.3 基础设施——不只是买 GPU

GPU 只是第一步。训练集群还意味着:

  • 高速网络:InfiniBand 或 NVLink 互联,普通千兆/万兆网络不可用
  • 存储系统:PB 级高性能存储,支持高并发读写
  • 散热和电力:一个 500 卡集群的功耗约 350kW,需要专门改造机房
  • 监控和容错:训练跑 20 天,中间故障一次可能丢失几天的进度

很多公司买了 GPU 才发现,配齐基础设施的成本是 GPU 本身的 1.5-2 倍。

五、真实案例:大厂都在放弃自训

案例 1:某互联网大厂的百亿自训项目

2024 年,某国内大厂启动百亿参数自训大模型项目。投入 300+ 人团队、2000 张 A100,耗时 8 个月,总花费超过 5 亿人民币。

结果模型跑分确实不错,但上线后发现:

  • 用户 query 分布和训练数据分布存在偏差,实际体验远不如 GPT-4
  • 推理成本太高,每千次调用成本是调 API 的 3 倍
  • 维护团队需要 50+ 人持续跟进

最终该项目在 2025 年被叫停,改为基于开源模型微调 + API 混合方案。

案例 2:SaaS 公司的务实选择

一家中等规模的 SaaS 公司(2000 人),2025 年评估自训方案后,选择了一个完全不同路线:

  • 用 LLaMA-3-70B 做基座
  • 用 2 万条业务标注数据做 LoRA 微调
  • 推理用 vLLM 部署在 4 张 A100 上
  • 复杂业务逻辑仍然调 GPT-4o API

总投入不到 200 万,效果满足 80% 的场景,剩下 20% 走 API。这才是 90% 公司的最优解。

六、什么时候真的需要自己训练?

说了这么多,我不是说自训永远不可行。有几个场景确实值得:

场景一:你的数据是核心壁垒。 比如医疗 AI 公司有千万级的脱敏病历数据,这些数据别人没有,开源模型也没见过。在基座模型上继续预训练可以明显提升效果。

场景二:离线批量推理量极大。 比如每天处理数十亿条数据做内容审核、分类。这时候自部署的边际成本确实低于调 API。

场景三:合规要求数据不能出域。 金融、政务、军工等行业,数据不能出内网。这时候自部署是唯一选择。

场景四:延迟要求极高。 需要毫秒级响应的实时场景,自部署才能控制推理链路。

但注意,即使在这些场景下,选择也是"开源基座 + 微调",而不是从零训练。

七、更好的路线:90% 公司的务实方案

对于绝大多数公司,最优路径是分层方案

第一层(80% 场景):直接调 API

  • GPT-4o、Claude、DeepSeek 等
  • 成本可控,效果最好
  • 没有维护负担
  • 适用于大多数通用任务

第二层(15% 场景):开源模型 + 微调

  • LLaMA-3、Qwen2.5、DeepSeek-V3 等
  • 用几千条业务数据做 LoRA / QLoRA 微调
  • vLLM / SGLang 部署,单卡或少卡即可
  • 适用于领域特定任务

第三层(5% 场景):继续预训练

  • 只在拥有绝对数据优势时考虑
  • 需要评估 ROI,用数据说话
  • 建议先做小规模实验验证

这套方案的好处是:用 10% 的成本覆盖 95% 的需求。

八、写在最后

回到开头那位产品同学的提议——「自己训练大模型一本万利」。

这个逻辑在物理世界里成立:买一台机器,投入后就不用再花钱买产品了。

但在 AI 世界不成立,因为:

  • 训练只是一次性的? 不是,模型需要持续迭代
  • 后续免费? 不是,推理成本是持续且巨大的
  • 有数据和人才? 大概率不够
  • 能追上 API 厂商? 不可能,头部 API 厂商的研发投入是你的百倍

老张点评: 说"自训大模型省 API 费",就像说"自己发电比交电费划算"——技术上可以做到,但经济上只有特定场景才合理。绝大多数公司的正确选择是:用好现有的 API 和开源模型,把精力花在业务场景上,而不是重新造轮子。


本文由老张整理编写。成本估算基于 2026 年 H100 云服务市场价格和行业公开数据,实际费用因地区、供应商和谈判折扣有所差异。

延伸阅读:

分享:
返回文章列表