探针 3|大模型是怎么被「炼」出来的

你天天用的 ChatGPT,这身本事是从哪来的
你天天用 ChatGPT, Claude 这些大模型,让它写代码、写文章、闲聊,什么都能接住,还特别听话——你让它正经就正经,让它写代码它就写代码。
你大概没认真想过:它这身本事,到底从哪来的?
它刚「出生」的时候,其实啥都不会。不是生下来就懂代码、懂人话的。是后来被人一点一点「炼」出来的。
那这个「炼」,到底在炼什么?这篇就顺着这个问题,一路挖到底。
先纠正一个误会:模型不是「一锅炖」出来的
很多人想象中,训练一个大模型,就是把一堆知识灌进去,一锅炖出来,结束。
不是这样。它分两大步,目的完全不同:
- 第一步,学本事——行话叫 预训练(pre-training)。
- 第二步,学规矩——行话叫 对齐(alignment)。
前者让它「会东西」,后者教它规矩、教它对话,变得「好用」。两步干的是完全不同的活,少一步都不行。

第一步·预训练:让它玩「猜下一个字」的游戏
预训练听着玄,干的事其实特别朴素:让模型玩一个你已经很熟悉的游戏——猜下一个字(行话叫 next-token,也就是「下一个 token」)。
还记得前两篇说过的吗?大模型是一个字一个字往外蹦的(准确说是一个 token 一个 token,但你先按「一个字一个字」理解也行),每蹦一个,都要在候选里选。预训练,就是在疯狂练这个「选」。
具体怎么练?把互联网上能找到的文本(网页、书、论文、代码、论坛帖子,加起来几万亿个 token)一股脑喂给它。每次遮住一句话的下一个字,让它猜:「今天天气真」后面接什么?接「好」。猜对了,奖励;猜错了,调整。一遍不够,过几十遍。

你可能会怀疑:就玩个接龙,能学到啥?
多了去了。因为想猜准下一个字,它得真搞懂前面在讲什么。比如「法国的首都是」后面接什么,它得知道答案是巴黎;代码的下一行该怎么写,它得懂编程;连数学题下一步怎么推,它都得会推理。一个看着傻乎乎的接龙游戏,硬是把它逼成了什么都懂一点。
这一步非常烧钱。要喂几万亿 token,得用几千到几万张专业显卡(GPU)没日没夜跑上几个月,烧掉几千万甚至几亿美元。
比如 OpenAI 公开过,GPT-3 当年训练用了大约 3000 亿 token 的数据。而最近两三年新出的前沿模型,数据量早已是它的几十倍——Meta 公开过,Llama 3 的训练数据就有 15 万亿 token。
为什么非得堆这么多?背后有个铁律,叫 Scaling Law(缩放定律):数据越多、模型越大、算力越足,它就越强。后来 DeepMind 的 Chinchilla 论文又补了个准:数据和模型大小得按比例一起涨,光堆一边没用——所以各家才拼命同时堆卡、堆数据,不是烧钱玩,是这条路确实走得通。
跑完这一步,模型已经「上知天文、下知地理」了。那它能直接拿出来给你用了吗?
反直觉:预训练完的模型,其实还不会聊天
这个地方,很多人,包括不少工程师,一开始都会搞错。我第一次拿到原始模型试的时候,也愣了一下。
预训练完的模型(行话叫 base model,中文叫原始模型),你直接拿来用,会发现一个怪现象:你问它「你好」,它不会回你「你好!有什么可以帮你的」。它会接着「你好」往下续写——可能续出一长串「你好,欢迎来到本公司,下面是产品使用说明」。
因为预训练只教会了它一件事:续写文本。它学到的是「给我一段开头,我顺着往下写」,根本没学会「一问一答」这回事。在它眼里,你的「你好」不是一个问题,是一段待续写文章的开头。

所以预训练完,模型有本事,但不会和人对话,更不懂什么叫「当一个助手」。这一步,要靠对齐来教。
第二步·对齐:教它当一个「助手」
对齐,就是把那个「只会续写」的原始模型,调教成你熟悉的、能一问一答的、听话的助手。
它又分两个小步。
第一个小步,叫 SFT(监督微调,Supervised Fine-Tuning)。
办法很直接:人工写一大批「问题 → 理想回答」的示范对话,让模型照着练。比如教它:用户问「用 Python 写个快排」,标准答法是先给代码、再讲思路;用户说「你好」,标准答法是「你好!有什么可以帮你」。
练完这一步,模型总算学会了对话的格式,也理解了「我现在是个助手,人家问什么我答什么」这个角色,不再只会闷头续写。
第二个小步,叫 RLHF 或 DPO(基于人类反馈的强化学习 / 直接偏好优化)。
光会对话还不够。同一个问题,模型能给出好几种回答,哪种更好?得让它心里有数。
办法是:让真人给模型的回答打分。同样一个问题,模型给出 A、B 两个回答,人来判断「A 更有用」「B 在胡说」。这些打分先用来训一个奖励模型(reward model),再用强化学习让模型一点点往高分方向调——这套流程就是 RLHF。后来又有个更省事的替代方案叫 DPO,跳过奖励模型、直接拿偏好对训练,效果接近、工程更简单,这两年很流行。
这一步下来,模型才真正变得有用、不那么爱胡编、也不乱来。你日常觉得「这个 AI 真懂事」,主要就是这一步练出来的。ChatGPT 当年之所以一炮而红,这一步功不可没——它让回答变得讨喜、懂事,第一次让人觉得「这玩意儿真好用」。

决定你体感的,是占比最小的那步
讲到这,再给你一个反直觉的点。
预训练,吃掉的是几万亿 token;而对齐(SFT + 偏好),用的可能就几万到几百万条示范和偏好数据。两边的数据量,差了好几个数量级。

但决定你每天觉得「这个 AI 好不好用、听不听话」的,恰恰是占比最小的对齐那步——前提是预训练那关已经过了。
打个比方帮你定位(只是定位用的比喻,不是原理):预训练是打地基,对齐是搞装修。地基决定楼能盖多高,装修决定你住得舒不舒服。地基不行,装修再好也白搭;光有地基不装修,你也住不进去。
正因为这样,同一套预训练出来的底子,换种对齐方式,就能调出性格不一样的版本。有的调得听话,有的调得更敢发挥。这也是为什么同一个厂、同一时期发的不同版本,用起来手感差很多:地基一样,装修不同。
这根探针挖到了什么
一个「ChatGPT 本事哪来的」的疑问,底下连着一条完整的流水线:预训练玩接龙、猜下一个字,学到一身的本事;对齐教它对话、教它当助手、教它讨人喜欢。
这一趟下来,预训练、对齐、SFT、RLHF、DPO、Scaling Law、base model 这些词,你都摸过了。以后再刷到它们,你大概就知道在讲哪一环。
下一篇,换个离你更近的现象扎下去:你天天用的 Claude Code,凭什么能自己改代码、修 bug,不用人盯着——它到底是怎么自己干活的?下回聊。