大语言模型(LLM)的神经进化之路:从海量文本到通用智能的四个核心阶段

56 阅读9分钟

在人工智能浪潮中,以 ChatGPT、Claude 等为代表的大语言模型(Large Language Model, LLM)展现出了惊人的对话、推理与创作能力。从底层来看,这些大模型本质上是一个拥有海量参数的深层人工神经网络。一个大模型从最初的“一张白纸”到最终能够像人类一样进行高质量的对话,需要经历一套严密、优雅且耗资巨大的“四阶段进化矩阵”。

第一阶段:筑基语言之源——预训练阶段(Pre-train)

预训练是大模型修炼的第一步,也是耗时最长、算力吞噬最多的“大力出奇迹”阶段。这个阶段的核心目标是让模型在不依赖人工标注的情况下,自主阅读人类世界海量的无标签文本(如网页、书籍、百科等),从而掌握语言的通用底层规律。

1. 核心机制:段落联合概率

在预训练阶段,大模型内部只有一套公式和一套参数,它所做的核心任务可以概括为“文字接龙”——即通过调整内部参数,不断提高训练数据中整段文本的“段落联合概率”

模型通过前文去预测下一个最可能出现的词(Token)。例如,看到“白日依山”,网络通过计算得出后面接“尽”的概率最高,接“吃”的概率极低。提高联合概率,意味着模型对人类语言组织规律的理解越来越深刻。

2. 微观迭代:Batch(批次)与 Epoch(轮次)

由于网络上的海量文本数据过于庞大,计算机的内存无法一次性消化,因此必须采用分批、分阶段的训练策略:

  • Batch(批次) :将庞大的数据集切分成一个个小批次。以某些特定规模的数据集为例(如包含约37.5亿个段落联合概率的训练库),模型每读完一个 Batch 的数据,就会利用优化算法更新、迭代一次内部的函数公式和参数,完成一个小版本的自我进化。
  • Epoch(轮次) :当所有的训练数据被大模型完整地“阅读”并计算过一遍之后,就称为完成了一个 Epoch。通常情况下,为了让模型基础打得更牢,预训练阶段需要重复进行 2 到 3 个 Epoch 的洗礼。

从机器学习分类来看,预训练属于自监督学习(Self-supervised Learning) ,因为它的标签(下一个词是什么)就藏在文本数据的本身,不需要人工费时费力地去标注。

第二阶段:规训对话范式——有监督微调阶段(SFT)

通过预训练,大模型虽然拥有了满腹经纶和流畅的语言组织能力,但它此时只是个“接龙天才”。如果你问它:“请帮我写一首关于秋天的诗。”它可能不会直接帮你写,而是顺着你的话继续接龙:“要求是七言绝句,字数在28字以内……”

也就是说,此时的模型不会做特定任务,不会顺应人类的问答习惯。为了解决这个“接话茬”的问题,必须引入 SFT(Supervised Fine-Tuning, 有监督微调)

1. 概念厘清:什么是半监督学习?

在进入 SFT 前,我们可以清晰地划分几种学习模式的界限:

  • 有监督学习:使用带有明确“人工标签”的数据进行训练。
  • 无监督学习:使用完全没有标签的数据进行训练,寻找内部结构。
  • 自监督学习:如上述的预训练,利用数据自身的前后文作为标签。
  • 半监督学习:将“自监督的预训练”与“有监督的SFT”两个阶段无缝组合的训练范式,在大模型领域构成了标准的半监督进化路径。

2. 人工教科书与回答预测

SFT 阶段的核心是教模型“听懂指令”并“规范作答”。

  • 首先,由专业的人工团队编写一套高质量的“一问一答”(Prompt-Response)数据集,作为模型的教科书。
  • 训练时,系统先把“问题”作为已知条件输入给预训练后的模型,强迫模型去预测“正确回答的第一个字”。
  • 每条数据会计算一个回答的段落联合概率,每批数据再计算一个总联合概率,通过损失函数反向传播,去微调和修正大模型的函数与参数。

经历过 SFT 调教后,大模型终于脱胎换骨,明白了看到问号或指令时应当去“回答问题”,而不是盲目地去“扩写问题”。

第三阶段:树立价值标尺——奖励模型构建阶段(Reward Model)

通过 SFT 之后,大模型已经变成了一个合格的对话助手。然而,人类的偏好是复杂且微妙的。同一个问题,可能有好几种回答方式,有些回答虽然正确但冷冰冰,有些回答则更温暖、更详实;同时,模型还可能输出一些带有偏见或不安全的内容。为了让模型彻底同人类价值观与偏好对齐(Alignment) ,我们需要构建一个“裁判”——奖励模型(Reward Model, RM)

1. 模型的分流与各司其职

在 SFT 阶段结束后,根据神经网络参数量的规模,通常会产生不同规格的版本,例如 6B、32B、200B、500B 等(B代表十亿参数)。此时,研发团队会针对不同体量的模型进行分工:

  • 挑选其中一个中等规模的模型(例如 6B 或 32B),拿去训练成奖励模型(RM)
  • 挑选另一个性能表现最好、规模通常也最大的模型,留作下一步的强化学习核心模型(Policy Model)

2. 偏好数据的收集与裁判的诞生

奖励模型需要学会像人类一样去评判回答的好坏,其训练过程如下:

  • 选取一批问题作为提示词,让 SFT 后最好的大模型针对同一个问题生成多个不同的候选答案(例如 A、B、C、D 四个版本)。
  • 让人类专家对这几个候选答案进行好坏排序和标注,这就形成了极其珍贵的人类偏好数据集
  • 用这些偏好数据去训练那个中等规模的模型。训练成功后,这个奖励模型就变成了一个“数字裁判”,能够给大模型的任意回答输入一个分值,从而完美替代昂贵、低效的人工在线打分。

第四阶段:极限自我进化——强化学习阶段(PPO)

有了自动打分的“裁判”(奖励模型)之后,大模型就可以开启高频、密集的“自我做题与进化”模式了。这一阶段主要采用 PPO(Proximal Policy Optimization,近端策略优化) 算法来进行基于人类反馈的强化学习(RLHF)。

1. 刷题、打分与得分最大化

在这个阶段,大模型不再依赖现成的问答对,而是进行实战演练:

  • 自主模拟考:使用与 SFT 阶段重叠度高或同类分布的提示词(问题)输入给参与 PPO 训练的大模型,让它自己写出回答。
  • 自动化批改:模型写出回答后,立刻将回答送入上一阶段训练好的奖励模型进行自动打分
  • 参数调优:PPO 算法的核心目标,就是通过调整大模型的内部参数,使得模型输出的回答在裁判那里的整体得分实现最大化。得分最高的过程,本质上就是深度对齐人类偏好、走向表达极致的过程。

2. 动态飞轮与螺旋上升

这种对齐并不是一成不变的静态过程,而是一个不断迭代的动态飞轮:

  1. 当 PPO 模型的得分提高到一定阶段后,让它重新生成一批全新的、更高质量的回答。
  2. 再次由人类对这些新回答进行重新排序与标注。
  3. 利用更新、更细腻的偏好数据,重新训练一个更严苛、更聪明的奖励模型。
  4. 接着,用新的奖励模型去指导大模型进行新一轮的 PPO 强化训练。

通过这种动态互动的机制,大模型不仅能够给出正确的答案,还能在语气、安全、逻辑结构等多维度上表现得最符合人类的阅读习惯。

总结:大模型训练全景速查

阶段名称核心目标输入数据特征学习范式底层机制简述
1. 预训练 (Pre-train)掌握通用语言规律,积累背景知识海量无标签文本自监督学习通过分 Batch、走多个 Epoch 的方式,不断提高海量文本的段落联合概率,做文字接龙。
2. 有监督微调 (SFT)听懂人类指令,规范问答范式高质量人工问答对(有标签)有监督学习输入提示词,通过预测回复(Response)的第一个字及后续序列,修正模型参数,解决“接话茬”问题。
3. 奖励模型 (RM)建立符合人类偏好的“裁判标准”提示词 + 模型多版本回复 + 人类排序标注偏好对齐学习训练中等规模模型模拟人类裁判,对任意回复进行打分,用以替代人工评价。
4. 强化学习 (PPO)最大化输出质量,实现深度对齐提示词(与SFT重叠或相似)强化学习 (RLHF)模型自主生成回答 \rightarrow 奖励模型打分 \rightarrow PPO算法调整参数使得分最大化 \rightarrow 动态重标迭代。

大语言模型神经网络的进化,是从浩瀚数据中汲取养分,在规范的框架下懂得约束,最终在裁判的指引下追求卓越的过程。这四个阶段缺一不可,共同铸就了当今迈向通用人工智能(AGI)的基石。