系列第 3 篇 / 共 5 篇:补上参数是怎么训练出来的。

一句话:训练 = 反复做"猜下一个词"的考试,答错了就把所有参数朝"下次能答对"的方向调一点点。

核心四步:前向传播 → 算损失 → 反向传播 → 梯度下降。然后三阶段:预训练 → SFT → RLHF。

一、参数是什么?

参数 = 网络里所有权重矩阵中的数字,包括:

词嵌入表(embedding 矩阵)
Q、K、V 三个投影矩阵 × 多头 × 每层
FFN 的两层权重
LayerNorm 的参数
最后的输出线性层
  • GPT-3 有 1750 亿个参数;2026 年旗舰已到 1.6 万亿
  • 参数就是"模型的记忆"——所有学到的规律都编码在这些数字里

二、一次训练循环(核心四步)

① 前向传播(forward)

给模型一段真实文本,让它在每个位置猜下一个词。 例如给它"猫在屋顶__",它给 10 万个候选词各自打分,"上"只得了 0.02。

② 算损失(交叉熵 loss)

把预测分布和真实答案对比,算"差多少":

真实答案概率 0.9  →  loss ≈ 0.1   (猜得准,损失小)
真实答案概率 0.01 →  loss ≈ 4.6   (猜得离谱,损失大)

loss = -log(模型给正确答案的概率)

损失 = 模型对自己预测的惊讶程度。对正确答案越不惊讶,损失越小。

③ 反向传播(backprop)

现在有一个损失数字,要回答:上万亿个参数里,每一个如果动一丁点,损失是变大还是变小?多剧烈?

  • 用微积分的链式法则,从输出层一层层往回算
  • 得到每个参数的梯度(一个方向 + 一个陡度)
  • 可以理解为:"这个参数对这次错误负多大责任、该往哪边推"

④ 梯度下降(gradient descent)

每个参数沿梯度的反方向(下坡方向)挪一小步:

新参数 = 旧参数 − 学习率 × 梯度

类比:大雾天摸黑下山。 你看不见全局,只能感觉脚下坡度(梯度 = 最陡的上升方向),就朝相反方向迈步。

学习率 = 步子大小:太大容易左右横跳跨过谷底;太小走得太慢。

⑤ 分批重复

  • 一次用一批(batch,几百万个 token)算平均损失,更新一次
  • 所有数据过一遍 = 1 个 epoch;预训练通常跑好几个 epoch,数据总量上万亿 token
  • 优化器(Adam):比普通梯度下降聪明——每个参数记住历史梯度,有自己合适的学习率,收敛更快更稳

三、三阶段训练(为什么"能听话")

阶段干什么学到的费用
预训练全网文本(网页/书/代码)上猜下一个词语言、知识、模式——"会说话"最贵(几千张 GPU 跑几个月)
SFT 指令微调用人写的"问题→回答"对微调听指令——"听话"中
RLHF 人类反馈生成多份回答,人类排序打分,训练奖励模型,用强化学习(如 PPO)强化高分行为安全、贴人味、不瞎说——"讨人喜欢"中

一句话:预训练给了它"知识",SFT 给了它"能力",RLHF 给了它"人品"。

补充:2026 年出现 GRPO(DeepSeek-R1 用),证明纯强化学习、不靠人工标注思维链也能训练出长推理能力;Anthropic 则用 Constitutional AI(宪法式 AI)做对齐。

四、规模效应:为什么越大越强

参数、数据、算力同时变大,模型会涌现出小模型没有的能力(推理、写代码、创作)。

  • 这不是谁设计出来的功能,而是规模跨过某个门槛后自己"长"出来的
  • 就像水到某个温度会突然沸腾

五、一张图收尾

海量文本 → 分词 → 向量化 → Transformer → 输出"下一个词"概率分布
                                              │
            与真实下一个词对比 → 损失(loss) ←─┘
                                              │
        反向传播:算出每个参数的梯度(谁该为错误负责)
                                              │
        梯度下降:每个参数沿下坡方向挪一小步(学习率×梯度)
                                              │
        反复几十万步 → 参数收敛 → 模型学会"语言规律"

核心一句话:训练 = 猜词考试 + 错了就反向微调所有参数,直到猜得准。推理 = 参数冻结,只算一遍。

评论

可以留下你的想法。评论提交后会进入审核,通过后公开展示。