系列第 5 篇 / 共 5 篇:理解训练收敛和泛化的边界。

一句话:训练过程确实收敛,但收敛是算法层面的事(优化),不是知识层面的事(逼近真相)。

这是深度学习里最容易被误解、也最颠覆直觉的一个点。

一、先纠概念:函数没有"收敛",是"序列"在收敛

数学上,"收敛"说的是一串数越来越靠近某个极限。

  • 我们不说"这个函数是收敛的",而是说训练过程收敛了:损失值随迭代下降并趋于平稳(3.9 → 1.2 → 0.4 → 0.31 → 0.30……),参数趋于稳定
  • 你说的"收敛函数才能取极值"混了两个概念:
  • 收敛:序列有极限(手段)
  • 极值:函数取到最大/最小(目标)

训练里"收敛"是手段,"取到极值(损失最小)"是目标。

二、关键问题:这个极值能不能"解出来"?

你可能想说:收敛的函数应该是"闭合"的、能直接写出答案。这对应数学里的闭式解(closed-form solution)。

  • 能闭式解:y = x²(凸函数),令导数 2x = 0,直接解出最小值在 x = 0。写得出公式,一步到位。
  • 神经网络:有 10 亿个参数 → 损失函数是 10 亿维空间里的非凸函数 → 根本写不出"最优参数 = 某个公式",只能迭代逼近(梯度下降一步步走,走到梯度≈0 停下)。

所以答案恰好相反:大模型的训练不是"闭合地解出来",而是"开放地一步步爬过去"。 收敛的是迭代路径,不是能写出的公式。

三、它收敛到的是什么?

梯度下降收敛到驻点(梯度 = 0 的点):

函数类型驻点 = ?
凸函数(如 x²)全局最小(唯一)
神经网络(非凸)大量局部极小值,甚至鞍点

好消息(2018 年被数学证明):当过参数化(参数远多于数据量)时,高维损失景观非常"友好"——好点被盆地连起来、坏坑极稀少。梯度下降几乎总能收敛到和全局最优差不多好的点。这就是大模型"总能训练得动"的理论依据。

四、"越来越准确"是最大的坑:收敛 ≠ 泛化

训练收敛到的是"在这批训练数据上误差最小的函数",不等于逼近真相。

经典实验(Zhang et al., 2017):把训练集标签彻底随机打乱(猫的照片标成狗),神经网络照样把训练损失收敛到接近 0——它把随机标签也一字不差背下来了。

结论:

  • 收敛 = 拟合训练数据(优化问题,能做到)
  • 泛化 = 对没见过的数据准(统计问题,很玄)
  • 两者是两个完全不同的维度。大模型能收敛,是优化;它能泛化,是统计

类比:大雾天摸黑下山找谷底。你摸到一片平地就停下(收敛),但你不确定这是不是整座山最低的谷(局部极小),而且这张"地图"是训练数据不是真实世界——这块平地下雨时会不会淹(泛化),下山时根本看不出来。

2018 年的理论证明了:这座山形状很好,好谷多、坏坑少,随便摸索也能到不错的谷底。

五、相关论文清单("讲收敛"的那些论文)

按理解顺序推荐:

  1. Robbins & Monro (1951) — 随机逼近。整个"随机梯度下降能收敛"的数学源头,SGD 的圣经。
  2. Zhang et al. (2017)《Understanding deep learning requires rethinking generalization》 — "背随机标签"实验。最值得先读,颠覆直觉。
  3. Jacot et al. (2018)《Neural Tangent Kernel》 — 深度学习收敛理论开山之作:无穷宽网络下梯度下降收敛到全局最优,模型等价于线性模型。
  4. Du et al. (2018) & Allen-Zhu et al. (2018) — 把 NTK 做到有限宽度:过参数化网络梯度下降可证明收敛到全局最优。即"高维损失景观友好"的数学依据。
  5. Choromanska et al. (2015)《The Loss Surfaces of Multilayer Networks》 — "局部极小值质量都差不多"的经验研究。
  6. Reddi et al. (2019)《On the Convergence of Adam and Beyond》 — 分析 Adam 优化器为什么不总是收敛、怎么修。

入门建议:从 Zhang 2017 和 Du 2018 入手——前者颠覆三观,后者给你数学保证,都相对好懂。

六、一句话总结

训练里的"收敛"是算法层面的(优化过程趋于驻点),不是知识层面的(逼近真相)。

它给你的是"在训练数据上误差最小的一个函数";至于它对新数据准不准,那是泛化的战场——那才是大模型真正"玄学"的地方。

评论

可以留下你的想法。评论提交后会进入审核,通过后公开展示。