系列第 4 篇 / 共 5 篇:看不同基础模型到底差在哪里。

先说结论:同一套底层逻辑,不代表能力一样

大模型大多都在做同一件事:用 Transformer 处理上下文,再预测下一个 token。训练路线也相似:预训练学语言和知识,后训练学指令和偏好,对齐阶段让它更符合人类使用习惯。

但同样是这条路线,不同模型的实际体验会差很多。差异主要来自六个地方:架构、训练数据、上下文能力、后训练方法、多模态能力、开放程度和成本。

这就像车都有发动机、轮子和方向盘,但赛车、越野车、家用车的结构和调校完全不同。选模型也不是问“谁最强”,而是问“谁更适合这个任务”。

一、架构差异:Dense 和 MoE

1. 稠密模型 Dense

稠密模型的特点是:每个 token 经过模型时,基本所有参数都会参与计算。

  • 好处:结构直接、训练稳定、推理行为更容易理解。
  • 代价:参数越大,计算越贵。
  • 代表例子:Meta Llama 3.1 405B 是公开模型里很典型的大型稠密模型。

2. 混合专家 MoE

MoE 的全称是 Mixture of Experts,意思是把模型内部拆成很多专家网络。每个 token 进来时,路由器只激活一小部分专家。

可以用一个公司类比:公司有很多员工,但每个项目只叫最适合的几个人参与。这样模型可以拥有很大的总容量,但每次推理只消耗一部分计算。

公开例子里,DeepSeek-V3 是 671B 总参数、每个 token 激活 37B 参数;Qwen3-235B-A22B 是 235B 总参数、22B 激活参数。这说明“总参数”和“激活参数”要分开看。

MoE 的好处是性价比高,适合做大容量模型。代价是路由机制更复杂,部署时总参数仍然要占显存,工程门槛也更高。

二、上下文能力:不是越长越好

上下文窗口决定模型一次能读多少内容。长上下文适合长文档、代码仓库、会议记录、资料整理。

但要注意:标称上下文长度不等于有效理解长度。模型能“装进去”,不代表能稳定记住中间所有细节。实际产品里,长上下文通常还要配合 RAG、摘要、分段检索、引用来源和评估。

所以长上下文没有替代 RAG。RAG 的价值是把最相关的材料提前找出来,让模型在更干净、更短、更可控的上下文里工作。

三、训练数据:读什么,决定擅长什么

模型不是凭空聪明,它的能力来自训练数据和训练方式。

可以这样理解:

  • 中文语料多、中文后训练做得好,中文表达就更自然。
  • 代码数据多、代码评估强,写代码和修 bug 就更稳。
  • 多模态数据从一开始就融合训练,图片、音频、视频理解会更自然。
  • 高质量数据比粗暴堆数据更重要,去重、清洗、筛选、覆盖面都会影响最终能力。

这就是为什么不同模型会有不同“性格”。有的擅长写作,有的擅长代码,有的擅长长文档,有的擅长多模态。

四、后训练和对齐:决定模型好不好用

预训练让模型“会说话”,后训练让模型“会听话”。

常见后训练包括:

  • SFT:用高质量问答数据教模型按指令回答。
  • RLHF / DPO:根据人类偏好或偏好数据,让回答更有用、更安全、更符合人类习惯。
  • 强化学习推理训练:在数学、代码、推理题上通过奖励信号提升长链路推理能力。

很多时候,两个模型的基础能力差不多,但一个更会按格式输出、更少废话、更稳定调用工具,体验就会明显更好。这些差异常常来自后训练,而不是单纯参数量。

五、多模态能力:文字、图片、音频、视频不是一回事

多模态模型可以理解或生成文字之外的信息,比如图片、音频、视频。

这里要分清几类能力:

  • 图片理解:看图、识别内容、分析截图、读图表。
  • 图片生成:根据提示生成图片、改图、保持人物或产品一致性。
  • 音频理解:转写、识别说话人、理解语音内容。
  • 视频理解:理解连续画面、动作、场景变化。
  • 视频生成:从文字或图片生成动态视频。

一个模型文字强,不代表图片生成强;能看视频,也不代表能生成高质量视频。做产品时要按任务选专门能力。

六、开放程度和成本:产品里很关键

闭源模型通常生态完整、工具链成熟、综合能力强,但价格、数据边界和可控性要仔细评估。

开放权重模型适合自托管、私有化、可审计、定制部署,也适合在成本敏感的产品里做大量调用。但部署和维护成本会转移到自己身上,包括显卡、推理框架、量化、监控和升级。

独立开发者更现实的方式是模型路由:

  • 简单摘要、分类、改写,用便宜模型。
  • 复杂推理、重要内容、代码生成,用强模型。
  • 涉及私有数据,用可控部署或严格的数据策略。
  • 多模态任务,用对应最强的专门模型。

七、选型不是选最强,而是选匹配

可以按任务这样判断:

任务优先看什么
中文写作、总结、资料整理中文能力、成本、稳定性
代码和 Agent工具调用、长链路任务、错误恢复
长文档问答上下文、RAG、引用、评估
图片理解视觉理解和图表能力
图片生成构图、中文文字、局部编辑、一致性
私有化部署开放权重、推理成本、硬件要求

八、一句话总结

基础模型的差异,不是“谁参数大谁赢”。

真正要看的是:架构决定计算方式,数据决定擅长领域,后训练决定好不好用,上下文决定能读多长,多模态决定能处理哪些信息,开放程度和成本决定能不能放进产品。

对开发者来说,最成熟的做法不是押宝一家模型,而是按任务建立模型路由和评估体系。

延伸阅读

评论

可以留下你的想法。评论提交后会进入审核,通过后公开展示。