第 2 章 大模型基础与选型

16 阅读9分钟

本章要解决的问题

DeepSeek、Qwen、豆包、GPT 到底选哪个?模型选错,后面的 Agent 架构全都白搭,怎么选才不后悔?

章节大纲

  • 2.1 从 Transformer 到 LLM:必懂的 6 个概念
  • 2.2 开源 vs 闭源:模型选型决策框架
  • 2.3 中文生态模型对比:DeepSeek / Qwen / 豆包 / 混元 / 海外模型
  • 2.4 推理成本与延迟预算
  • 🛠 解决方案:按「任务类型 × 成本预算 × 数据敏感度」选模型的实操清单

2.1 从 Transformer 到 LLM:必懂的 6 个概念

构建 Agent 不需要你会训练模型,但必须听懂模型的语言。以下 6 个概念是理解后续一切讨论的地基。

图 1:LLM 必懂 6 概念

图 1:LLM 必懂 6 概念

2.1.1 注意力机制(Attention):模型怎么"看懂"上下文

注意力机制让模型在处理某个词时,能"看向"上下文里其他相关的词——比如读"它"时,能关联到前文的"苹果"。

"小明把苹果放在桌上,然后吃了【它】"
                ↑
       注意力:这个"它"指代苹果(权重高)、不是小明

为什么重要:这是 Transformer(2017 年《Attention Is All You Need》)的核心创新,也是"上下文"这个概念(第 3 章)的技术根源——模型的能力上限,首先取决于它能"注意"到多大的上下文

2.1.2 预训练(Pre-training):模型是怎么"长大"的

预训练 = 在超大规模文本上"预测下一个词",让模型学到语言规律和世界知识。

输入:"中国的首都是"
输出预测:"北京"(概率最高)

预训练让模型获得了"语感"和"常识"。但此时它只会"接话",还不会"听话"——所以需要下一步。

2.1.3 指令微调(SFT):从"会接话"到"会听话"

SFT(Supervised Fine-Tuning)= 用"指令-回答"对(标注数据)微调模型,让它学会遵循指令。

预训练模型像"会接龙的学生",SFT 之后变成"能听懂老师布置作业的学生"。这是模型"可用性"的关键一跃。

2.1.4 人类反馈强化学习(RLHF):从"会听话"到"会做对"

RLHF = 用人类(或 AI)对回答的偏好反馈,强化模型产出"人类更满意"的回答。

模型回答 A:"北京"(直接)
模型回答 B:"北京是中国首都,气候四季分明……"(更友好)
人类偏好 → 奖励 B → 模型学会"更友好地作答"

RLHF 是 ChatGPT 系列"好用"的秘密——它让模型不仅答对,还答得符合人类预期(语气、结构、避免有害内容)。

2.1.5 KV 缓存(KV Cache):为什么第二次调用更快

KV 缓存 = 把已处理过的上文(Key/Value 向量)缓存起来,新请求只需计算新增部分。

这是"多轮对话为什么越聊越快""Agent 循环为什么第二轮更省"的底层原因——长上下文的重复计算被缓存复用(呼应第 24 章 Prompt 缓存的模型侧基础,第 23 章成本优化的技术支点)。

2.1.6 上下文窗口(Context Window):模型的一次性"工作记忆"

上下文窗口 = 模型单次能"同时看到"的最大 token 数。

窗口大小类比能力
4K-8K一页纸短文对话
32K-64K一本书的一章长文档问答
128K-1M一摞书超长文档、大型代码库

上下文窗口是第 3 章"上下文工程"的起点——窗口是资源,要精打细算

六个概念串起来:Transformer 注意力 →(预训练学会知识)→(SFT 学会听话)→(RLHF 学会做对)→(KV 缓存加速推理)→(上下文窗口限制视野)。作为 Agent 开发者,最常打交道的三个是:上下文窗口(配上下文)、KV 缓存(算成本)、RLHF(理解模型"为什么这样答")。

2.2 开源 vs 闭源:模型选型决策框架

2.2.1 两类模型的核心差异

维度闭源 API(GPT/豆包/DeepSeek 在线)开源模型(Qwen/DeepSeek 开源版/Llama)
部署无需部署,按量付费需自己部署(GPU/云主机)
数据安全数据出域(企业合规风险)数据不出域(私有化)
成本按 token 付费,量大有压力固定成本,高利用率时边际成本低(需计入 GPU 和运维)
定制有限(只能用 API 参数)可微调、可蒸馏、完全掌控
迭代厂商更新,自动升级需自己跟进新版本
门槛极低(注册即有 key)高(要 GPU、要运维)

图 2:开源 vs 闭源对比

图 2:开源 vs 闭源对比

2.2.2 选型决策树(第一版)

数据能不能出域?
  ├─ 不能(金融/医疗/涉密)→ 开源私有化部署
  └─ 能
      ├─ 用量大且稳定?→ 开源自部署可能更省(需计入 GPU 和运维)
      └─ 用量小/波动/想快速上线?→ 闭源 API

图 3:模型选型决策

图 3:模型选型决策

一句话数据敏感选开源,快速起步选 API,量大且稳定时自部署可能更省(呼应第 23 章成本优化——成本模型决定部署形态,需综合评估 GPU 和运维成本)。

2.2.3 混合部署:不是二选一

生产系统最常见的形态是混合:核心/敏感任务走私有化开源模型,长尾/探索任务走闭源 API,中间用路由(第 11 章)按"任务类型 × 敏感度"分流。选型不是一次定死,而是可演进的架构决策。

2.3 中文生态模型对比

2.3.1 主流模型速览(截至 2026 年中)

模型厂商特点适合场景生态
DeepSeek-V3深度求索综合能力强、中文好、价格低通用 Agent 主力OpenAI 兼容、可私有化
DeepSeek-R1深度求索推理模型(思维链)、数学/逻辑强复杂推理、代码注意别乱调温度(第 24 章)
Qwen(通义千问)阿里开源系列最全、32K~1M 窗口企业知识库、长文档开源可私有化、生态广
豆包 Doubao字节中文对话自然、价格低客服、内容创作字节系生态(扣子)
混元 Hunyuan腾讯与腾讯生态整合深微信/企微场景腾讯系生态
GPT-4o / o 系OpenAI综合最强、工具调用最成熟复杂任务、多模态生态最全、成本高
ClaudeAnthropic长文本/代码强、MCP 起源代码 Agent、长上下文MCP 生态

2.3.2 关键选型维度对比(中文视角)

维度推荐理由
通用 Agent 主力DeepSeek-V3 / Qwen中文强、价格低、兼容好
复杂推理任务DeepSeek-R1 / o 系思维链能力碾压
长文档/知识库Qwen(大窗口)/ Claude窗口大、长文稳
企业私有化Qwen / DeepSeek 开源版开源可自部署
腾讯/微信场景混元生态整合
字节/扣子场景豆包生态整合
多模态(图/音)GPT-4o / 豆包多模态成熟

2.3.3 选模型的核心误区

  1. "模型越强越好":强的贵、慢。简单任务用小模型(第 11 章模型路由),大模型是"重武器"。
  2. "只看基准分":榜单分数 ≠ 你的场景效果。用你自己的 50 条真实数据对比评测(第 20 章方法论),比任何榜单都可靠。
  3. "换模型只换 key":各模型参数行为不同(第 24 章表三:top_k 支持、推理模型 temperature 行为可能不同),迁移要回归测试。

2.4 推理成本与延迟预算

2.4.1 成本构成:不只是"一个 token 多少钱"

Agent 的真实成本 = 单价 × 用量 × 循环次数:

图 4:Agent 成本公式

图 4:Agent 成本公式

单次任务成本 ≈ 单价(元/千token) × 单次token量 × 调用次数
              ↑                     ↑            ↑
          模型定价          输入+输出总量     Agent循环步数

Agent 循环(第 6 章)把调用次数放大 2~10 倍,同样的模型,Agent 形态的成本是单次问答的数倍——这是 1.5 章"能不用 Agent 就不用"的经济学依据。

2.4.2 延迟预算:交互场景的生死线

场景可接受延迟手段
实时对话< 2s流式输出(stream)+ 小模型
客服/助手< 5s小模型 + 缓存
后台任务10s~5min可接受,异步化
批处理分钟级队列 + 并行(第 12 章)

预算三件事:设单任务 token 上限(第 24 章 G5 预算封顶)、开 Prompt 缓存(KV Cache)、简单任务路由到小模型(第 11 章)。

🛠 解决方案:按「任务类型 × 成本预算 × 数据敏感度」选模型实操清单

常见问题

  1. "选型怕选错,后面全白搭":选型是可演进的(2.2.3 混合部署),先用兼容协议(OpenAI 兼容)起步,随时能换,别被锁死。
  2. "开源和闭源纠结":回到第一原则——数据能不能出域?不能就开源,能就按成本/速度选。
  3. "模型效果评估靠感觉":用自己的 50 条真实数据做对比评测(2.3.3),别信榜单。
  4. "成本失控":预算封顶 + 缓存 + 小模型路由(2.4.2 三件事)。
  5. "推理模型和通用模型混用出错":推理模型(R1/o 系)参数行为可能与通用模型不同(第 24 章表三),混用时应路由分流并做评测验证。

解决方案速查表

你的情况推荐模型关键动作
通用 Agent、中文场景、预算敏感DeepSeek-V3 / QwenOpenAI 兼容起步
数学/逻辑/复杂推理DeepSeek-R1 / o 系不调温度,配自检
长文档知识库Qwen 大窗口 / Claude大窗口 + RAG
数据敏感(金融/医疗)Qwen / DeepSeek 开源私有化自部署 + 安全合规
腾讯系/字节系生态混元 / 豆包生态优先
多模态需求GPT-4o / 豆包原生多模态

实战提示

  1. 协议先行:一律选 OpenAI 兼容接口的模型,迁移成本最低(第 24 章表三已注明各家兼容性)。
  2. 50 条评测定生死:上线前用自有数据对比候选模型,一次评测胜过十篇榜单。
  3. 混合部署是常态:敏感任务私有化 + 长尾走 API,路由分流(第 11 章)。
  4. 成本预算三件套:token 上限 + Prompt 缓存 + 小模型路由,缺一不可。