本章要解决的问题
DeepSeek、Qwen、豆包、GPT 到底选哪个?模型选错,后面的 Agent 架构全都白搭,怎么选才不后悔?
章节大纲
- 2.1 从 Transformer 到 LLM:必懂的 6 个概念
- 2.2 开源 vs 闭源:模型选型决策框架
- 2.3 中文生态模型对比:DeepSeek / Qwen / 豆包 / 混元 / 海外模型
- 2.4 推理成本与延迟预算
- 🛠 解决方案:按「任务类型 × 成本预算 × 数据敏感度」选模型的实操清单
2.1 从 Transformer 到 LLM:必懂的 6 个概念
构建 Agent 不需要你会训练模型,但必须听懂模型的语言。以下 6 个概念是理解后续一切讨论的地基。
图 1:LLM 必懂 6 概念
2.1.1 注意力机制(Attention):模型怎么"看懂"上下文
注意力机制让模型在处理某个词时,能"看向"上下文里其他相关的词——比如读"它"时,能关联到前文的"苹果"。
"小明把苹果放在桌上,然后吃了【它】"
↑
注意力:这个"它"指代苹果(权重高)、不是小明
为什么重要:这是 Transformer(2017 年《Attention Is All You Need》)的核心创新,也是"上下文"这个概念(第 3 章)的技术根源——模型的能力上限,首先取决于它能"注意"到多大的上下文。
2.1.2 预训练(Pre-training):模型是怎么"长大"的
预训练 = 在超大规模文本上"预测下一个词",让模型学到语言规律和世界知识。
输入:"中国的首都是"
输出预测:"北京"(概率最高)
预训练让模型获得了"语感"和"常识"。但此时它只会"接话",还不会"听话"——所以需要下一步。
2.1.3 指令微调(SFT):从"会接话"到"会听话"
SFT(Supervised Fine-Tuning)= 用"指令-回答"对(标注数据)微调模型,让它学会遵循指令。
预训练模型像"会接龙的学生",SFT 之后变成"能听懂老师布置作业的学生"。这是模型"可用性"的关键一跃。
2.1.4 人类反馈强化学习(RLHF):从"会听话"到"会做对"
RLHF = 用人类(或 AI)对回答的偏好反馈,强化模型产出"人类更满意"的回答。
模型回答 A:"北京"(直接)
模型回答 B:"北京是中国首都,气候四季分明……"(更友好)
人类偏好 → 奖励 B → 模型学会"更友好地作答"
RLHF 是 ChatGPT 系列"好用"的秘密——它让模型不仅答对,还答得符合人类预期(语气、结构、避免有害内容)。
2.1.5 KV 缓存(KV Cache):为什么第二次调用更快
KV 缓存 = 把已处理过的上文(Key/Value 向量)缓存起来,新请求只需计算新增部分。
这是"多轮对话为什么越聊越快""Agent 循环为什么第二轮更省"的底层原因——长上下文的重复计算被缓存复用(呼应第 24 章 Prompt 缓存的模型侧基础,第 23 章成本优化的技术支点)。
2.1.6 上下文窗口(Context Window):模型的一次性"工作记忆"
上下文窗口 = 模型单次能"同时看到"的最大 token 数。
| 窗口大小 | 类比 | 能力 |
|---|---|---|
| 4K-8K | 一页纸 | 短文对话 |
| 32K-64K | 一本书的一章 | 长文档问答 |
| 128K-1M | 一摞书 | 超长文档、大型代码库 |
上下文窗口是第 3 章"上下文工程"的起点——窗口是资源,要精打细算。
六个概念串起来:Transformer 注意力 →(预训练学会知识)→(SFT 学会听话)→(RLHF 学会做对)→(KV 缓存加速推理)→(上下文窗口限制视野)。作为 Agent 开发者,最常打交道的三个是:上下文窗口(配上下文)、KV 缓存(算成本)、RLHF(理解模型"为什么这样答")。
2.2 开源 vs 闭源:模型选型决策框架
2.2.1 两类模型的核心差异
| 维度 | 闭源 API(GPT/豆包/DeepSeek 在线) | 开源模型(Qwen/DeepSeek 开源版/Llama) |
|---|---|---|
| 部署 | 无需部署,按量付费 | 需自己部署(GPU/云主机) |
| 数据安全 | 数据出域(企业合规风险) | 数据不出域(私有化) |
| 成本 | 按 token 付费,量大有压力 | 固定成本,高利用率时边际成本低(需计入 GPU 和运维) |
| 定制 | 有限(只能用 API 参数) | 可微调、可蒸馏、完全掌控 |
| 迭代 | 厂商更新,自动升级 | 需自己跟进新版本 |
| 门槛 | 极低(注册即有 key) | 高(要 GPU、要运维) |
图 2:开源 vs 闭源对比
2.2.2 选型决策树(第一版)
数据能不能出域?
├─ 不能(金融/医疗/涉密)→ 开源私有化部署
└─ 能
├─ 用量大且稳定?→ 开源自部署可能更省(需计入 GPU 和运维)
└─ 用量小/波动/想快速上线?→ 闭源 API
图 3:模型选型决策
一句话:数据敏感选开源,快速起步选 API,量大且稳定时自部署可能更省(呼应第 23 章成本优化——成本模型决定部署形态,需综合评估 GPU 和运维成本)。
2.2.3 混合部署:不是二选一
生产系统最常见的形态是混合:核心/敏感任务走私有化开源模型,长尾/探索任务走闭源 API,中间用路由(第 11 章)按"任务类型 × 敏感度"分流。选型不是一次定死,而是可演进的架构决策。
2.3 中文生态模型对比
2.3.1 主流模型速览(截至 2026 年中)
| 模型 | 厂商 | 特点 | 适合场景 | 生态 |
|---|---|---|---|---|
| DeepSeek-V3 | 深度求索 | 综合能力强、中文好、价格低 | 通用 Agent 主力 | OpenAI 兼容、可私有化 |
| DeepSeek-R1 | 深度求索 | 推理模型(思维链)、数学/逻辑强 | 复杂推理、代码 | 注意别乱调温度(第 24 章) |
| Qwen(通义千问) | 阿里 | 开源系列最全、32K~1M 窗口 | 企业知识库、长文档 | 开源可私有化、生态广 |
| 豆包 Doubao | 字节 | 中文对话自然、价格低 | 客服、内容创作 | 字节系生态(扣子) |
| 混元 Hunyuan | 腾讯 | 与腾讯生态整合深 | 微信/企微场景 | 腾讯系生态 |
| GPT-4o / o 系 | OpenAI | 综合最强、工具调用最成熟 | 复杂任务、多模态 | 生态最全、成本高 |
| Claude | Anthropic | 长文本/代码强、MCP 起源 | 代码 Agent、长上下文 | MCP 生态 |
2.3.2 关键选型维度对比(中文视角)
| 维度 | 推荐 | 理由 |
|---|---|---|
| 通用 Agent 主力 | DeepSeek-V3 / Qwen | 中文强、价格低、兼容好 |
| 复杂推理任务 | DeepSeek-R1 / o 系 | 思维链能力碾压 |
| 长文档/知识库 | Qwen(大窗口)/ Claude | 窗口大、长文稳 |
| 企业私有化 | Qwen / DeepSeek 开源版 | 开源可自部署 |
| 腾讯/微信场景 | 混元 | 生态整合 |
| 字节/扣子场景 | 豆包 | 生态整合 |
| 多模态(图/音) | GPT-4o / 豆包 | 多模态成熟 |
2.3.3 选模型的核心误区
- "模型越强越好":强的贵、慢。简单任务用小模型(第 11 章模型路由),大模型是"重武器"。
- "只看基准分":榜单分数 ≠ 你的场景效果。用你自己的 50 条真实数据对比评测(第 20 章方法论),比任何榜单都可靠。
- "换模型只换 key":各模型参数行为不同(第 24 章表三:
top_k支持、推理模型 temperature 行为可能不同),迁移要回归测试。
2.4 推理成本与延迟预算
2.4.1 成本构成:不只是"一个 token 多少钱"
Agent 的真实成本 = 单价 × 用量 × 循环次数:
图 4:Agent 成本公式
单次任务成本 ≈ 单价(元/千token) × 单次token量 × 调用次数
↑ ↑ ↑
模型定价 输入+输出总量 Agent循环步数
Agent 循环(第 6 章)把调用次数放大 2~10 倍,同样的模型,Agent 形态的成本是单次问答的数倍——这是 1.5 章"能不用 Agent 就不用"的经济学依据。
2.4.2 延迟预算:交互场景的生死线
| 场景 | 可接受延迟 | 手段 |
|---|---|---|
| 实时对话 | < 2s | 流式输出(stream)+ 小模型 |
| 客服/助手 | < 5s | 小模型 + 缓存 |
| 后台任务 | 10s~5min | 可接受,异步化 |
| 批处理 | 分钟级 | 队列 + 并行(第 12 章) |
预算三件事:设单任务 token 上限(第 24 章 G5 预算封顶)、开 Prompt 缓存(KV Cache)、简单任务路由到小模型(第 11 章)。
🛠 解决方案:按「任务类型 × 成本预算 × 数据敏感度」选模型实操清单
常见问题
- "选型怕选错,后面全白搭":选型是可演进的(2.2.3 混合部署),先用兼容协议(OpenAI 兼容)起步,随时能换,别被锁死。
- "开源和闭源纠结":回到第一原则——数据能不能出域?不能就开源,能就按成本/速度选。
- "模型效果评估靠感觉":用自己的 50 条真实数据做对比评测(2.3.3),别信榜单。
- "成本失控":预算封顶 + 缓存 + 小模型路由(2.4.2 三件事)。
- "推理模型和通用模型混用出错":推理模型(R1/o 系)参数行为可能与通用模型不同(第 24 章表三),混用时应路由分流并做评测验证。
解决方案速查表
| 你的情况 | 推荐模型 | 关键动作 |
|---|---|---|
| 通用 Agent、中文场景、预算敏感 | DeepSeek-V3 / Qwen | OpenAI 兼容起步 |
| 数学/逻辑/复杂推理 | DeepSeek-R1 / o 系 | 不调温度,配自检 |
| 长文档知识库 | Qwen 大窗口 / Claude | 大窗口 + RAG |
| 数据敏感(金融/医疗) | Qwen / DeepSeek 开源私有化 | 自部署 + 安全合规 |
| 腾讯系/字节系生态 | 混元 / 豆包 | 生态优先 |
| 多模态需求 | GPT-4o / 豆包 | 原生多模态 |
实战提示
- 协议先行:一律选 OpenAI 兼容接口的模型,迁移成本最低(第 24 章表三已注明各家兼容性)。
- 50 条评测定生死:上线前用自有数据对比候选模型,一次评测胜过十篇榜单。
- 混合部署是常态:敏感任务私有化 + 长尾走 API,路由分流(第 11 章)。
- 成本预算三件套:token 上限 + Prompt 缓存 + 小模型路由,缺一不可。