《大语言模型的能力和局限》学习笔记
来源:华为培训课件《01大语言模型的能力和局限》
一、LLM 推理基础原理
LLM 是什么
- 语言模型(Language Model):一种统计模型,用于预测一系列单词在文本序列中的概率。
- 大语言模型(LLM):基于传统语言模型 + 海量训练数据,涌现出传统语言模型不具备的能力(机器翻译、情感分析、QA 等)。
推理流程(4 个环节)
输入文字 → Tokenizer → Model → Sampler → DeTokenizer → 输出文字
- Tokenizer(分词器):把文字拆成 token 数字序列,如
[1, 40, 2031, ...]。 - Model(模型):对每个候选 token 输出概率分布,如
[0.1, 0.2, ..., 0.6]。 - Sampler(采样器):按概率分布采样下一个 token(如 1024),拼回序列后继续预测下一个(2048)。
- DeTokenizer(逆分词器):把 token 序列还原为文字。
模型通过这种自回归方式逐词循环生成完整输出。
二、LLM 关键采样参数
| 参数 | 作用 | 特性 |
|---|---|---|
| Temperature | 控制输出随机性(类比物理温度) | 值越大越随机/有创造性;值越小越确定/保守 |
| Top-p(核采样) | 只从累计概率达到 p 的最小 token 集合中采样 | 如 top_p=0.7,选累计概率超过 0.7 的那批 token |
| Top-k | 只从概率最高的前 k 个 token 中采样 | 如 top_k=3,只看排名前 3 的候选 |
| presence_penalty(存在惩罚) | 对出现过至少一次的 token 施加一次性惩罚 | 范围 [-2.0, 2.0],鼓励引入新词、避免重复 |
| frequency_penalty(频率惩罚) | 惩罚与 token 出现频率成正比 | 范围 [-2.0, 2.0],合理值约 0.1~1,用于减少输出重复 |
记忆口诀:Temperature 管"发散程度",Top-p / Top-k 管"候选范围",两个 penalty 管"重复抑制"。
三、基础 LLM 的局限及指令微调
基础模型(Base LLM)的局限
- 仅靠"反复预测下一个词"训练,没有明确的目标导向。
- 例:问"现在天上乌云密布,今天天气如何?",它只会续写为"今天天气晴朗,阳光明媚,适合外出活动",不会真正回答问题。
指令微调(Instruction Tuned LLM)
- 用
instruction / input / output三元组数据进行专门训练。 - 让模型学会理解问题并给出符合指令的回答。
- 例:输入"天上在打雷",微调后模型正确回答"雷雨天气,可能有降雨、强风和闪电"。
Prompt 的两类角色
- System Prompt:建立基础框架,确保 AI 行为一致性,约束其在预定义的伦理和操作准则内运行。
- User Prompt:承载即时、具体的用户需求,推动 AI 的实时响应与互动。
附:思考题答案
1. 以下哪些是 LLM 的关键采样参数?
- A. Top_k ✅ B. Top_p ✅ C. Temperature ✅ D. Prompt ❌
- 答案:ABC(Prompt 是输入方式,不属于采样参数)
附:课程小结
- 描述了大语言模型推理的基础原理
- 讲解了大语言模型关键采样参数的定义
- 讲解了基础模型和指令微调模型的定义
缩略语
- LLM:Large Language Model,大语言模型