01大语言模型的能力和局限

0 阅读3分钟

《大语言模型的能力和局限》学习笔记

来源:华为培训课件《01大语言模型的能力和局限》

一、LLM 推理基础原理

LLM 是什么

  • 语言模型(Language Model):一种统计模型,用于预测一系列单词在文本序列中的概率。
  • 大语言模型(LLM):基于传统语言模型 + 海量训练数据,涌现出传统语言模型不具备的能力(机器翻译、情感分析、QA 等)。

推理流程(4 个环节)

输入文字 → Tokenizer → Model → Sampler → DeTokenizer → 输出文字
  1. Tokenizer(分词器):把文字拆成 token 数字序列,如 [1, 40, 2031, ...]
  2. Model(模型):对每个候选 token 输出概率分布,如 [0.1, 0.2, ..., 0.6]
  3. Sampler(采样器):按概率分布采样下一个 token(如 1024),拼回序列后继续预测下一个(2048)。
  4. DeTokenizer(逆分词器):把 token 序列还原为文字。

模型通过这种自回归方式逐词循环生成完整输出。


二、LLM 关键采样参数

参数作用特性
Temperature控制输出随机性(类比物理温度)值越大越随机/有创造性;值越小越确定/保守
Top-p(核采样)只从累计概率达到 p 的最小 token 集合中采样top_p=0.7,选累计概率超过 0.7 的那批 token
Top-k只从概率最高的前 k 个 token 中采样top_k=3,只看排名前 3 的候选
presence_penalty(存在惩罚)对出现过至少一次的 token 施加一次性惩罚范围 [-2.0, 2.0],鼓励引入新词、避免重复
frequency_penalty(频率惩罚)惩罚与 token 出现频率成正比范围 [-2.0, 2.0],合理值约 0.1~1,用于减少输出重复

记忆口诀:Temperature 管"发散程度",Top-p / Top-k 管"候选范围",两个 penalty 管"重复抑制"。


三、基础 LLM 的局限及指令微调

基础模型(Base LLM)的局限

  • 仅靠"反复预测下一个词"训练,没有明确的目标导向
  • 例:问"现在天上乌云密布,今天天气如何?",它只会续写为"今天天气晴朗,阳光明媚,适合外出活动",不会真正回答问题。

指令微调(Instruction Tuned LLM)

  • instruction / input / output 三元组数据进行专门训练。
  • 让模型学会理解问题并给出符合指令的回答
  • 例:输入"天上在打雷",微调后模型正确回答"雷雨天气,可能有降雨、强风和闪电"。

Prompt 的两类角色

  • System Prompt:建立基础框架,确保 AI 行为一致性,约束其在预定义的伦理和操作准则内运行。
  • User Prompt:承载即时、具体的用户需求,推动 AI 的实时响应与互动。

附:思考题答案

1. 以下哪些是 LLM 的关键采样参数?

  • A. Top_k ✅ B. Top_p ✅ C. Temperature ✅ D. Prompt ❌
  • 答案:ABC(Prompt 是输入方式,不属于采样参数)

附:课程小结

  1. 描述了大语言模型推理的基础原理
  2. 讲解了大语言模型关键采样参数的定义
  3. 讲解了基础模型和指令微调模型的定义

缩略语

  • LLM:Large Language Model,大语言模型