NLP 概述

3 阅读7分钟

在人工智能的众多分支中,让机器理解并运用人类的自然语言,一直被视作衡量通用人工智能水平的核心标志之一。语言是人类思维的载体,沉淀了人类绝大部分的文明与知识。本章作为自然语言处理的导论,将系统阐述其核心定义、主要应用任务以及数十年来波澜壮阔的技术演进脉络。


1.1 定义

自然语言处理(Natural Language Processing,简称 NLP) 是一门融合了计算机科学、人工智能以及语言学的交叉学科。其根本目标在于研发能够理解、解析、生成和操作人类自然语言的计算系统,消除人机之间的交互鸿沟。

从功能与处理流向划分,NLP 主要由两大核心支柱构成:

  1. 自然语言理解(Natural Language Understanding, NLU):旨在让计算机“读懂”语言。这包括语法分析、语义消歧、意图识别、上下文推理等,目标是将非结构化的自然语言映射为机器易于处理的结构化语义表示。
  2. 自然语言生成(Natural Language Generation, NLG):旨在让计算机“表达”语言。将机器内部的结构化数据、逻辑概念或知识表示,转化为流畅、符合语法规则且契合语境的人类自然语言。

由于自然语言具有极高的多义性(Ambiguity)灵活性以及对**文化语境(Context)**的深度依赖,NLP 历来被称为“人工智能皇冠上的明珠”,是 AI 领域最具挑战性的研究方向之一。


1.2 常见任务

NLP 的技术体系由一系列经典的任务所驱动,不同任务对应着现实生活中的具体落地场景。

1.2.1 文本分类

文本分类是 NLP 中最基础且应用最广的任务之一,其目标是将一段文本(词、句子、段落或整篇文章)映射到一个或多个预定义的类别标签中。

  • 典型应用:垃圾邮件过滤、新闻主题分类、用户反馈分类、情感分析(判断评论是积极、消极还是中性)。
  • 数学本质:输入变长文本序列 XX,预测离散类别标签 Y{C1,C2,,Ck}Y \in \{C_1, C_2, \dots, C_k\}

1.2.2 序列标注

序列标注关注文本内部各个单元之间的关系,其目标是为输入文本中的每一个词或字都赋予一个对应的标签。

  • 典型应用
    • 中文分词(Word Segmentation):切分句子词界(如利用 B/M/E/S 标签标注)。
    • 词性标注(Part-of-Speech Tagging, POS):识别词汇是名词、动词、形容词等。
    • 命名实体识别(Named Entity Recognition, NER):抽取文本中出现的专有名词,如人名、地名、机构名、时间等。
  • 特点:输入与输出序列等长,强依赖上下文局部约束与全局转移概率。

1.2.3 文本生成

文本生成强调模型的创造性与连贯表达能力,主要处理以特定主题、提示或前文为输入,自动输出连贯文本的任务。

  • 典型应用:开放域对话机器人、小说/故事续写、营销文案自动生成、代码自动补全等。
  • 特点:属于单向自由度较高的开放任务,评价指标更注重语言的流畅性、事实一致性与创造力。

1.2.4 信息抽取

信息抽取(Information Extraction, IE)旨在从非结构化的文本中,提取出结构化的事实知识,为构建知识图谱或数据库提供支撑。

  • 核心子任务
    • 实体识别:定位关键概念实体。
    • 关系抽取(Relation Extraction):判断实体间的关系(如“乔布斯”与“苹果公司”之间的“创始人”关系)。
    • 事件抽取(Event Extraction):识别事件触发词,并抽取出事件的时间、地点、参与者等论元角色。

1.2.5 文本转换

文本转换通常是指将一种自然语言形式映射为另一种形式,输入与输出通常都是完整的文本序列(Seq2Seq 范式)。

  • 典型应用
    • 机器翻译(Machine Translation):跨语种转换(如中译英)。
    • 文本摘要(Text Summarization):将长篇文本压缩提炼为短篇核心摘要。
    • 文本改写与润色:包括文本纠错、风格迁移(将口语转换为正式书面语)等。

1.3 技术演进历史

NLP 从诞生至今经历了数次研究范式的根本性转变,其演进史反映了整个人工智能从“符号推理”到“概率统计”,再到“表示学习”的发展轨迹。

1.3.1 规则系统阶段(20世纪50年代 — 80年代)

在 NLP 的早期探索阶段,学者们试图通过纯粹的逻辑和语言学规则来建模语言。

  • 核心思想:依靠语言学家手工编写复杂的语法规则、词典和专家系统(如形式语言理论、上下文无关文法 CFG)。
  • 局限性:人类语言规则极其繁复、例外众多且不断演化,手工编写的规则系统存在严重的组合爆炸问题,缺乏鲁棒性和泛化能力,系统难以走出实验室环境。

1.3.2 统计方法阶段(20世纪80年代末 — 90年代)

随着大规模机读语料库的出现和计算性能的提升,统计学方法开始取代纯手工规则,成为主流范式。

  • 核心思想:利用概率统计模型,从海量真实语料中计算词与短语的共现概率和转移概率。
  • 代表技术NN-gram 语言模型、隐马尔可夫模型(HMM)、基于词典互信息的统计机器翻译(SMT)。
  • 特点:摆脱了对纯人工规则的完全依赖,使得系统能够有效处理语言中的歧义与噪声。

1.3.3 机器学习阶段(2000年代初 — 2010年代初)

进入 21 世纪,统计机器学习(特别是判别式模型)被全面引入 NLP 领域,研究进入精细化特征工程时代。

  • 核心思想:研究人员通过领域知识提取特征(如词形、前后词窗口、前缀后缀等),结合凸优化算法训练分类器。
  • 代表模型:支持向量机(SVM)、最大熵模型(MaxEnt)、条件随机场(CRF)等。
  • 局限性:这一阶段的成功极度依赖于人工特征工程(Feature Engineering),不仅耗时耗力,而且词的离散表示(如 One-Hot 编码)存在严重的“维度灾难”与“语义鸿沟”问题。

1.3.4 深度学习阶段(2013年至今)

深度学习的兴起彻底重塑了 NLP 的技术底座,实现了从“离散符号”到“连续分布式表示”的跃迁。

  1. 分布式词表示(2013年):以 Word2Vec、GloVe 为代表的词嵌入算法,将单词映射为低维稠密语义向量,解决了词汇语义相似度的度量难题。
  2. 时序建模范式(2014—2016年):循环神经网络(RNN)、长短期记忆网络(LSTM)以及门控循环单元(GRU)配合注意力机制(Attention),成为序列建模的主力,在机器翻译等任务上超越了传统方法。
  3. 预训练语言模型时代(2017—2020年)
    • 2017 年 Transformer 架构的提出,彻底解放了时序计算的并行能力;
    • 随后以 BERT(双向自编码预训练)和 GPT(自回归预训练)为代表的模型确立了“大规模无监督预训练 + 下游任务微调(Fine-tuning)”的标准范式。
  4. 大语言模型时代(LLM,2020年至今):随着模型参数量突破千亿规模,模型展现出了强大的上下文学习(In-Context Learning)、思维链(CoT)以及指令遵循能力,使得绝大多数传统的专用 NLP 任务正在逐步被统一的通用生成模型所整合与重塑。