AI 应用开发 学习指南

34 阅读7分钟

AI 应用开发 学习指南

【成长全景图】
阶段 0: 核心底座 (Python + 数据基础 + 大模型机理)
   
阶段 1: 结构化输出与受控生成 (消除幻觉的关键)
   
阶段 2: 高级数据工程与 GraphRAG (突破 20k 窗口的核心)
   
阶段 3: 复杂工作流编排与符号系统 (确定性校验逻辑)
   
阶段 4: 私有化部署与吞吐优化 (内网低算力跑百万字)
   
阶段 5: 评测体系与工业级交付 (怎么证明系统没漏检)

image.png

阶段 0:核心底座与心智模型

要做好应用开发,首先要建立对大模型的正确认知LLM 是一个“根据概率预测下一个 Token”的文本生成器,它不是神,有幻觉、算数极差、记忆有限。

1. 核心技能

  • Python 高级特性:类型注解(Type Hints)、异步编程(asyncio,处理高并发 API 必备)、Pydantic(数据校验神器)。

  • Token 与分词机理:理解 Tokenizer、Byte-Pair Encoding(BPE),知道为什么中文耗费的 Token 往往更多、为什么数字在分词后容易被模型拆散导致计算错误。

  • Context Window(上下文窗口)与注意力机制

    • 理解 Attention 机制为什么会随长度呈平方级膨胀。
    • 理解 Lost in the Middle(大模型经常记住开头和结尾,遗忘中间内容)的现象。

阶段 1:结构化输出与受控生成

在企业级场景中,严禁让模型自由发挥写小作文。面对 20k 窗口,你的输入和输出都必须是高密度的结构化数据。

1. 核心技能

  • JSON Mode 与 JSON Schema:掌握如何强制模型按照固定格式输出,字段缺一不可。

  • 结构化提取框架

    • Instructor(Python 库):基于 Pydantic 的大模型结构化抽取工具,支持自动重试与校验。
    • Outlines / SGLang:基于正则表达式(Regex)和状态机的语法级约束生成(Logit Bias 拦截)。
  • Few-Shot 与 Chain-of-Thought(思维链) :在抽取复杂参数时,如何设计极简的示例让模型准确识别“规格、公差、物理量”。

🛠️ 阶段目标小项目

  • 编写一段脚本,输入一篇 2000 字的凌乱技术文档,零幻觉提取出所有的 {参数名, 额定值, 允许误差, 所在章节} 并输出为严格合法的 Python 对象。

阶段 2:高级长文本工程与 GraphRAG

这是解决**“百万字文档 + 20k 窗口限制”**的最核心技术栈。

1. 核心技能

  • 文档切分策略(Chunking)

    • 告别死板的按字数切分(如每 500 字一刀)。
    • 掌握语义切分基于 Markdown/PDF 目录树的层级切分(Recursive Chunking)滑动窗口重叠切分
  • 向量检索(Vector Search)的局限与调优

    • 理解 Dense Embedding(稠密向量,语义匹配)与 Sparse BM25(稀疏检索,精准字词匹配)的混合检索(Hybrid Search)。
    • 掌握重排模型(Reranker,如 BGE-Reranker)的使用。
  • 知识图谱(Knowledge Graph)与 GraphRAG

    • 图数据库基础(Neo4j 或轻量级的 NetworkX)。
    • 实体与关系抽取(Entity-Relation Extraction)
    • 实体消歧与对齐(Entity Resolution) :比如把文档中的“主驱电机”、“1号电机”、“M1”识别为同一个实体。

🛠️ 阶段目标小项目

  • 构建一个微型知识图谱系统:把 10 篇相关的产品说明书解析成 Neo4j 节点和边,能够通过 Cypher 语句查询出“哪些部件的工作温度超过了 80 度”。

阶段 3:复杂工作流编排与混合校验架构

大模型只负责“阅读理解”,真正的“一致性比对”需要靠传统的代码/规则引擎

codeCode

【大模型】擅长:从自然语言中识别出 "V_in = 220V""输入电压为 380伏"
【程序代码】擅长:if 220 != 380: 报警("发现不一致!")

1. 核心技能

  • 状态机与工作流编排

    • 学习 LangGraph 或 LlamaIndex Workflows

    • 掌握 Map-Reduce 范式

      • Map:把百万字分拆成 100 个 10k 的块,并行抽取参数表。
      • Reduce:将 100 个参数表去重、归并成一张“全局系统参数大表”。
  • 确定性规则校验系统

    • 用 Python / SQL 编写冲突检测算法(比对全局表中同一实体的属性矛盾、范围溢出、逻辑互斥)。
  • 人机协同(Human-in-the-Loop)

    • 规则系统发现疑似矛盾时,自动捞取对应的原文段落,拼接成一个 10k 的 Context,让大模型输出最终判决说明供人工核对。

阶段 4:私有化部署与吞吐优化

在内网跑百万字提取,如果有 100 篇文档,那就是上亿字。必须懂得如何榨干内网显卡的性能。

1. 核心技能

  • 开源大模型推理引擎

    • vLLM(目前企业私有化部署事实上的标准,掌握 PagedAttention、连续批处理 Continuous Batching)。
    • Ollama(快速本地测试与原型开发)。
  • 量化技术(Quantization)

    • 理解 AWQ、GPTQ、GGUF/bitsandbytes。
    • 知道如何在 16G/24G 消费级显卡(如 RTX 4090)上流畅运行 14B~32B 的开源模型(如 Qwen2.5-14B/32B)。
  • 轻量级微调(LoRA / QLoRA)

    • 会用 LLaMA-Factory 或 Unsloth 微调小模型。
    • 应用场景:通用的 7B 模型抽取专业参数经常漏检,用 500 条高质量标注数据微调它,让它成为专精该领域的“提取专用小钢炮”。

阶段 5:评测、可观测性与工业级交付

做 AI 应用最怕被业务方问:“你这个一致性检查系统,准确率到底是多少?有没有漏报?”

1. 核心技能

  • 大模型评测(LLM Evaluation)

    • 掌握 Ragas / DeepEval 评测框架。
    • 如何构建合成测试集(Synthetic Dataset Generation):用大模型自己造 100 个“埋了逻辑冲突”的长文档样本,用来测试你的系统能不能全部揪出来。
  • 可观测性(Observability & Tracing)

    • 掌握 Langfuse 或 Arize Phoenix(私有化部署),追踪每一次 Map-Reduce 调用的延迟、Token 消耗和失败重试。

推荐学习路径与时间规划

阶段周期核心学习内容阶段交付物(做出来才算过关)
第一步:基础与受控第 1~4 周Python 异步 + Pydantic + Tokenizer 机制 + Instructor 结构化提取跑通单篇长文的高精度 JSON 提取脚本
第二步:数据与图谱第 5~8 周混合检索 + Neo4j 图数据库 + Entity Resolution(实体消歧)构建一个能自动落库知识图谱的数据流管道
第三步:架构与编排第 9~11 周LangGraph + Map-Reduce 工作流 + Python 确定性比对引擎实现题图中的核心系统:百万字一致性与参数比对系统
第四步:内网工程化第 12~14 周vLLM 部署 + LoRA 微调专用提取模型 + Langfuse 链路追踪将整个系统打包,在单卡/双卡内网机器上完整跑通与评测

给小白的建议:避坑指南

  1. 不要从“手写 Transformer 神经网络底层”开始:去推导微积分反向传播对你做业务应用毫无帮助。把重点放在系统架构、数据流设计、模型能力边界上。
  2. 不要迷信“超长上下文” :即使未来模型支持 10M 窗口,一次性喂进去的效果也远远不如“结构化提取后精准比对”。确定性逻辑永远比概率生成更适合严肃工业场景。
  3. 重视小模型(7B/14B/32B)的价值:学会用 Prompt 约束、JSON Mode 和少量微调把小模型调教好,这是你在内网严苛资源下最核心的竞争力。