一.认识大模型
1.机器学习 分为监督学习,非监督学习,强化学习
2.深度学习 分为神经网络、Transformer
二.大模型应用场景
├─ 1.自然语言处理(NLP)
│ ├─ 情感分析
│ ├─ 文本归类
│ ├─ 信息抽取
│ ├─ 数学问题
│ ├─ 角色扮演
│ ├─ 编程问题
│ └─ 创作问题
├─ 2.语音处理(SLP)
└─ 3.图像视频处理
三.Gradio快速入门
可以调用大模型聊天 等等 熟悉python后要去练习
Hugging Face 发布的开源 Python 包,可以为机器学习模型、API 或任意 Python 函数快速构建 demo 或 web 应用,并且通过 Gradio 的内置共享功能可以快速生成对应的链接,而无需任何编程基础
- 官方网站:gradio.app/
- 官方文档-快速开始:gradio.app/guides/quic…
1.安装 python -m pip install gradio
import gradio as gr
def reverse_text(text):
return text[::-1]
demo = gr.Interface(fn=reverse_text, inputs="text", outputs="text")
demo.launch(share="True")
四.提示词工程
1.提示词是什么?
- 提示工程(Prompt Engineering)是一项通过优化提示词(Prompt)和生成策略,从而获得更好的模型返回结果的工程技术。
流程:提示词 (Prompt) → 大语言模型 LLM → 返回结果 (Completion)
- 好的 Prompt 需要不断调优。
- 说清楚自己到底想要什么,要具体!
- 不要让机器去猜测太多。为了不让机器去猜测,我们就需要告诉细节。
- 提示工程有一些技巧,灵活掌握,事半功倍
2.提示词的构成
3.定义提示词
instruction = """根据下面的上下文回答问题。保持答案简短且准确"""
context = """Teplizumab起源于一个位于新泽西的药品公司"""
query = """OKT3最初是从什么来源提取的?"""
prompt = f"""{instruction} ### 上下文 {context} ### 问题: {query}"""
4.样本学习
//给出样本
示例:这组数字中的奇数加起来是一个偶数:4、8、9、15、12、2、1。
A:答案是 False。
这组数字中的奇数加起来是一个偶数:15、32、5、13、82、7、1。
A:
5.思维链
6.提示词
- 写清楚的指令 将复杂任务分解为更简单的子任务 系统地测试更改(
不要给模糊的一句话需求。明确输出格式、角色、限制条件) - 提供参考文本 使用外部工具(
直接把原文、样例、模板丢进去,让 AI 按照给的例子格式 / 风格输出) - 早期测试和学习(
拿到 prompt 不要直接上复杂场景,先用简单小案例快速测试) - 引入新信息 可靠地复制复杂的风格或方法(
粘贴新相关资料作为上下文,AI 才能基于这份新材料回答)
五.Agent应用开发
图解拆解
>
整张图自上到下分为 4 层:**Agent 类型 → Agent 四大核心能力 → 开发框架 → 底层大模型**,
从上到下是业务概念 → 核心组件 → 开发工具 → 底层基座。
## 第一层:Agent 类型(左上角 + 右上角红框)
### 1)场景分类(蓝色)
- **Action**:做单次动作,简单任务,调用工具完成一步操作
- **Simulation**:模拟仿真,模拟角色、模拟事件推演
- **Autonomous**:**自主 Agent**,无人干预,自己规划、循环执行复杂任务
### 技术能力(深蓝色块)
`Chatbot`聊天机器人、`Multi‑Agent`多智能体(多个 Agent 互相协作)、
`RAG`检索增强生成(刚刚讲过)、`Planning`任务规划、
`Reflection`自我反思(就是 Self‑RAG 那种自检)、`Evaluation`结果评估。
### 右上角红框:AI 经典智能 Agent 分类(源自人工智能经典教材)
1. **Simple Reflex 简单反射 Agent**:只看当前输入,简单条件判断,不记历史。例:收到问题直接回答。
1. **Model‑based Reflex 基于模型的反射 Agent**:维护环境状态记忆,结合历史 + 当前输入做决策。
1. **Goal‑based 基于目标 Agent**:有明确目标,规划多条路径去达成目标。
1. **Utility‑based 基于效用 Agent**:不仅看能不能完成目标,还要选最优方案(权衡成本、好坏)。
1. **Learning 可学习 Agent**:可以从历史经验中自我迭代优化。
> 简单理解:越往下,Agent 越聪明、越复杂。
## 第二层:Agent 四大核心能力(图中间彩色块,Agent 的四大金刚)
> 一个完整 AI Agent,必须具备这 4 大核心模块
1. 🟨 **Planning 规划**:任务拆解。用户一个复杂需求,Agent 自己拆成一步步子任务。
1. 🟥 **Memory 记忆**:保存信息。分短期对话记忆、长期知识库记忆;记住历史对话、历史执行结果。
1. 🟦 **Tools 工具**:调用外部能力。联网搜索、操作文件、调用 API、计算器,大模型本身做不了的事情交给工具。
1. 🟩 **Action 执行**:把规划好的任务,调用工具,真正落地执行动作。
> 完整 Agent 运行链路:
接收问题 → **Memory 读取记忆** → **Planning 拆解任务** → **选择 Tools 工具** → **Action 执行** →
把结果写回 Memory。
## 第三层:开发框架(黄色栏,开发 Agent 用的工具库)
这是程序员写 Agent 程序时用的 SDK,封装好了上面规划、记忆、工具、RAG 的逻辑,不用从零手写。
1. **LangChain**:最流行,生态最全,Agent、RAG 首选。
1. **LlamaIndex**:原本主打 RAG 知识库,现在也支持 Agent 开发。
1. **Semantic Kernel**:微软出品,适合对接微软生态。
## 第四层:模型服务(底层基座)
Agent 框架只是 “脚手架”,真正思考推理靠大模型,分为**闭源、开源**
- **闭源模型(商用 API 调用)** :GPT‑4,Claude3;推理强,直接调用接口,不能本地部署。
- **开源模型(可以本地跑)** :Mistral、DeepSeek、Qwen 通义千问开源版、Gemma2、Phi‑3;
可以下载到自己电脑 / 服务器运行,数据不外流。
* * *
# 整体串联理解(完整链路)
> 用户需求 → Agent 类型(自主 Agent) 👉
四大核心能力:记忆 → 规划拆解任务 → 挑选工具 → 执行 👉
使用 LangChain/LlamaIndex 框架写代码实现这套逻辑 👉
底层调用 GPT‑4/Qwen 等大模型做思考推理 👉
中间还可以结合 RAG、Reflection 自我反思能力提升效果
### 和你上一张 Self‑RAG 图关联
`Self‑RAG`就是**Reflection(自我反思)** 的一种实现,
属于 Agent 技术栈里面的一个子技术,Agent 是更大的概念,RAG 只是 Agent 其中一个组件。
### 通俗类比
- 大模型:人的大脑;
- LangChain 等框架:身体手脚,给大脑提供记忆本、任务清单、工具包;
- Planning 规划:做计划;Memory 记忆:笔记本;Tools 工具:计算器、搜索引擎;Action 执行:动手干活;
- Agent:一个完整会思考、记东西、做计划、用工具干活的智能助手。
>
1.ReAct
2.RAG是什么
self-RAG属于 RAG 的高级变种,加上了自我校验循环
RAG = Retrieval‑Augmented Generation,检索增强生成 简单大白话:让大模型先去查外部资料,再结合查到的资料来回答问题,而不是只靠模型自己脑子里训练过的知识说话
3.Ollama
# Agent Hosting:Ollama
Ollama 开源项目提供了一套用于下载、运行和管理 LLMs 的工具和服务,是 Hosting 领域最受关注的项目之一。
4.多智能体协同
5.项目实战
多模态支持,丰富交互(Multi‑modal Support)
- Dify 能力:支持连接能处理文本、图像、甚至语音的多模态大模型。
- LangBot 能力:能够接收和发送 IM 平台上的文本、图片、语音片段、文件等消息类型。
- 组合效果:
- 用户可以通过语音提问,Agent 以图文并茂的形式回答。
- Agent 可以发送图片、文件(如产品手册)给用户。
- 为未来更智能、更自然的交互体验打下坚实基础。