AI Agent开发

0 阅读7分钟

一.认识大模型

1.机器学习 分为监督学习,非监督学习,强化学习
2.深度学习 分为神经网络、Transformer

image.png

二.大模型应用场景

├─ 1.自然语言处理(NLP)
│  ├─ 情感分析
│  ├─ 文本归类
│  ├─ 信息抽取
│  ├─ 数学问题
│  ├─ 角色扮演
│  ├─ 编程问题
│  └─ 创作问题
├─ 2.语音处理(SLP)
└─ 3.图像视频处理

三.Gradio快速入门

可以调用大模型聊天 等等 熟悉python后要去练习
Hugging Face 发布的开源 Python 包,可以为机器学习模型、API 或任意 Python 函数快速构建 demo 或 web 应用,并且通过 Gradio 的内置共享功能可以快速生成对应的链接,而无需任何编程基础

1.安装 python -m pip install gradio
import gradio as gr

def reverse_text(text):
    return text[::-1]

demo = gr.Interface(fn=reverse_text, inputs="text", outputs="text")
demo.launch(share="True")

四.提示词工程

1.提示词是什么?

  • 提示工程(Prompt Engineering)是一项通过优化提示词(Prompt)和生成策略,从而获得更好的模型返回结果的工程技术。

流程:提示词 (Prompt) → 大语言模型 LLM → 返回结果 (Completion)

  • 好的 Prompt 需要不断调优
  • 说清楚自己到底想要什么,要具体
  • 不要让机器去猜测太多。为了不让机器去猜测,我们就需要告诉细节。
  • 提示工程有一些技巧,灵活掌握,事半功倍

2.提示词的构成

image.png

3.定义提示词

instruction = """根据下面的上下文回答问题。保持答案简短且准确"""

context = """Teplizumab起源于一个位于新泽西的药品公司"""

query = """OKT3最初是从什么来源提取的?"""

prompt = f"""{instruction} ### 上下文 {context} ### 问题: {query}"""

4.样本学习

//给出样本
示例:这组数字中的奇数加起来是一个偶数:489151221。
A:答案是 False。

这组数字中的奇数加起来是一个偶数:15325138271。
A:

5.思维链

6.提示词

  • 写清楚的指令 将复杂任务分解为更简单的子任务 系统地测试更改(不要给模糊的一句话需求。明确输出格式、角色、限制条件
  • 提供参考文本 使用外部工具(直接把原文、样例、模板丢进去,让 AI 按照给的例子格式 / 风格输出
  • 早期测试和学习(拿到 prompt 不要直接上复杂场景,先用简单小案例快速测试
  • 引入新信息 可靠地复制复杂的风格或方法(粘贴新相关资料作为上下文,AI 才能基于这份新材料回答

五.Agent应用开发

image.png 图解拆解

> 
整张图自上到下分为 4 层:**Agent 类型 → Agent 四大核心能力 → 开发框架 → 底层大模型**
从上到下是业务概念 → 核心组件 → 开发工具 → 底层基座。

## 第一层:Agent 类型(左上角 + 右上角红框)
### 1)场景分类(蓝色)
-   **Action**:做单次动作,简单任务,调用工具完成一步操作
-   **Simulation**:模拟仿真,模拟角色、模拟事件推演
-   **Autonomous****自主 Agent**,无人干预,自己规划、循环执行复杂任务

### 技术能力(深蓝色块)

`Chatbot`聊天机器人、`Multi‑Agent`多智能体(多个 Agent 互相协作)、
`RAG`检索增强生成(刚刚讲过)、`Planning`任务规划、
`Reflection`自我反思(就是 Self‑RAG 那种自检)、`Evaluation`结果评估。

### 右上角红框:AI 经典智能 Agent 分类(源自人工智能经典教材)

1.  **Simple Reflex 简单反射 Agent**:只看当前输入,简单条件判断,不记历史。例:收到问题直接回答。
1.  **Model‑based Reflex 基于模型的反射 Agent**:维护环境状态记忆,结合历史 + 当前输入做决策。
1.  **Goal‑based 基于目标 Agent**:有明确目标,规划多条路径去达成目标。
1.  **Utility‑based 基于效用 Agent**:不仅看能不能完成目标,还要选最优方案(权衡成本、好坏)。
1.  **Learning 可学习 Agent**:可以从历史经验中自我迭代优化。

> 简单理解:越往下,Agent 越聪明、越复杂。

## 第二层:Agent 四大核心能力(图中间彩色块,Agent 的四大金刚)
> 一个完整 AI Agent,必须具备这 4 大核心模块
1.  🟨 **Planning 规划**:任务拆解。用户一个复杂需求,Agent 自己拆成一步步子任务。
1.  🟥 **Memory 记忆**:保存信息。分短期对话记忆、长期知识库记忆;记住历史对话、历史执行结果。
1.  🟦 **Tools 工具**:调用外部能力。联网搜索、操作文件、调用 API、计算器,大模型本身做不了的事情交给工具。
1.  🟩 **Action 执行**:把规划好的任务,调用工具,真正落地执行动作。

> 完整 Agent 运行链路:
接收问题 → **Memory 读取记忆****Planning 拆解任务****选择 Tools 工具****Action 执行** → 
把结果写回 Memory。

## 第三层:开发框架(黄色栏,开发 Agent 用的工具库)

这是程序员写 Agent 程序时用的 SDK,封装好了上面规划、记忆、工具、RAG 的逻辑,不用从零手写。

1.  **LangChain**:最流行,生态最全,Agent、RAG 首选。
1.  **LlamaIndex**:原本主打 RAG 知识库,现在也支持 Agent 开发。
1.  **Semantic Kernel**:微软出品,适合对接微软生态。

## 第四层:模型服务(底层基座)

Agent 框架只是 “脚手架”,真正思考推理靠大模型,分为**闭源、开源**

-   **闭源模型(商用 API 调用)** :GPT‑4,Claude3;推理强,直接调用接口,不能本地部署。
-   **开源模型(可以本地跑)** :Mistral、DeepSeek、Qwen 通义千问开源版、Gemma2、Phi‑3;
可以下载到自己电脑 / 服务器运行,数据不外流。

* * *

# 整体串联理解(完整链路)

> 用户需求 → Agent 类型(自主 Agent) 👉 
四大核心能力:记忆 → 规划拆解任务 → 挑选工具 → 执行 👉 
使用 LangChain/LlamaIndex 框架写代码实现这套逻辑 👉 
底层调用 GPT‑4/Qwen 等大模型做思考推理 👉 
中间还可以结合 RAG、Reflection 自我反思能力提升效果

### 和你上一张 Self‑RAG 图关联

`Self‑RAG`就是**Reflection(自我反思)** 的一种实现,
属于 Agent 技术栈里面的一个子技术,Agent 是更大的概念,RAG 只是 Agent 其中一个组件。

### 通俗类比

-   大模型:人的大脑;
-   LangChain 等框架:身体手脚,给大脑提供记忆本、任务清单、工具包;
-   Planning 规划:做计划;Memory 记忆:笔记本;Tools 工具:计算器、搜索引擎;Action 执行:动手干活;
-   Agent:一个完整会思考、记东西、做计划、用工具干活的智能助手。
> 

image.png

1.ReAct

image.png

image.png

2.RAG是什么

self-RAG属于 RAG 的高级变种,加上了自我校验循环

RAG = Retrieval‑Augmented Generation,检索增强生成 简单大白话:让大模型先去查外部资料,再结合查到的资料来回答问题,而不是只靠模型自己脑子里训练过的知识说话

3.Ollama

# Agent Hosting:Ollama
Ollama 开源项目提供了一套用于下载、运行和管理 LLMs 的工具和服务,是 Hosting 领域最受关注的项目之一。

4.多智能体协同

image.png

5.项目实战

多模态支持,丰富交互(Multi‑modal Support)

  • Dify 能力:支持连接能处理文本、图像、甚至语音的多模态大模型。
  • LangBot 能力:能够接收和发送 IM 平台上的文本、图片、语音片段、文件等消息类型。
  • 组合效果
    • 用户可以通过语音提问,Agent 以图文并茂的形式回答。
    • Agent 可以发送图片、文件(如产品手册)给用户。
    • 为未来更智能、更自然的交互体验打下坚实基础。

image.png