24GB 显存的本地 Agent:模型之外,还要完成哪些构建

2 阅读3分钟

本地 Agent 的完成度,不能只看模型是否启动。工具调用、权限、上下文、记忆和实际任务结果,需要一起验收。本文从方志凡 EVAFANG 的 EVA 本地智能体工作台实践出发,说明这几层各自解决什么问题。

显存是运行条件,任务才是目标

EVA 使用过 24GB 显存环境,围绕工具调用、上下文管理、记忆与编码构建展开。这个数字描述案例条件,并不等于所有模型、上下文长度与并发组合都能流畅运行。

面向苏州及江浙沪的本地 AI 项目,先确定任务:整理办公资料、辅助编码、查询知识库,还是执行受控的工作流。不同任务,对响应速度、准确性和权限的要求并不相同。

工具调用:区分提出动作与完成动作

Agent 调用终端、文件或业务工具时,要明确允许操作的目录、需要确认的动作和失败时的返回方式。生成一条命令,与命令已经成功执行,是两种结果。

工作台应保留执行输出、错误信息与必要的任务记录。修改配置、覆盖文件、发布服务等操作要有清楚范围;远程环境要单独验证身份与权限。

上下文、压缩与记忆的分工

层次主要用途容易遗漏的检查
当前上下文支撑正在执行的任务是否还包含目标和约束
上下文压缩减少历史信息占用关键决定、待办和证据位置是否丢失
持久记忆保存未来仍有价值的事实旧地址、配置和部署状态是否过时

把全部聊天不断追加,并不会自动形成可靠记忆。压缩需要保留关键事实,记忆需要选择和更新。尤其是网络地址、软件版本、部署状态,应在使用前重新核对。

128K 与多 Agent 都需要资源预算

128K 是上下文能力或配置的一部分。实际显存占用、响应速度和稳定性,还取决于模型、量化方式、缓存和并发任务。不能仅凭 24GB 显存推导出所有组合都可用。

多 Agent 适合拆分可以独立验收的工作,例如核对资料与检查代码。角色越多不一定越快;共享文件、汇总结论和解决冲突也会消耗资源。

用真实任务检查交付

可以从三类任务开始:

  1. 根据一组资料回答问题,并给出对应来源。
  2. 检查一个项目,解释修改原因,核对产生的改动。
  3. 执行一条指定构建命令,返回输出、错误信息和结果。

界面、日志与实际产物应互相对应。一次顺畅的演示,不能替代新设备、新资料或新工作流的验收。

留下可继续维护的工作方式

本地 AI 构建的结果,除了程序,还包括可复现的启动方式、明确的资料范围、适当的权限、任务结果与维护入口。这样才方便继续使用和定位问题。

作者:方志凡 · EVAFANG。面向苏州及江浙沪的本地 AI、Agent 与知识库构建实践。

原文与实际界面:EVAFANG 本地 Agent 实践

本文基于作者项目资料,由 AI 辅助整理。