自我介绍
猿友们好,我是一名从业5年base广的.NET开发人员——小熊。在25年底,我开始接触到了VibeCoding,在此之前25年初我都尝试用免费的Qwen网页版复制我的代码让AI帮我改写再贴回去,效果也还行,但我并不满足于此。
我会觉得这AI好像能帮我大概率上的写好一段代码,但此刻对随之而起AI摧毁就业市场的营销文嗤之以鼻,我觉得这也能替代程序员?会不会喝太多,吹太高了?因为就目前来说用来工作完全是天方夜谭。
和Trae、Qoder结缘,解放双手之路的开始
后面是开始尝试用一些trae、qoder,虽然比网页版本的对话AI好用多了,但也时常面临着把我代码改的一团糟,最后无奈通过git还原一天白干的窘境。后续通过各渠道了解这个玩意还是看模型,为了能体验国外模型,我又用魔法下个国际版本trae和qoder,虽能全自动干活不用我来回复制粘贴了但都体验一般且没几回合我的额度就没了。
甜头尝到了又想着更好的工具和模型
那会儿10月还是11月的样子流行着cursor搭配着opus模型,我薅着首次羊毛用优惠的美金买了入门的阶梯,没几个问题就给我聊爆了,但是效果出奇的好,那会儿我才觉得好像ai真的要替代程序员了,但是太贵了,我拿着RMB的收入养着吃dollar干活的工具,那我可吃不消。
开始体验到真正的VibeCoding
随后我又了解到了更为有口皆碑的Cluade code,但高额的订阅费和时不时封号的政策让我望而却步,更何况我还得找各自渠道弄个虚拟电话卡和买个虚拟信用卡来注册这个成本用的我现有工作的项目上感觉有点杀鸡用牛刀。
我是通过trea、qoder里面内置的模型才开始了解到各个模型是啥和差异。真是天公作美,刚好GLM4.6那会儿刚推出的TokenPlan首购优惠套餐我花1000块买下Pro年费订阅(踩狗屎运了后面狂涨和限卖疯抢),我想着这种订阅费都那么贵了,我咬咬牙买来试试水也不是不行,虽然怕效果还是像刚出来的trea、qoder一样狗屎那岂不是打水漂了?
(感谢雷总的厚爱直接领了max)
我又开始各种看看,发现claude code能绕过接入其他模型!天呐,命运太眷顾我了,我体验到了真正的VibeCoding,后面就尝试skill的运用和编写claude.md来尝试提高稳定性以及前端去除ai味,然后一直用到今天。
发文章的契机
最近招聘市场上涌现一批AI Agent岗位,且里面不乏高薪岗,有19年左右互联网热潮那意味在,与此同时又恰好深入接触了vibecoding以及背后其原理。
因为好奇原理,我是从顶层了解下去的,agent的背后是什么?llms、提示词、上下文工程再到transfomer架构,最后大概了解了Transformer 本质上是根据前面的上下文,预测下一个 token 的概率分布,然后选出概率最大的那个 token(或按概率采样)。所以为什么会有海量数据来训练模型。
所以想发此文一步步记录我从哪里学起,学到了哪里,以及学习笔记,再配合VibeCoding工具(cluade code+glm5.1/mimo 2.5 pro)一同搭建一个工程化的AI Agent应用。
AI Agent应用
目前我对于AI Agent的理解是跟搭建一个.net软件差不多,只不过技术栈不同,同样是利用工程和业务逻辑限制在一个范围内,只不过ai agent灵活的多且能理解意图并自动化去干活。
现在的AI Agent市场我发现的还算是晚了,招聘要求没年初刚爆发只是调用模型api问答就算是个agent那么简单了。 经过看各类招聘岗,要求的能是工程化落地得各种调优和并发控制(已经颇具大厂级软件那味了。。。)。
我知道的技术栈较为简单易学的有coze、dify、n8n,进阶的
1、框架和工具类
langchain 底层依赖,封装 LLM 调用、@tool、Prompt,类似于传统的开发的asp.net mvc
langGraph 项目骨架,定义消息处理链路和 Agent 编排,类似于传统的开发的asp.net mvc的Middleware 管道 + State 管理
RAG(Retrieval-Augmented Generation)检索增强生成,简单说就是给大模型接一个"外挂知识库"。大模型本身只知道训练数据里的东西,你公司的业务文档、产品手册、历史工单它统统没见过。RAG 的做法是先把你的文档切片、转成向量(一串数字)存到向量数据库里,用户提问时先去向量库里搜出最相关的几段内容,塞进 Prompt 一起发给大模型,这样模型就能"查资料回答"而不是凭记忆瞎编。类似于传统开发里你先查数据库拿到数据,再渲染到页面上,只不过这里"数据库"换成了向量库(Milvus、Qdrant、Chroma 等),"查询"换成了语义相似度检索。
Embedding 模型 文本转向量的工具,RAG 的前置依赖。你把一段文字丢进去,它返回一个几百到上千维的数字数组(向量),语义相近的文本转换出来的向量距离也近。常用的有 OpenAI 的 text-embedding-3、智谱的 embedding-3、开源的 BGE 系列等。类似于传统开发里你定义数据模型(Model),把业务对象转成数据库能存储的结构。
Function Calling / Tool Use 大模型调用外部能力的标准协议。你告诉模型"你有这些工具可以用",模型根据用户意图决定调哪个工具、传什么参数,拿到结果后再组织回复。类似于传统开发里的依赖注入(DI)+ 接口调用——模型不直接执行,而是生成一个调用意图,由框架帮你执行真正的函数。这个能力是 Agent 能"干活"而不是"只聊天"的核心。
Prompt Engineering 提示词工程,说白了就是怎么跟大模型说话才能让它干好活。包括 System Prompt(系统指令,相当于给模型一份"岗位说明书")、Few-shot(给几个示例让模型照葫芦画瓢)、Chain-of-Thought(让模型一步步推理而不是直接给答案)等技巧。类似于传统开发里你写业务规则和校验逻辑,只不过这里是用自然语言写的。写得好不好直接影响 Agent 的输出质量,是调优的核心战场。
上下文工程(Context Engineering) 比 Prompt Engineering 更上一层的概念。不只是写好一句提示词,而是管理整个对话过程中模型能看到的所有信息——系统指令、历史消息、工具返回结果、RAG 检索到的文档片段等。模型的上下文窗口有大小限制(比如 128K token),塞太多会溢出、太少了模型又记不住前面说了啥。所以需要做摘要、压缩、滑动窗口等策略来管理上下文,类似于传统开发里的缓存策略和内存管理。
2、低代码/可视化编排平台
Coze(扣子) 字节出的,拖拖拽拽就能搭个 Agent,支持插件市场、知识库、工作流编排。门槛低适合快速验证想法,但灵活性和定制化有上限。类似于传统开发里用低代码平台搭个管理系统——能跑,但扩展性受限。
Dify 开源的 LLM 应用开发平台,支持可视化编排工作流、RAG、Agent 模式。比 Coze 更开放,可以私有化部署,对接自己的模型和数据。类似于传统开发里选了个开源的 admin 框架自己搭,灵活度比低代码高不少。
n8n 开源的自动化工作流工具,主打"连接一切"。可以对接几百种外部服务(数据库、API、消息队列等),配合 LLM 节点实现复杂的多步骤自动化。类似于传统开发里的 ETL 调度工具或者 Windows Workflow Foundation,只不过节点更丰富、接入 LLM 更方便。
3、大模型 API 与服务平台
OpenAI API 行业标杆,ChatGPT 背后的 API 服务。GPT等模型通过 API 调用,支持 Function Calling、结构化输出(JSON Mode)、多模态(图片、音频)等。生态最成熟,文档最齐全,但价格相对较高且国内访问不太方便。
智谱 GLM 国产大模型代表之一,API 兼容 OpenAI 格式,迁移成本低。价格亲民,国内访问稳定,支持 Function Calling。我目前主要用的就是 GLM 系列搭配 Claude Code 来做 VibeCoding。
Anthropic Claude 以安全性和长文本理解著称,Claude 系列模型在代码生成和复杂推理上表现很强。Claude Code 就是官方出的终端编码工具,也是我目前的主力开发工具。
阿里通义千问(Qwen) 阿里出的大模型,开源版本(Qwen 系列)在国内社区活跃度很高,很多国产 Agent 框架默认对接的就是它。API 价格也比较友好。
本地部署模型(Ollama + 开源模型) 如果不想付 API 费用或者有数据隐私要求,可以用 Ollama 在本地跑开源模型(Llama、Qwen、DeepSeek 等)。类似于传统开发里你不想用云数据库就在本地起个 MySQL,好处是免费、数据不出本机,坏处是吃显卡、效果比商业模型差一截。
4、向量数据库
Milvus 开源向量数据库里的扛把子,支持海量向量的高性能检索,适合生产环境。类似于传统开发里的 MySQL/PostgreSQL——功能全、社区大、坑少。
Chroma 轻量级向量库,Python 生态里用得多,适合小项目和快速原型验证。类似于传统开发里的 SQLite——够用就行,别指望它扛高并发。
Qdrant 用 Rust 写的向量数据库,性能好,API 友好,支持过滤检索。算是后起之秀,社区增长很快。类似于传统开发里的 PostgreSQL——功能和性能都不错的平衡选择。
5、其他常用工具和概念
LangSmith / LangFuse Agent 的可观测性工具,能追踪每次调用的 Prompt、模型返回、工具调用链路和耗时。Agent 出了问题你能回溯看到每一步发生了什么,类似于传统开发里的日志系统(ELK)+ APM 链路追踪(SkyWalking、Jaeger)。没有这个,Agent 调优基本靠猜。
Guardrails / 输出校验 对模型输出做结构化校验和安全过滤。比如要求模型必须返回 JSON 格式、字段不能缺失、不能包含敏感内容等。类似于传统开发里的 Model Validation 和中间件过滤器——在数据到达业务逻辑之前先过一道校验。
流式输出(Streaming) 大模型生成回复是逐 token 输出的,流式传输可以让用户边生成边看到内容,而不是等全部生成完再一次性展示。类似于传统开发里的 SSE(Server-Sent Events)或者 WebSocket 推送,提升用户体验的关键技术。
以上技术框架我会挑选一部分来作为我的agent项目技术栈,完成后也将会进行开源。