腾讯开源了一个项目,让 AI 直接用你已经登录好的浏览器

0 阅读13分钟

导语,本文你能学到什么

2026 年 9 月,腾讯 PCG 开源了一个叫 BrowserSkill 的项目。它解决的是一个很具体的问题,让 AI 助手直接复用你电脑上 Chrome 或 Edge 里已经登录好的状态去操作网页。

本文面向需要在自动化工作流里接入“已登录浏览器”的开发者和效率玩家,你会看到下面这些内容。

  • 传统网页自动化为什么卡在“身份”而不是“打开网页”
  • BrowserSkill 选的第三条路,以及它的本地架构链路
  • 四步安装与四条验收标准,含代码块命令
  • 三套可直接复制的提示词模板
  • 两个开关、三个坑、一条边界,以及作者的真实踩坑经历

读完你能独立把“AI 替你操作已登录后台”这件事跑通,并且知道哪些场景不该用它。

从一个真实的登录之痛说起

作者有一条多平台内容分发流水线,最常输的地方不是稿子,是登录。前几天早上 9 点 40,他照例跑那条自动分发流水线,脚本一条条往下走,走到推送环节,全绿变全红,原因就一行字,浏览器扩展没连上。他盯着那个报错看了十几秒,心里不是着急,是一种熟悉到发麻的无力感。

好家伙,一条链路上特别长的一截,偏偏是特别没技术含量的一截。稿子写完了,图也配好了,排版也过了,最后卡在一个登录态上。

说真的,这不是他一个人的问题。只要你让 AI 干过需要登录的网页,你都遇到过。

作者这两年在残联系统跑了六站 AI 培训,温州、福鼎、杭州、龙泉、磐安、青田,台下坐的多是自己开店、做小生意的朋友。讲 AI 能写、能画、能剪视频,大家点点头。可讲到“让它替你操作那些平台”,就得在这儿刹一脚,因为 AI 得先能进你的账号。现在这句话可以改口了。

传统方案卡在哪儿,身份才是门槛

AI 做网页自动化这件事,业界做了很多年,方案无非两条路。

一条路是给 AI 造一个干净的浏览器,比如无头浏览器那套。干干净净,一尘不染,问题是它谁也不认识。你的后台它进不去,你的账号它没有,你去给它配测试号,密码写进脚本里,还得天天维护。

另一条路更粗暴,直接接管你正在用的浏览器窗口。AI 一动,你就停工。

所以这些年,AI 去操作网页这件事,卡点从来不是“打开网页”,是“我是谁”。打开网页,机器两秒钟就干了。可它不知道你是谁,它就没有权限看任何有价值的东西。

真相是,网页自动化真正的门槛,不是浏览器技术,是身份。

三条路线对比

BrowserSkill 选的第三条路,是借用。下面这张表把三条路线放在一起看。

路线做法优点缺点
无头浏览器给 AI 造一个干净浏览器,配测试账号环境干净可控谁也不认识,进不了你的后台,密码要写进脚本并天天维护
接管浏览器直接接管你正在用的浏览器窗口直接用真实状态AI 一动你就停工,体验冲突
借用登录态(BrowserSkill)在已开浏览器里另开独立 Agent Window,复用登录态不用测试号、不用交密码,标签页先借后还需要本机装命令行工具和扩展,对完全不碰电脑设置的人有一点学习坡度

借用这条路的核心做法是,它在你已经打开的浏览器里,另外开一个独立的、你能看见的窗口,叫 Agent Window。这个窗口直接用你浏览器里已有的登录状态,Cookie、登录信息,全都是你日常用的那一套,不用测试账号,不用把密码交给谁。

你原来那些标签页,该怎么用怎么用,不受影响。AI 要动你已经开着的某个标签页怎么办,得先跟你借,用完还回来,默认还要弹窗问你一句同不同意。

撞上验证码、二次验证、确认弹窗这些只有人能处理的事,AI 会停下来,请你接手,你处理完,它接着往下跑。

架构链路,全程不出本机

这个设计里特别聪明的一笔,不是复用登录态,是那句“借用”。它把“AI 和你的账号”这件事,从黑箱变成了一个有借有还的契约。

整条链路的走向是这样的,AI 发出命令,命令走到你电脑上的一个本地小程序(daemon),小程序通过本机的一个通道通知浏览器扩展,扩展才在 Agent Window 里动手。

全程不出你这台电脑,没有第三方服务器看得到你的登录信息。

适配范围,谁能用

官方给的适配清单里,有九款 AI,Cursor、Claude Code、Codex、CodeBuddy、WorkBuddy 这些都在里面。把仓库里那句安装说明丢给你的 AI,它自己就把活干了。

作者看到官方定位的时候,有点不同意。他们把这个项目介绍成“给开发者的浏览器自动化能力”,作者觉得说小了。真正被登录态困住的,不是程序员,是每天要登五个后台的普通人和小老板。

你想啊,一个人管着公众号、知乎、百家号、短视频后台、公司内部系统,每天第一件事就是挨个登录一遍,Cookie 过期了再登一遍。这些活没有一分钱价值,但它吃掉的是你一天里状态特别好的那段时间。

作者认识一个 50 岁的制造业老板,没有任何编程背景,自己用 AI 做出了订单追踪系统。第一版只有三个功能,录入订单、查看状态、到期提醒。他后来说了一句话,原来是我把它想难了。

这句话作者记了很久。因为大部分时候拦住我们的,真不是技术,是我们以为它很难。

四步安装与验收

下面带你把三件事跑通,读完你自己也能复现。第一,让 AI 打开一个你已经登录好的网页,把页面内容读出来、总结给你。第二,让 AI 进入你已经登录的某个后台,把信息整理成一张表或者一份草稿。第三,遇到验证码这类只有人能做的事,AI 停下来,你处理完它接着干。

先看清楚要装的是三件东西

这个项目不是一个软件,它是三件东西配合工作。一件是给 AI 看操作规则的技能文件。一件是安装在电脑上、负责执行命令的命令行工具,命令叫 bsk。一件是装在浏览器里、负责连上浏览器的扩展。

三件少一件都跑不起来,只复制一份技能文件是没有用的。支持的电脑系统是 Windows 64 位、macOS 和 Linux,浏览器目前只认 Chrome 和 Edge,火狐官方说在计划里,还没有。

把命令行工具装上

Windows 用户打开 PowerShell,把下面这一行原样贴进去,回车。

irm https://raw.githubusercontent.com/Tencent/BrowserSkill/main/install.ps1 | iex

macOS 和 Linux 用户,换成这一行。

curl -fsSL https://raw.githubusercontent.com/Tencent/BrowserSkill/main/install.sh | sh

装完先验证,敲这一行,能看到版本号就说明装上了。

bsk --version

这里有个坑要提前说。安装脚本改不了你当前这个终端窗口里的路径设置,所以可能出现命令找不到的情况。这时候新开一个终端窗口再试,或者按安装提示把路径加进去。

还有一个更容易被忽略的坑,装完之后,正在运行的那个 AI 会话要重启一下,不然它读不到新装的东西。作者第一次就是因为没重启,对着屏幕愣了半分钟。

手动把浏览器扩展装上

这一步必须你亲手做,AI 替不了你。打开 Chrome 应用商店或者 Edge 加载项商店,搜 BrowserSkill,点添加,按浏览器提示确认。

如果公司网络打不开商店,可以去项目的 Releases 页面下载扩展压缩包,在浏览器里打开开发者模式,选“加载已解压的扩展程序”。

装好之后,点一下浏览器工具栏上的扩展图标,弹窗里连接状态变绿,才算就位。

把技能装给你的 AI

回到终端,敲这一行。

bsk install-skill

它会自动扫描你电脑上装过的 AI,把检测到的列出来,用空格键勾选,回车确认。

想看看支持哪些、装到哪个目录,可以先跑这一行。

bsk install-skill --list

想跳过交互直接指定,比如给 Cursor 装,可以这样写。

bsk install-skill --harness cursor --json

装完重启你的 AI 会话,这一步和上面那条是同一个道理,不重启它不认。

最后做一次体检

bsk doctor

别被红色吓到。扩展还没连上的时候,有一项显示 FAIL 是正常的,那不是装坏了。按提示把扩展装好、状态变绿之后,再跑一遍,全部变成 ok,才算真正打通。

作者自己定的验收标准是四条,你可以照着对。

第一,bsk --version 能打出版本号。 第二,扩展弹窗的连接状态是绿色。 第三,bsk doctor 没有 FAIL。 第四,新开一个 AI 会话,能成功打开一个网页并把内容总结出来。

四条全过,这块地基就算打好了。

怎么跟 AI 说话,这比装更重要

工具装好只是开始,能不能用好,全看你怎么交代任务。作者试下来,一句好提示词的模板是这样的,打开哪里,做什么,输出什么,怎么算完成。

第一次跑,先拿一个公开页面练手,别一上来就进后台。

使用 browser-skill 打开 https://example.com ,读取页面标题和正文,用 3 个中文要点总结。
只读,不登录、不填表、不提交,完成后结束会话。

能看到一个独立的窗口自动弹出来,访问页面,把总结返回给你,然后自己关掉,端到端就通了。

练熟了,换成这三个常用的模板。

模板一,读长文,整理资料。

用 browser-skill 打开【文章链接】,通读全文,按需滚动展开。
提取标题、作者、发布日期、核心论点、关键数据、原文链接。
事实和观点分开,无法核实的标上待核实。只读并截图,不登录不评论,完成后关闭会话。

模板二,多页对比。

用 browser-skill 依次打开这 3 个公开页面,把链接写在这里。
汇总成一张清单,包含页面标题、发布日期、核心结论、数据口径、原文链接。
页面之间有矛盾的,分列陈述,不要强行统一。只读,不下载、不登录。

模板三,进自己的后台,只填草稿,不许提交。

用 browser-skill 打开我已登录的后台,名字写在这里,把下面内容填进新建草稿。
允许创建和编辑草稿,禁止点击发布、提交、发送、确认按钮。
填完截图暂停,等我人工检查。
碰到登录、验证码、权限或支付环节,立即停止。

模板三的精髓就是那句禁止提交,把最后一下按按钮的权利,稳稳留在自己手上。

作者跑通的三件事

第一件,作者让 AI 去登录好的几个内容平台抄当天热榜,标题加链接一起回来,整理成一份选题参考。原来自己一个平台一个平台翻,现在一句话。

第二件,让 AI 看某篇文章下面的评论,把带真实需求的留言挑出来,做成一张客户线索表。这件事以前都是靠碎片时间翻,翻一半就断了。

第三件,让 AI 去后台起草,稿子填进去,截图给作者看,然后停住。最后那一下发布,自己点。

三件事跑完,作者感受不是快,是终于不用每天先登录一遍五个后台。作者之前把月度计划的整理工作交给 AI,原来要花一整天,现在一个小时收工。同样的思路,登录这一步,也该交出去了。

两个开关,三个坑,一条边界

两个开关,扩展弹窗里默认都是打开的,建议先别关。一个是借用标签页前确认,关掉它就免确认直接借你的标签页。一个是可以请求人工协助,关掉之后它碰到验证码只能自己想办法。

作者理解的日常用法档位,就是 AI 干活、你把关这个更舒服。真要无人值守跑批处理,再考虑关。

三个坑,都是作者自己碰过或者看到别人碰过的。

版本要对齐。命令行的版本和扩展的版本要一起升级,不然长截图这种功能会莫名失灵。

企业网络可能拦截本地通信。扩展检测不到,先找 IT 加个白名单。

它不适合大规模并行抓取。它的设计是借用,不是抢,别拿它当爬虫用。

一条边界,单独拎出来说。登录态就是权限。AI 借走的每个标签页,带的都是你账号的完整身份。支付、转账、删除这三类操作,永远留给人。敏感页面用完,手动关掉更稳妥。

讲到这里,作者跟读者说句实话。这东西现在还不够成熟,是一个刚迭代三个月的开源项目,命令行的版本和扩展的版本经常要一起升级,对完全不碰电脑设置的人来说还是有一点学习的坡度。它不是那种打开就能用的消费级软件。

总结,关键要点

  • BrowserSkill 是腾讯 PCG 在 2026 年 9 月开源的项目,MIT 协议,TypeScript 编写,六千多颗星,迭代很密
  • 它走的是“借用登录态”第三条路,与传统无头浏览器、接管浏览器形成对比
  • 架构是本地闭环,AI 命令经本机 daemon、本机通道、浏览器扩展到 Agent Window,全程不出本机
  • 适配九款 AI,Cursor、Claude Code、Codex、CodeBuddy、WorkBuddy 都在列
  • 安装分三步组件加体检,验收看四条标准
  • 提示词分读长文、多页对比、后台填草稿三套模板,后台模板核心是禁止提交
  • 两个开关默认开,三个坑在版本对齐、企业网络、并行抓取,边界是登录态就是权限
  • 真正被登录态困住的是每天登五个后台的普通人,不是程序员

它真正的价值,不在于多厉害,在于它把那堵名叫登录的墙,从你面前挪开了。你每天状态特别好的那几个小时,本来就不该花在输账号密码上。AI 负责重复劳动,人负责那临门一脚。

你要是也想试,建议就从最简单的那个模板开始,拿一个公开页面跑通,再动后台。跑通之后回来跟作者说一声,你会说那句话,原来是我把它想难了。