不用另开测试账号,也不打断你正在浏览的页面:BrowserSkill通过bsk CLI和浏览器扩展,让Codex、Claude Code等Agent在独立窗口里观察、点击、填表,还能录下你的操作供AI复现。
先说预测:浏览器会成为AI Agent最重要的“手”。过去AI能告诉你该点哪里,接下来它会直接完成搜索、筛选、填表、后台检查和重复性导出。真正决定工具能不能进入日常工作的,不只是会不会点击,而是能否复用真实登录态、隔离操作范围,并在验证码和确认环节把控制权还给人。
BrowserSkill正是沿着这条路线设计。它不是给网页加一个聊天框,而是用bsk CLI、本地daemon和浏览器扩展搭桥,让能调用Shell的Agent操作Chrome或Edge。目前官方明确列出Cursor、Claude Code、Codex、OpenClaw等工具;项目采用MIT许可证。

01 / BrowserSkill怎么工作?先理解这三个边界
BrowserSkill的链路可以概括为:Agent → bsk CLI → 本地daemon → 浏览器扩展 → Agent Window。daemon通过本机回环地址与扩展通信,AI不会绕过工具直接控制浏览器。
- 登录态复用:Agent Window位于真实浏览器环境,可以访问你已登录的网站,不必为每个任务重新建测试账号。
- 窗口隔离:自动化默认在独立、可见的Agent Window运行,不会随意刷新你正在使用的普通窗口。
- 标签页借用:如果必须操作用户已经打开的页面,需要显式借用指定标签页;session结束后会自动归还。
这种设计比“让AI接管整个桌面”更容易划清范围,但它并不等于绝对安全。扩展一旦能使用登录态,就应把它视为拥有当前网站权限的自动化操作者。
02 / 安装教程:CLI、扩展和Skill一个都别漏
第一步:安装bsk CLI。macOS或Linux可按官方脚本安装:
curl -fsSL https://raw.githubusercontent.com/Tencent/BrowserSkill/main/install.sh | sh
bsk --versionWindows PowerShell使用:
irm https://raw.githubusercontent.com/Tencent/BrowserSkill/main/install.ps1 | iex
bsk --version安全提醒:管道执行远程安装脚本前,应确认地址属于官方仓库;企业环境建议先下载、审查脚本再运行。
第二步:安装BrowserSkill浏览器扩展。
https://chromewebstore.google.com/detail/browserskill/hhcmgoofomhgciiibhipgmgkgnoenaoi

扩展与本地服务连接成功后,面板会出现绿色状态。若没有连接,先运行bsk status或bsk doctor检查CLI、daemon和浏览器实例。

第三步:把官方Skill安装到Agent工具。
bsk install-skill按空格选择Codex、Claude Code、Cursor等目标,再按Enter安装。完成后应新开一个Agent会话,让工具重新读取Skill。只会调用Shell的其他Agent,也可以按官方说明把skill/SKILL.md放入相应技能目录。
03 / 基础用法:AI必须先观察,再执行动作
原文强调的核心顺序非常重要:先启动session,再观察页面,执行动作后重新观察,目标完成立即停止session。不要依赖默认闲置超时替你收尾。
bsk session start
# 记下输出的四位 session id,例如 ABCD
bsk observe --session ABCD
bsk snapshot --session ABCD
# 再按页面返回的控件信息执行 click / fill / select
bsk observe --session ABCD
bsk session stop ABCDobserve返回面向Agent的语义页面信息,包括文字、按钮和输入框;snapshot提供更严格的无障碍树快照,适合页面复杂或需要核对控件结构时使用。页面布局变化后,AI仍可以根据可见名称和语义重新寻找目标,而不是死记坐标。
适合的第一个测试任务:
使用 BrowserSkill 打开 example.com,读取页面标题并总结内容;完成后停止 session。不要一上来就测试支付、删除数据或发布内容。先用无登录、可撤销的小任务确认连接、观察和停止流程都正常。
04 / 最有价值的功能:做一遍,录下来教AI
有些后台流程很难靠文字说清:进入菜单、切换状态、筛选日期、导出文件,中间任何一步遗漏都会失败。BrowserSkill的bsk record允许用户亲自完成一遍,并生成可供Agent理解的trace bundle。


可以先在扩展中进入操作录制,填写任务用途和起始网址;也可以直接运行命令:
bsk browsers
bsk record start --browser <浏览器实例ID>
--url https://example.com
--purpose "筛选本周数据并导出"
--redact-values
--output trace
命令启动后,在Agent Window里像平常一样完成网页操作,最后点击录制面板里的Finish。当前trace v3通常输出:
trace/
├── trace.json
└── states/
├── s0.txt
├── s1.txt
└── ...trace.json保存动作链及状态索引,states/保存关键步骤前后的页面观察结果。因此AI看到的不只是“点了某个按钮”,还知道点击前后页面发生了什么。较旧扩展可能退回trace v2,只生成动作文件而没有states/,遇到这种情况应先检查扩展版本。
05 / 录制不是录像:敏感信息仍可能进trace
--redact-values会把表单值标记为[filled]或[empty],但页面文字、按钮名称、订单信息和操作路径仍可能出现在状态文件中。不要在银行、单点登录、密码管理器或含有大量个人信息的页面录制,也不要把trace bundle随意上传到公开仓库。
- 验证码、登录、短信验证和支付确认,应暂停并交给人处理。
- 发布、删除、付款等不可逆动作,必须设置明确的人类确认点。
- 任务完成立刻执行
bsk session stop <id>,不要长时间保持控制。 - 只借用完成任务所需的标签页,用完立即归还。
尤其注意:“在本机运行”只说明通信路径,不代表每一步都自动可信。真正的安全来自最小任务范围、可见窗口、人工确认和及时停止。
06 / 哪些工作最值得录制?
重复执行的后台操作最适合:固定条件的数据导出、内容审核、订单查询、每周报表整理、网页回归检查等。判断标准不是“步骤多不多”,而是流程是否稳定、结果是否可验证、错误是否容易撤销。
对网站运营者,可以先录制一个只读任务,例如登录后台后筛选最近7天的草稿并导出列表。跑通后再逐渐加入编辑动作。对开发者,可以把稳定的测试路径录成trace,让Agent在页面改版后结合observe结果重新定位控件。
我们的看法:BrowserSkill最有价值的不是“AI替我点鼠标”,而是把人熟悉、却很难写成教程的网页流程变成可观察、可复用、可检查的任务材料。它让浏览器自动化更接近日常工作,但越接近真实账号,权限纪律就越重要。
官方地址与站内延伸阅读
BrowserSkill GitHub项目:
https://github.com/Tencent/BrowserSkill
官方中文说明:
https://github.com/Tencent/BrowserSkill/blob/main/README.zh-CN.md
官方Agent Skill:
https://github.com/Tencent/BrowserSkill/blob/main/skill/SKILL.md
Chrome扩展商店:
https://chromewebstore.google.com/detail/browserskill/hhcmgoofomhgciiibhipgmgkgnoenaoi
登录态安全:Hermes复制Chrome Profile有哪些风险:
https://www.zuoshipin.com/article/27748
Agent工具生态:DeepSeek Harness浏览器与多智能体插件:
https://www.zuoshipin.com/article/23004












