一句话推荐:Browser Use 是当下 GitHub 上最被低估的「浏览器代理」开源项目之一,把 AI Agent 直接接到 Chrome 上 open/click/type/fill——你写一句话,浏览器自己完成表单、数据抓取和 QA 抓 bug 这一整条链路。

网站定位:这是一个 MIT 开源框架 + 云端 Browser 的双轨产品。开源版本是 Python 库(pip 包名 browser-use),Cloud 版本提供 steerable remote Chrome + 反爬指纹 + 多工具路由。项目硬指标:在 Odysseys 200 个长任务基准上以 87.4% 平均分排在 Anthropic、OpenAI、Google、Microsoft 的 computer-use 代理前。
为什么值得推荐
- 从「能不能点」到「能不能跑长任务」。同项目把短动作、长任务、轨迹监控拆开评估,README 公开了 browser-use/benchmark,明确告诉读者自家模型在 100 个真实网页任务上的胜率分布,不发黑盒数字。
- LLM 接入不绑定。
ChatBrowserUse()支持openai/gpt-5.5、anthropic/claude-opus-4-8、google/gemini-3-pro一行切换;同时推荐它自家的bu-2-0模型,平均领先其他主流模型 3-5 倍完成速度。 - MCP 与 CLI 一起装。README 介绍了一段
browser-use skill install安装脚本,能把它直接挂到 Claude Code、Codex、Cursor、Hermes、OpenClaw 这些已经装了 MCP 的 IDE/CLI。
核心功能
- 表单填写:上传简历填求职申请表、办报销、批量注册账号;
- 结构化数据抓取:把任意网页解析成
CSV,适合做监控和数据更新; - 本地 QA 巡检:让模型打开你的本地 dev 站,输出 visual/usability 的问题清单;
- Custom Tools:通过
@tools.action注入自建动作,把现有 API 包成浏览器的下一步; - 1000+ integrations:Gmail、Slack、Notion 等常见 SaaS 可直接调用。
体验评测
我自己用 Python 库 + 一个 30B 预览模型跑过几个示例:
- 起步成本低:
uv add browser-use+ 一个BROWSER_USE_API_KEY就能跑通 hello world,10 行代码起; - 沙盒透能力真实存在:对受控站的「点同意 → 跳转 → 填表」这种连续动作稳定性比同价位的一些 RPA 工具更高;
- 思考过长比较明显:默认 LLM 在跨页面跳转时会反复自检,单任务 token 消耗不低;适合用项目自家的
bu-*模型切一刀; - 生产阻力:本地跑容易踩 Chrome 内存/CPU;并发上来后推荐直接用官方 Cloud,反爬、proxy rotation、captcha 解决都被接管。
适合人群
- AI 工程师 / 工具链作者:想给 Claude Code / Codex / Cursor / Hermes / OpenClaw 加「自动办网页」能力的;
- 数据 / 运营 / 竞品分析师:需要把网页结构化进 CSV、监控价格、做 QA 巡检;
- 想自建 computer-use 产品的 PM:不想从 0 写浏览器代理的;
- 不推荐:对浏览器有强反爬的社交媒体、对实时性有亚秒级要求的场景、对低成本 batch 有刚需但不愿付费的。
使用建议
- 先在 README 用一段「安装 skill」的提示词一次性装好,开箱即用;
- 写项目代码时优先用
ChatBrowserUse+ project 专用bu-2-0模型,速度和准确率都最稳; - 「需要 stealth / captcha」的生产场景直接选 Cloud,不要纠结本地;
- 认证/持久登录可以用
real_browser.py复用本地 Chrome profile,搭配profile.sh同步到 remote browser。
综合评价
Browser Use 不是「又一个开源 RPA」——它把浏览器代理做到了跟当前一线闭源 computer-use 同台竞争的水平,把选 LLM 的自由度还给了开发者,又把生产稳定性的脏活藏在 Cloud 后面。如果你正在给 AI 编程助手加「自己去操作浏览器」的能力,或者想自动化批量的运营/数据/QA 任务,它就是当前最值得收藏的开源入口;反过来,如果你只是想偶尔手动跑一次简单网页操作,Browser Use 可能稍重,可以先看作者自家的 browser-use skill install + IDE 里的提示词样板再决定。
