agent-browser 是 Vercel Labs 出品的 AI Agent 浏览器自动化 CLI,原生 Rust 实现比 Node/Puppeteer 方案更快更稳,支持快照、点击、表单、可访问性树、PDF 等全套浏览器能力。适合做 Web Agent、端到端测试、网页数据抓取的工程团队。
agent-browser(vercel-labs/agent-browser)是 Vercel Labs 出品的浏览器自动化 CLI,专门给 AI Agent 用。它的核心卖点是"快 + 稳 + 对 Agent 友好"——用原生 Rust 实现,比常见的 Node + Puppeteer 方案更快、内存占用更小、可执行文件更轻;提供快照(accessibility snapshot)、点击、表单填写、可访问性树查询、PDF 导出等一整套浏览器能力,同时暴露成结构化输出,便于编程 Agent 解析决策。它走 Chrome for Testing 通道下载 Chromium,绑定固定版本避免兼容性问题;通过 npm 全局装、Homebrew、Cargo、源码均可。
Playwright 是 Node/TS 通用测试库,Puppeteer 是 Chrome 协议的最早 Node 封装——它们都是给人用的:API 偏命令式、错误信息偏开发者。agent-browser 是给 AI Agent 用的:默认输出"Agent 可读"的结构化 snapshot(元素 + 角色 + 可访问性属性),按角色定位(button/textbox/link)而非 CSS selector,断言失败时给出"下一步该往哪走"的建议而不是栈追踪。它不替代 Playwright 写单元测试,而是把"AI 替我操作网页"这件事的最后一公里做稳。
三个最常见:(1) Web Agent 在电商、政务、CRM 等页面自动下单、查物流、提报——需要稳定、能跨 Chromium 版本的浏览器层;(2) 端到端测试脚本需要"AI 友好"的失败信息——CI 看到截图 + snapshot 就能诊断;(3) 网页数据抓取要快、要可控、要能挂代理——Rust 实现 + 命令行参数化都比 Node 进程轻。Vercel 把它当作"自己平台 Agent 测试 + 演示 + 部署前自检"的内部工具开源。
两步:(1) `npm install -g agent-browser` + `agent-browser install`(首次下载固定版本 Chromium,几百 MB);(2) 在你的 Agent 项目里用 `agent-browser` 命令直接调,按角色定位元素(role=button[name="Submit"]),返回结构化 snapshot。例如让它"打开 example.com 并抓取所有链接":一句命令行 + JSON 输出。
(a) 写 Web Agent 的工程师——想要一个比 Playwright 更"Agent-native"的浏览器层;(b) CI/端到端测试想升级到 AI-friendly 错误信息的团队;(c) 经常抓网页数据、需要 Rust 性能/可控性的开发者。MIT/Apache 双协议兼容,免费;Skills CLI 生态(skills.sh)原生支持。
> **michael 用户告知**: 本 Skill 在 AIMS 平台使用平台已支持的真实大模型(与原 README 推荐对照)
| 项 | 说明 |
|---|---|
| **原仓库 README 推荐** | Claude Code / Codex (浏览器) |
| **AIMS 平台实际使用** | **`gpt-4.1`** |
| **AIMS 平台可用替代** | claude-sonnet-4.6 / gpt-5.1-codex |
| **对齐度** | 高度一致 (Claude / GPT 都行) |
> 💡 **如何切换模型**: 使用 AIMS `aims.update_skill` 传 `skill_id + model_name + call_price_fen` 即可在上述任意支持的模型间切换(短 id 直接传,无需前缀)。
Playwright 是 Node/TS 通用测试库,Puppeteer 是 Chrome 协议的最早 Node 封装——它们都是给人用的:API 偏命令式、错误信息偏开发者。agent-browser 是给 AI Agent 用的:默认输出"Agent 可读"的结构化 snapshot(元素 + 角色 + 可访问性属性),按角色定位(button/textbox/link)而非 CSS selector,断言失败时给出"下一步该往哪走"的建议而不是栈追踪。它不替代 Playwright 写单元测试,而是把"AI 替我操作网页"这件事的最后一公里做稳。
三个最常见:(1) Web Agent 在电商、政务、CRM 等页面自动下单、查物流、提报——需要稳定、能跨 Chromium 版本的浏览器层;(2) 端到端测试脚本需要"AI 友好"的失败信息——CI 看到截图 + snapshot 就能诊断;(3) 网页数据抓取要快、要可控、要能挂代理——Rust 实现 + 命令行参数化都比 Node 进程轻。Vercel 把它当作"自己平台 Agent 测试 + 演示 + 部署前自检"的内部工具开源。
两步:(1) `npm install -g agent-browser` + `agent-browser install`(首次下载固定版本 Chromium,几百 MB);(2) 在你的 Agent 项目里用 `agent-browser` 命令直接调,按角色定位元素(role=button[name="Submit"]),返回结构化 snapshot。例如让它"打开 example.com 并抓取所有链接":一句命令行 + JSON 输出。
(a) 写 Web Agent 的工程师——想要一个比 Playwright 更"Agent-native"的浏览器层;(b) CI/端到端测试想升级到 AI-friendly 错误信息的团队;(c) 经常抓网页数据、需要 Rust 性能/可控性的开发者。MIT/Apache 双协议兼容,免费;Skills CLI 生态(skills.sh)原生支持。