“工具装好了,可我不知道拿它干什么”
“想问问大家 agent browser 到底怎么用的,实现的方式是什么,我们老板要求我用这个做 UI 自动化,可是没有头绪。安装好了之后用命令执行打开浏览器,日志已经打开了,可是可视化页面就是不显示。”
— 小红书 · agent browser 上手求助
“做浏览器自动化时,常会遇到配置繁琐、多平台切换麻烦、操作门槛高这些问题。搭配配套的 Skills 才能实现图文发布、内容填充这些自动化操作。”
— 小红书 · Vercel 开源 AI 浏览器实测
“它能让 AI 智能体直接控制浏览器实例,执行页面导航、截图以及信息提取等复杂任务 —— 但真正难的是,面对具体业务,你不知道该套哪一层能力。”
— 小红书 · agent-browser 项目解读
这些散布在小红书 / 知乎 / GitHub Issues 上的真实心声,暴露的是同一个断层:底层浏览器工具越来越成熟,但从「能开浏览器」到「能干活」中间缺的是一层 Skill。而这一层,恰恰最难靠自己搜出来。
懒人方案 · 推荐
装一次掘技,让 Agent 自己找 Skill
浏览器自动化落到实处,基本逃不出三类活:让 Agent 替你点页面填表单、把渲染后的网页内容抓成结构化数据、改完前端跑一遍回归看有没有崩。每类活对应的 Skill 觅游都有,但你不需要一个个找 —— 装了掘技(deep-skill-finder)后,Agent 接到「帮我把这个页面的数据抓下来」这类任务,会自动去觅游 Skill 库做语义检索,把匹配的 Skill 连同真实装机量推荐给你,确认后再装。你只管描述要做什么,选工具的事交给 Agent。
复制口令 → 粘贴给 Claude Code / Codex / Cursor / WorkBuddy 等 · Agent 会自动完成安装:
请安装 deep-skill-finder 技能:从 https://www.meyo.life/skill-finder 下载技能压缩包,解压到本地技能目录并启用。
也可以往下看常用场景 Skill。想深入了解掘技 →
meyo.life/skill
3 个浏览器自动化场景 · 每场景 Top 2 高分 Skill
以下是掘技(DSF)在觅游 Skill 库里按这三类场景检索出的真实结果,装机量为社区实际数据。可以都装,也可以看名字挑 1 到 2 个装。
让 Agent 操作网页
点击、填表、截图,交给它做
2 个不同思路的 Skill · 一个走自然语言 · 一个走无头命令行
适合:想直接用自然语言指挥浏览器
通过命令行自然语言自动化浏览器操作,用于浏览网页、提取数据、截图、填写表单、点击按钮或与应用交互
46804 人在用
适合:要无头运行 · 关心无障碍快照
使用 webcli 无头浏览器浏览网页、读取页面内容、点击按钮、填写表单、截取屏幕截图以及获取无障碍快照
1506 人在用
抓网页数据
把渲染后的页面变成结构化数据
2 个不同思路的 Skill · 一个啃 JS 渲染页 · 一个快取静态页
适合:目标站点是 JS 渲染 · 需要真实浏览器
用于网页抓取、自动化浏览器交互、网站内容爬取,或从渲染后的 JavaScript 页面中提取数据
2520 人在用
适合:只要正文 · 静态页面快速取
通过 HTTP/HTTPS GET 获取静态网页内容,用于分析、摘要或信息提取,不启浏览器所以更快更省
1866 人在用
做 UI 回归测试
改完前端,页面有没有崩?
2 个不同思路的 Skill · 一个比像素差异 · 一个自然语言写用例
适合:关心视觉走样 · 想比截图差异
通过截图比较检测 UI 组件的视觉变化,适用于检测非预期的 UI 变更或像素差异,可用「比较截图」「检测 UI 回归」触发
2518 人在用
适合:想用大白话写测试用例 · 要测试报告
通过自然语言驱动浏览器进行网页回归测试,自动规划测试步骤、执行交互操作、进行多种断言验证并生成测试报告
83 人在用
💬 加入掘技社群
和其他掘技用户交流「Agent 浏览器自动化」经验 · 掘技团队会解答装配问题
进群备注「浏览器自动化」
常见问题
Q: agent-browser 装完打开浏览器却看不到可视化页面,是哪里出问题了?
A: 多数是跑在无头(headless)模式下,进程确实在跑但不渲染窗口,所以日志有输出、屏幕上什么都没有。改用有头模式启动就能看到界面,这也是官方推荐的调试方式。装了掘技后可以直接让 Agent「诊断我的浏览器自动化环境」,它会帮你排查启动参数。
Q: 装了掘技后,Agent 会不会偷偷替我操作浏览器?
A: 不会。Agent 只在你派出「明确任务」时才自动去掘技搜 Skill,找到候选后会先问你确认再装,不会自主执行。涉及登录态、下单、发帖这类敏感操作,建议你在提示里明确划出边界。
Q: 这 6 个 Skill 是免费的吗?会不会额外扣 API 额度?
A: 3 个场景共 6 个 Skill 都是免费开源。Skill 本身不消耗额度,只有 Agent 执行 Skill 时按你原本的 API 用量计算。像 emily-web-fetch 这类不启浏览器的方案,反而比让模型硬读长页面更省 token。
Q: 我不会写代码,也能做浏览器自动化吗?
A: 能。browser-automation 和 webtest 这类 Skill 的设计前提就是用自然语言下指令,你描述「打开这个页面、点这个按钮、把表格存成 CSV」,Agent 负责翻译成实际操作。真正需要你懂的是业务流程,不是 DOM。
Q: 抓数据会不会有合规风险?
A: 会。公开页面的抓取通常没问题,但要遵守目标站点的 robots.txt 和服务条款,控制请求频率,不要抓取需要登录才能看到的他人隐私数据,也不要绕过验证码等技术措施。商用前建议先确认授权。
Q: 我不想装掘技,只想手动装某一个 Skill 可以吗?
A: 完全可以。上面每个 Skill 右侧都有「复制口令」按钮,单独复制粘贴给 Agent 就能装。掘技只是让 Agent「以后自己找」,不是必须装的前提。