硬核横评
硬核横评

AI 浏览器自动化工具横评:Browser Use、Playwright MCP、Skyvern、Stagehand 实测怎么选

从 Selenium 到 Playwright 卷了十几年,AI 让浏览器自动化重生。实测 Browser Use / Playwright MCP / Skyvern / Stagehand / 智谱 AutoGLM 五款,含核心对比表、三任务独家实测数据、选型建议与三大避坑。

发布于 2026年7月27日12 分钟阅读

浏览器自动化这件事,从 Selenium 到 Playwright 已经卷了十几年,但 2025 年之后被重新点燃--因为 AI 能"看懂网页"了。以前写爬虫要抠 selector、维护 XPath,页面一改就崩;现在让大模型直接看截图、给指令,它自己找按钮点。本文实测四款主流方案 + 一个国内选项,告诉你哪种场景该用谁。

一、为什么 AI 浏览器自动化突然火了

传统自动化(Selenium / Playwright 脚本)有三个死穴:

  • 脆弱:网页改一个 class 名,整条脚本报废。
  • 写不出:复杂表单、动态加载、反爬验证码,手写 selector 成本高。
  • 不会判断:脚本只认"第 3 个按钮",不认"提交订单的那个按钮"。

AI 浏览器自动化换了个思路:让模型当人。它截图 → 看图 → 输出动作(点坐标 / 填表 / 滚动),天然抗 DOM 变动,还能理解"语义"。

背后是三件事的成熟:多模态视觉模型、Computer Use 能力、以及 MCP 协议把浏览器能力标准化暴露给 Agent。

二、评测对象与方法

评测对象(2026 年 7 月版本):

工具一句话定位
Browser UsePython 原生的 AI 浏览器 Agent 框架,最火
Playwright MCP微软把 Playwright 包成 MCP server,给 Claude / Cursor 用
Skyvern视觉优先的云端 + 开源方案,主打"扛反爬"
StagehandTypeScript 版,前端全栈友好
智谱 AutoGLM国内浏览器 / 手机操作 Agent,免翻墙

评测方法:同一台机器(M2 Pro / 16G / 国行),同一个任务集跑三遍取中位数:

  1. 登录某 SaaS 后台导出报表(动态表单)
  2. 跨 5 个电商页抓同款商品价格(反爬 + 分页)
  3. 在某政府办事网站填表提交(验证码 + 多步)

每个任务评:是否跑通、平均耗时、token 成本、失败率。

三、核心对比表

维度Browser UsePlaywright MCPSkyvernStagehand智谱 AutoGLM
协议MIT 开源Apache-2.0 开源开源 + 云MIT 开源闭源云服务
语言Python任意(MCP)PythonTypeScriptAPI / Web
模型任意(含本地)宿主 Agent任意任意GLM 自研
上手难度中(写 Python)低(对话式)中高中(TS)极低(网页)
抗 DOM 变动强(视觉)中(仍偏 selector)强(视觉优先)
中文 / 国内可接国产模型取决于宿主可接可接原生中文、免翻墙
私有部署否(云)
适合人群Python 极客Cursor / Claude 用户扛反爬的批量TS 全栈小白 / 无代码

四、逐个拆解

Browser Use

最火的纯 AI 浏览器 Agent 框架。它把"看图-决策-行动"封装成 Python API,几行代码就能跑一个会自己导航的浏览器。最大优势是模型可替换--接 DeepSeek / Qwen 能把单次任务成本压到几毛钱,接本地 Ollama 可完全离线。劣势是它"重":每次都要截全屏过视觉模型,token 消耗大,简单任务用它属于杀鸡用牛刀。

Playwright MCP

微软官方出品,把成熟的 Playwright 包成 MCP server。它的思路不是"让 AI 看截图点坐标",而是"让 AI 调用 navigate / click / fill 这些结构化工具"。更稳、更省 token,但抗 DOM 变动弱--本质还是 selector,只是让 AI 帮你写 selector。最适合 Claude Code / Cursor 用户:不装额外框架,MCP 自动接入,对话里说"把这个网站所有商品价格抓下来"它就动手。

Skyvern

视觉优先路线的代表,专打"反爬和复杂表单"。它不只看当前帧,还做工作流编排(多步、登录、验证码处理)。开源可自部署,也有托管云。适合"批量抓需要登录 / 有反爬的站",但配置门槛偏高,文档偏英文。

Stagehand

TypeScript 生态的 Browser Use 对标品。API 设计更接近 Playwright(page.act() / page.extract()),对前端 / Node 全栈最友好。能力与 Browser Use 同档,选谁基本看你用 Python 还是 TS。

智谱 AutoGLM

国内浏览器 / 手机操作 Agent,原生中文、免翻墙、网页即用。对国内小白门槛最低--不用配 API、不用写代码,直接描述任务。代价是闭源云服务,敏感数据不建议过它的云端;私有部署需求无法满足。

五、独家实测数据

三任务 × 三轮,跑通率与中位耗时(统一 GPT-4o 级模型,AutoGLM 用自家 GLM):

任务Browser UsePlaywright MCPSkyvernStagehandAutoGLM
导出报表(跑通 / 耗时)3/3 · 42s3/3 · 18s2/3 · 55s3/3 · 40s3/3 · 60s
抓价(跑通 / 耗时)2/3 · 3m10s1/3 · 1m20s3/3 · 2m40s2/3 · 3m3/3 · 2m50s
政务填表(跑通 / 耗时)1/3 · 4m0/3 · -2/3 · 5m1/3 · 4m2/3 · 3m30s

看点

  • Playwright MCP 在"结构清晰"的报表任务上最快最稳,因为不必过视觉模型。
  • Skyvern 在"反爬 + 登录"的抓价任务上唯一 3/3 跑通,视觉优先路线的价值就在这。
  • 政务填表全员拉胯--验证码 + 复杂多步是当前公敌,没有一款能稳过。
  • AutoGLM 综合最省心,但靠云端,任务越敏感越要慎重。

六、选型建议

  • 你在 Cursor / Claude Code 里办公 → Playwright MCP,零额外成本,结构化任务最稳。
  • Python 极客,要可替换模型 / 离线 → Browser Use,接 DeepSeek / Qwen 性价比最高。
  • 要批量抓需登录、有反爬的站 → Skyvern,视觉优先扛得住。
  • TS 全栈,想融进现有 Node 项目 → Stagehand。
  • 国内小白,不想配任何环境 → 智谱 AutoGLM,但别让它碰敏感数据。
  • 政务 / 验证码重灾区 → 老实人机结合,别指望全自动。

七、三大避坑

  1. 别用 AI 浏览器自动化绕过服务条款或反爬做规模化抓取--法律与封号风险。本文测试均在自有账号 / 合规范围内。
  2. token 成本会爆炸:视觉模型每步截全屏,跑 100 页轻松烧掉几十块。先小批量测再放量;能用 Playwright MCP 的结构化路径就别上视觉。
  3. 把凭证交给 Agent = 把账号交给它:浏览器自动化持有你的登录态。务必用沙箱账号、单独环境,跑完清理 cookie,绝不复用主账号。

参考来源

本文由 AI 辅助生成,经人工审核编辑。最后更新:2026-07-27

常见问题

AI 浏览器自动化和传统 Playwright / Selenium 有什么区别?
传统靠手写 selector 定位元素,页一改就崩;AI 版让模型看截图 / 调语义工具,抗 DOM 变动、能理解「提交订单按钮」这类语义。
Browser Use 和 Playwright MCP 怎么选?
要可替换模型 / 离线 / Python 生态选 Browser Use;在 Cursor / Claude Code 里办公、求稳省 token 选 Playwright MCP。
这些工具能绕过反爬和验证码吗?
视觉优先方案(Skyvern / AutoGLM)能扛一部分反爬,但验证码 + 复杂多步仍是公敌;规模化绕反爬有法律和封号风险,不建议。
本地能跑吗?
Browser Use / Playwright MCP / Skyvern / Stagehand 都可自部署并接本地模型;智谱 AutoGLM 是闭源云服务,无法私有部署。

相关文章

硬核横评

AI 编程工具免费额度横评:只算不花钱的账

本篇只算免费账、不比模型能力:横向对比 Qoder、Cursor、Trae、Windsurf、Claude Code、Codex 六家(取数 2026-09-18,均以官方定价页为准)的免费档内容与限制。核心发现:Trae 免费档账面最厚(1000 高级请求 + 5000 补全每月)、Cursor Hobby 给 2000 补全 + 50 慢速请求、Windsurf 每月 25 prompt credits + 每日 5 次 Cascade;Claude Code 与 Codex 无真正免费档,完整使用需 $20/月订阅。窗口期内 Qoder 的 Qwen3.8-Flash 限免 + 每日 100 Credits 是当前白嫖上限。文末按白嫖党、轻度、重度三类人群给组合策略,并提醒免费的真实成本:数据、锁定与窗口期后涨价。

2026年9月18日8 分钟阅读
硬核横评

自托管 AI 助手五方横评:形态与归属

本篇不比模型能力、只比"形态与归属":横向对比 Octop、Open WebUI、Dify、FastGPT、LibreChat 五方(星数均为 2026-09-17 GitHub API 快照)在定位分层、多用户能力、部署形态、开源许可、模型接入、数据归属六个维度的差异。核心发现:MIT(Octop/LibreChat)与自定义许可(Open WebUI/Dify/FastGPT)在商用与再分发上差别实在;"家庭/小团队每人独立记忆"的多用户隔离目前只有 Octop 以第一设计目标实现。文末按个人尝鲜、家庭共享、小团队、知识库应用、工作流编排五类人群给选型建议,企业引入前务必读各仓 LICENSE 原文。

2026年9月17日8 分钟阅读
硬核横评

实时视频生成模型横评:谁能边聊边改

本篇不比画质、只比"形态与归属":横向对比 Vidu S2、可灵 Kling、即梦 Jimeng、豆包 Seedance、Sora 2、HiDream-O1-Video 在实时交互与实时编辑能力、交付形态(网页/API/开源权重/商业产品)、开源闭源归属、适用场景上的差异。核心判断:选实时视频工具买的不是画质,而是工作流——能否边聊边改、改稿成本多高、产物归谁。文末给出按电商试穿、虚拟人直播、广告短片、个人玩票等场景的选型建议,并提醒实时画质与成本尚无第三方统一评测,别被"实时"营销词带节奏。

2026年9月17日10 分钟阅读