美团Tabbit实测:免费用GPT-5.5和Claude Opus 4.8,浏览器Agent自动化到底能干什么

上周在刷 Twitter 的时候,看到有人发了张截图:一个浏览器插件界面,模型列表里整整齐齐排着 GPT-5.5、Claude Opus 4.8、Gemini 3.1 Pro、Grok 4.3,底下赫然写着「免费」。

第一反应是钓鱼网站。

点进去一看,居然是美团做的。一个叫 Tabbit 的 AI 浏览器,6 月 9 号刚发布 1.0 版本。我拿主力浏览器装了试了三天,说实话,模型免费不是最让我意外的------浏览器 Agent 自动化才是这个产品的真正野心

一句话摘要:Tabbit 把 AI 模型聚合、浏览器自动化、技能市场三件事塞进了一个浏览器插件,免费额度给得很大方,但 Agent 自动化在复杂场景下还比较拉胯。

先搞清楚:Tabbit 到底是什么

你可能跟我第一反应一样------又一个 ChatGPT 套壳?

不是。Tabbit 是一个浏览器原生的 AI 操作系统,由 Lumina Lab 开发,注册在新加坡。它跟 ChatGPT 的根本区别在于:ChatGPT 是一个聊天窗口,Tabbit 是把整个浏览器变成了 AI 的操作界面。

三个核心层:

层级 功能 和现有产品的关系
模型聚合层 免费接入 8+ 旗舰模型 类似 Poe,但免费且无每日配额
Agent 自动化层 AI 操控浏览器完成任务 类似 Browser Use / OpenAI Operator
Skills 技能层 2000+ 预置技能覆盖 100+ 网站 类似 Claude Code 的 Skill 系统

这三个层级叠在一起,Tabbit 的定位就清楚了:它不是在跟 ChatGPT 抢聊天入口,而是在抢浏览器这个 AI 操作的主战场

免费模型到底能用到什么程度

先说大家最关心的------免费到底是真免费还是骗进去割韭菜。

国际版(tabbit.ai)目前支持的模型:

模型 能力等级 免费状态
GPT-5.5 OpenAI 旗舰 免费
Claude Opus 4.8 Anthropic 旗舰 免费
Gemini 3.1 Pro Google 旗舰 免费
Grok 4.3 xAI 旗舰 免费
DeepSeek V4 国产最强 免费
Kimi K2.6 国产长文本 免费
GLM 5.2 智谱旗舰 免费
MiniMax M2.8 国产多模态 免费

官网的说法是「no upsell tier hidden behind a paywall」------没有隐藏付费墙。搜狗微信上几篇热文提到每周约 1000 次免费对话 + 50 张配图,用完后可以切到不限量的高级模式。

我实测三天,每天重度使用(每轮对话含上下文),GPT-5.5 和 Claude Opus 4.8 都没有被限流的迹象。响应速度跟直接调 OpenAI/Anthropic 官方 API 感觉一致,没有明显的排队或降速。

但有一个关键细节:免费模型走的是 Tabbit 的代理路由,你的 prompt 和 response 都经过新加坡的合规服务器。后面会单独说隐私问题。

浏览器Agent自动化:我测了3个场景

这才是 Tabbit 区别于所有聊天 AI 的核心卖点。所谓浏览器 Agent,就是你给 Tabbit 一个任务指令,它自动操控浏览器帮你完成------点击、填表、翻页、抓数据,全程不需要你动手。

我设计了三个场景,从简单到复杂,逐一实测。

场景一:自动填写 GitHub Issue 模板(成功率:100%)

任务描述:在 GitHub 一个开源项目中,自动填写一个 Bug Report Issue,包括标题、复现步骤、环境信息。

执行过程:我在 Tabbit 的 Agent 面板输入:「帮我在 github.com/magebyte/power-ai/issues/new 里创建一个 bug report,标题写 Tabbit Agent 搜索框偶尔不响应,复现步骤:1. 打开搜索 2. 快速连按三次回车 3. 搜索框无响应,环境 macOS 15.5 + Chrome 126。」

Tabbit 大约花了 8 秒完成整个流程:打开 issue 页面 → 选择 Bug Report 模板 → 依次填入标题、描述、复现步骤 → 提交。每个字段填写时都会高亮当前操作的 DOM 元素,视觉反馈很清楚。

结论:对于结构化的表单填写,Agent 的表现堪称完美。100% 成功率,零人工干预。

场景二:自动抓取并对比两个 npm 包的下载量(成功率:80%)

任务描述:分别访问 npm 上 express 和 koa 的页面,抓取近一周下载量,生成对比结论。

执行过程:Tabbit 依次打开两个 npm 页面,等页面加载完成后提取周下载数据。express 周下载约 2800 万次,koa 约 120 万次。最终生成了一句对比结论。

踩坑 :第一次执行时,npm 页面的动态加载还没完成,Tabbit 就开始读数据了,抓到了 -- 占位符。第二次加了「等页面完全加载后再读取」的限定,成功了。说明 Agent 对异步加载的等待策略还不够智能,需要用户在指令里显式提醒。

场景三:自动登录电商网站并比价(成功率:失败)

任务描述:在某电商平台搜索「机械键盘」,筛选价格 300-500 元区间,按销量排序,取前 3 个结果的名称和价格。

执行过程:Tabbit 能打开搜索页,能输入关键词,能点击搜索按钮。但到了筛选价格区间这一步,它遇到了平台的反爬弹窗(滑块验证码),Agent 完全卡住了。

结论需要登录或有反爬机制的网站,Agent 目前基本不可用。这不是 Tabbit 的技术问题,而是整个浏览器 Agent 赛道的共同瓶颈------反爬和验证码是 Agent 自动化最大的天敌。

实测数据汇总

场景 任务类型 耗时 成功率 人工干预
GitHub Issue 填写 表单自动化 8s 100%
npm 数据对比 网页数据抓取 25s 80% 需显式等页面加载
电商比价 跨页面操作 失败 0% 无法绕过验证码

我的判断 :Tabbit 的 Agent 在结构化、无反爬、公开页面的场景下已经能用了。但凡涉及到登录态、验证码、复杂交互状态机,目前还是别指望。

这里有个大多数人踩过又不知道原因的坑:Agent 对页面状态的理解完全依赖 DOM 快照。当页面有异步加载、动态渲染、或需要等待特定事件触发时,Agent 会「看到」一个不完整的页面。这跟人类「等页面加载完再操作」的直觉完全不同------Agent 不会主动等,除非你显式告诉它。这个差异会导致 Agent 在很多「看起来简单」的场景下翻车。

Skills 系统:2000 个预置技能到底有没有用

Tabbit 号称有 2000+ Agentic Skills,覆盖 100+ 常用网站。听起来跟 Claude Code 的 Skill 系统类似,但机制完全不同。

Claude Code 的 Skill 是本地 Markdown 文件,定义了 agent 在特定场景下的行为规则,由 Claude 的工具调用能力驱动执行。

Tabbit 的 Skill 更像是预录制的浏览器自动化脚本 + prompt 模板组合。比如它的「GitHub Skill」就封装了创建 Issue、搜索代码、管理 PR 等一系列操作的 Agent 指令。

我翻了一下它的 Skills 列表,大概分三类:

类型 示例 实用性
网站操作型 GitHub、Notion、Google Docs 较高,结构化操作
信息聚合型 新闻汇总、Twitter 趋势 中等,信息抓取可用
模板生成型 简历、PPT、代码模板 较低,跟直接用模型差距不大

说实话,Skills 系统的真正价值不在那 2000 个预置技能,而在它的 Skill 开发框架------你可以自己写 Skill 来自动化你常去的网站。但目前 Skill 的自定义文档非常少,社区生态还没起来。

跟 ChatGPT、Claude、Perplexity 横向对比

维度 Tabbit ChatGPT Plus Claude Pro Perplexity Pro
月费 免费 $20 $20 $20
最强模型 GPT-5.5 + Claude Opus 4.8 GPT-5.5 Claude Opus 4.8 GPT-5.5
浏览器 Agent 内置 Operator(额外收费)
Skills 生态 2000+ 预置 GPTs(已弱化) MCP + Skill
联网搜索 内置 内置 内置 核心功能
隐私透明度 新加坡合规路由 美国 美国 美国
响应速度 快(代理路由) 中等

最大差异:Tabbit 是唯一一个把「模型免费 + 浏览器 Agent + Skills 生态」打包在一起的产品。ChatGPT 的 Operator 功能类似但要额外付费,Claude 和 Perplexity 根本没有浏览器 Agent。

最大劣势:Tabbit 的对话质量和模型表现,跟直接用原厂产品相比,我主观感受差了大约 5-10%------可能是因为代理路由的 prompt 预处理。不确定是网络延迟还是 prompt 注入导致的。另外,Tabbit 不支持 system prompt 自定义和 temperature 调参,对需要精细控制模型行为的开发者来说是个硬伤。

底层技术:浏览器Agent是怎么实现的

你可能会好奇,Tabbit 到底用什么技术驱动浏览器 Agent。从它的行为模式推断,核心技术栈大概率是多模态大模型 + DOM 解析 + 任务规划链的组合。

具体来说,Agent 每执行一步操作,流程大概是这样的:

  1. 页面理解:拿到当前页面的 DOM 树快照(或者视觉截图),送给多模态模型分析
  2. 任务分解:模型把用户的自然语言指令拆成一系列原子操作(点击、输入、滚动、等待)
  3. 元素定位:在 DOM 树中找到目标元素的 selector 或坐标
  4. 操作执行:通过浏览器扩展 API 模拟真实用户操作
  5. 结果验证:检查操作后的页面状态是否符合预期,决定是否需要重试

这个架构有个天然的瓶颈:每一步都要调一次模型推理,导致复杂任务的延迟是线性累加的。我测的 npm 对比场景,25 秒的耗时里至少有 15 秒花在模型推理上。

对比 OpenAI 的 Operator 和 Anthropic 的 Computer Use(虽然 Computer Use 不是浏览器 Agent),Tabbit 的实现明显更轻量,但精度也更低。Operator 有 OpenAI 自己的视觉理解模型做底层支持,定位准确率更高;Tabbit 用的是通用多模态模型,在复杂页面上的定位偶尔会出错。

隐私和安全:把浏览器交给 AI 代理,你敢吗

这是我在用 Tabbit 之前最纠结的问题,也是我认为所有 IT 工程师都应该认真考虑的点。

数据流向:Tabbit 的 Agent 操作是在你的浏览器里执行的,但模型推理请求会经过新加坡的合规服务器。官方说法是不存储用户 prompt,但作为工程师,你应该知道「说不存」和「真的不存」是两件事。

需要你关注的风险

风险点 具体情况 严重程度
Agent 访问你的登录态 Agent 在你的浏览器上下文执行,能看到你已登录的 cookie
prompt 经过第三方服务器 所有对话内容经过 Tabbit 代理
Skill 来源不可审计 预置 Skill 的执行逻辑用户看不到源码
浏览器权限过大 插件需要几乎所有网站的读写权限

我的建议:在公司浏览器和个人浏览器之间做隔离。别在装了 Tabbit 的浏览器里登录公司内部系统、财务系统、或任何敏感账号。用一个专门的 Profile 跑 Tabbit。

什么时候用,什么时候别用

适合用 Tabbit 的场景

  • 你想同时对比多个模型对同一个问题的回答,省去挨个切换的麻烦
  • 你有大量重复性的网页操作(填表、信息抓取、内容发布),想试试 Agent 自动化
  • 你想免费用 GPT-5.5 和 Claude Opus 4.8 但不想每月花 $40
  • 你想探索浏览器 Agent 这个新方向,Tabbit 是目前门槛最低的入口

别用 Tabbit 的场景

  • 涉及登录态的敏感操作(银行、公司内网、支付)
  • 需要绕过反爬机制的数据采集(Agent 目前没有这个能力)
  • 对响应质量要求极高的场景(直接用原厂 API 更稳)
  • 所有需要处理公司机密信息的工作

常见问题

Q1:Tabbit 国际版和国内版有什么区别?

国际版(tabbit.ai)支持 GPT-5.5、Claude Opus 4.8 等海外模型,注册和服务器在新加坡。国内版主要接入国产模型(DeepSeek、Kimi、GLM 等),合规要求不同。两个版本的 Agent 和 Skills 功能基本一致,但模型池不同。

Q2:免费额度用完怎么办?

搜狗微信上的热文提到每周约 1000 次免费对话额度,用完后可以切到高级模式。实测下来,普通使用节奏很难在一周内用完 1000 次。如果你是重度 Agent 使用者,可能会在周三左右碰到额度。

Q3:跟 Claude Code 的 Skill 系统有关系吗?

没有关系。Claude Code 的 Skill 是本地 Markdown 文件定义的 agent 行为规则,由模型的工具调用能力驱动。Tabbit 的 Skill 是浏览器自动化脚本 + prompt 模板,本质是「录制回放 + AI 补全」。名字相似,机制完全不同。

Q4:Tabbit 的浏览器 Agent 能替代 Selenium / Playwright 做自动化测试吗?

不能。Tabbit 的 Agent 是自然语言驱动的,每次执行路径可能不同,没法保证确定性。自动化测试需要的是确定性 + 可重复性,Selenium 和 Playwright 仍然是正确选择。Tabbit 的 Agent 更适合「一次性探索任务」,不适合 CI/CD 管线。

Q5:Tabbit 靠什么赚钱?

目前没有公开的商业模式信息。考虑到 Lumina Lab 注册在新加坡,且免费模型的算力成本不低,后续大概率会走企业版付费、或高级 Agent 功能付费的路线。模型聚合层可能一直是免费入口,靠 Agent 和 Skills 层变现。

我的判断

Tabbit 代表了一个明确的趋势:AI 战争正在从「模型层」转向「入口层」。模型本身正在快速商品化------当 GPT-5.5 和 Claude Opus 4.8 都能免费用的时候,模型就不再是壁垒。谁掌握了用户触达 AI 的入口,谁就拿到了下一阶段的船票。

美团做 Tabbit 的逻辑不难理解:浏览器是所有 Web 操作的起点,把浏览器变成 AI 操作系统,就等于拿到了用户和所有网站之间的「中间层」控制权。这跟当年 Google 做 Chrome 的逻辑如出一辙------浏览器不是目的,用户行为数据和分发入口才是。

对工程师来说,Tabbit 值得花一个下午试一试。但别指望它今天就能替代你的自动化工具链。它的 Agent 能力还处于「能用但不稳」的阶段,适合探索和简单任务,距离生产级自动化还有明显差距。

下次有同事跟你说「AI 浏览器要颠覆一切了」,把这篇文章甩给 TA。

相关推荐
我要割麦子20 小时前
从零到一手撸 Agent 系列 — 第 3 篇:Agent 的"心跳" — 主循环与 System Prompt
aigc·agent
网易云信21 小时前
网易智企入选《2026人工智能发展白皮书》,帝王蟹引领“智能增效”场景
人工智能·agent
后端小肥肠21 小时前
用它做的第一条视频自然流就是投流的 3 倍,我做了个抖音全栈运营 Skill
人工智能·aigc·agent
新知图书21 小时前
6.3 详细实现与核心配置(双语绘本速记单词智能体开发)
人工智能·agent·ai agent·智能体·扣子
Bigger21 小时前
我受够了每天问“今天吃什么”,于是做了个 AI 菜单工具
前端·人工智能·agent
另一种生命里21 小时前
你的 Agent 流程还是一团黑盒?这个开源引擎把每一步都画成了可回放的 DAG 图
人工智能·agent
ArixBit21 小时前
用 Go 手撸 Agent 框架 #10:用自己的 Runtime,做一个研究助手
go·agent
李剑一1 天前
AI大模型扎堆上新?Kimi K3、Qwen 3.8、DeepSeek v4马上上线,旧的还没用上,新的就来了!比当年山寨机上新还快!
agent·ai编程·deepseek
HYDtomako1 天前
Claude Code学习
学习·ai·agent·claude code