
ClawBench 针对 Claude、GPT 和 Gemini 等 AI agent 开展了真实网站任务测试,公开报道显示,三类模型整体任务成功率约为 33%。这意味着模型在受控问答或标准化基准中展现出的能力,尚不能直接等同于真实网页工作流中的完成能力。测试暴露的重点不是某一家模型单独失利,而是当前 AI agent 在页面理解、连续操作、状态保持和异常恢复等环节仍存在系统性不稳定。由于现有公开线索尚未披露完整测试报告,样本量、任务分布、具体模型版本和成功判定标准仍需以 ClawBench 原始资料为准。
真实网站测试给出了更低的完成率
根据新浪网及手机新浪网 9 月 2 日的报道,ClawBench 将 Claude、GPT 和 Gemini 等模型置于真实网站任务环境中进行评估,结果显示整体任务成功率约为 33%。这里的关键限定是“整体约为 33%”,现有信息并未说明每个模型分别取得多少成功率,也没有足够材料证明某一模型在全部任务类型上领先或落后。因此,不能把这一数字简单解读为三家模型的单项排名。
真实网站与静态题库的差别,在于任务通常不是一次生成答案,而是需要连续完成多个动作:理解页面目标,定位控件,输入或修改信息,等待页面反馈,再根据新状态决定下一步。任何一步出现页面结构变化、加载延迟、权限限制或工具调用失败,都可能让后续动作失去前提。对 agent 而言,最终任务是否完成往往比某个局部动作是否正确更重要,这也会放大长流程中的小错误。
33% 暴露的不是“不会回答”,而是不会稳定执行
这项测试最值得重视的地方,在于它把模型能力从“生成合理文本”推进到了“对外部环境产生连续、可验证的行动”。语言模型可以给出看似正确的步骤,但真实网站要求它持续读取环境反馈,并且在每一步都保持对任务状态的准确判断。若模型误判按钮状态、遗漏必要字段,或者在页面跳转后继续依据旧上下文行动,最终结果仍然是失败。
由此可以提出第一个判断: 当前 AI agent 的主要瓶颈已经不只是推理能力,而是推理、工具和环境状态之间的闭环可靠性。 在演示场景中,一次成功操作足以展示能力;在企业流程中,用户更关心的是连续数十次执行能否保持稳定,以及失败后能否及时停止、回退和交给人工处理。约 33% 的整体成功率,至少说明模型距离“无需监督地处理通用网站任务”仍有明显距离。
第二个判断是,真实网站评测可能比单纯的知识问答或静态操作题更接近 agent 的实际使用成本。网页任务失败不一定意味着模型缺乏相关知识,也可能源于界面变化、权限和登录状态、外部工具连接、信息填写规范等非语言因素。开发者如果只看模型在传统基准上的高分,可能会高估其在客服后台、采购系统、办公平台和运营流程中的可部署程度。
对模型厂商和应用开发者的影响
对模型厂商来说,这类测试会把竞争重点从“模型能否完成一次任务”转向“模型能否在复杂环境中稳定完成任务”。模型需要更好地识别页面状态、确认操作结果,并在不确定时主动暂停,而不是继续生成看似连贯的动作序列。评测也应同时记录局部步骤正确率、最终完成率、错误类型、恢复成功率和人工接管次数,否则一个汇总成功率很难解释失败究竟来自模型、工具还是网站本身。
对应用开发者而言,直接把通用模型接入浏览器自动化并不等于拥有可靠的数字员工。更现实的做法是缩短单次任务链路,为高风险动作增加二次确认,保存可回滚的操作记录,并对登录、支付、提交和删除等环节设置人工兜底。对于低风险、结构稳定的网页任务,agent 仍可能具备实用价值;但在开放网页环境中,系统设计不能把模型输出当作必然正确的执行指令。
后续需要补齐哪些测试信息
目前公开线索能够确认的是 ClawBench 测试涉及 Claude、GPT 和 Gemini,并给出了约 33% 的整体成功率;但测试任务数量、网站类别、任务难度、模型具体版本、是否允许重试、浏览器和工具配置,以及“成功”的定义尚未完整公开。缺少这些信息,就无法判断结果是否具有统计稳定性,也无法公平比较不同模型在相同条件下的差异。
后续最值得关注的不是单一百分比是否上升,而是评测能否提供可复现的任务集和分项结果。如果成功率提升来自更适合测试的网站或更短的任务链路,其现实意义有限;如果模型能够在动态页面、长流程和异常场景中同时降低失败率,才更接近企业真正需要的可靠性指标。官方原始报告及完整方法说明尚未在现有新闻线索中提供,相关结论仍应保持审慎。
信息来源
- 新浪网:《33%!Claude、GPT、Gemini 在真实网站上集体翻车,ClawBench 把 AI agent 打回原形》,2026 年 9 月 2 日。
- 手机新浪网:同题报道,2026 年 9 月 2 日。
- 说明:本文依据上述公开新闻线索整理。ClawBench 完整测试报告、样本量、模型版本、任务清单和评分细则,现有材料未披露,最终数据应以原始发布方资料为准。