报告概述
本报告由AIwatch.ai出品,作者郎瀚威与猫猫头。报告对Anthropic Claude插件、OpenAI Atlas、Manus插件、Genspark浏览器四个AI Agent平台进行了六项真实任务的横向测试。六项任务分别测试了视频内容理解、电商购物操作、财务数据分析与Excel生成、品牌Logo设计、政府财务报告检索、简历转网页等能力。每个任务均采用统一Prompt,记录执行成功率、耗时,并由测试人员撰写主观体验。报告旨在评估各平台在模拟人类操作场景下的实际表现,揭示不同技术路线(操作模拟 vs API调用)的优劣,为AI Agent应用发展提供参考。
报告的核心结论
Claude插件采用操作模拟范式,交互像人但效率较低。
报告指出,Claude插件通过浏览器截图识别屏幕内容、模拟鼠标点击和键盘输入来完成任务,而非调用API。这种方式的优势是跨平台兼容性强,符合人类操作直觉;缺点是运行速度慢(例如Logo设计耗时超过1小时),且出错率较高。测试者形容它'像一个不会学习但学得很认真的笨学生'。
Genspark浏览器在综合能力上表现最佳,被誉为'全能大师'。
在全部六项测试中,Genspark均成功完成任务,且结果质量较高。它针对不同任务调用专用工具(如视频分析工具、表格工具、浏览器自动化工具),不仅满足需求,还能主动优化输出(如Logo设计给出设计元素供后续修改)。测试者认为它'样样都会,样样都能做得好'。
AI Agent正从'用代码搭建工作流'转向'模拟人类操作'。
报告核心观点指出,Claude插件的推出代表了交互范式的转变——不再需要编写API脚本,而是通过模仿人的操作(点击、输入、复制粘贴)实现跨平台自动化。这大幅降低了自动化门槛,普通用户说一句话就能实现复杂流程,但同时也意味着标准化屏幕操作的工作更容易被AI取代,如数据录入、客服等岗位面临冲击。
报告回答的关键问题
哪些AI Agent在真实购物任务中表现最好?
报告测试了在Instacart上根据邮件购买食材的任务,四个平台均成功完成。其中OpenAI Atlas最快(152秒),执行果断且自动清理了上次遗留物品;Genspark浏览器也顺利完成但数量有误;Claude插件耗时最长(1403秒),但步骤谨慎需用户多次确认。综合来看,Atlas在速度与准确性上表现最优。
Claude插件能否总结YouTube视频?
报告显示,Claude插件无法直接解析视频内容,而是通过截图页面文字进行'猜'总结,最终失败。同样,OpenAI Atlas也只读取了页面文字。只有Manus和Genspark通过实际分析视频内容完成了任务,其中Genspark调用了自带的视频分析工具。因此,Claude插件目前不具备真正的视频理解能力。
AI Agent设计Logo的质量如何?
四个平台均成功生成了Logo,但质量差异大。OpenAI Atlas和Manus直接通过AI图像生成产出简约大气的设计;Genspark调用NanoBanana模型,输出高质量Logo并附设计元素;而Claude插件采用最笨的方法——打开Canva手搓Logo,耗时一个多小时,结果仅为插画与文字拼接,美感不足。
报告中的代表性数据
各平台完成任务用时(秒)
2025年12月测试,在'总结YouTube视频'任务中,OpenAI Atlas、Claude插件、Manus插件、Genspark浏览器的耗时分别为12秒(失败)、234秒(失败)、231秒(成功)、208秒(成功)。Manus和Genspark成功分析视频内容,而Atlas和Claude仅依赖页面文字。
Claude插件设计Logo耗时
2025年12月测试,在'设计品牌Logo'任务中,Claude插件耗时4570秒(约1.27小时),是其他平台的20倍以上。它通过打开Canva手动拼接元素完成,效果较差。
以上数据根据报告摘要整理,具体统计口径和数值请以完整报告原文为准。
完整报告包含什么
- 每个任务的完整测试过程截图与细节:包括OpenAI Atlas、Claude插件、Manus插件、Genspark浏览器在每一步的操作记录、中间结果和最终输出,帮助读者直观对比不同AI Agent的执行逻辑。
- 任务Prompt原文及任务分析:列出了六个任务的官方Prompt来源(如Genspark官方、Gemini官方、Anthropic官方等),并逐一解析每个任务的核心能力要求,方便读者理解测试设计的意图。
- 多维度成功率与耗时统计:以表格形式展示了所有平台在每个任务上的成功/失败状态、耗时(秒)、成功率比例,以及平均耗时等量化指标,便于从数据层面评估各Agent的效率和可靠性。
- 测试人员主观感受与评价:三位测试人员(Will、wzy、dyr)分别撰写了详细的平台评测感受,包括对每个平台交互体验、执行风格、优缺点的个性化点评,提供了超越客观数据的洞察。
- Claude插件操作模拟的深层思考:报告第三部分'测试感受——by Will'专门讨论了Claude插件所代表的交互范式转变,包括对岗位替代风险、技术发展路径的深入分析,是报告最具洞察力的章节。
- 作者介绍与联系方式:提供了作者郎瀚威(硅谷AI GTM顾问)和猫猫头的背景、公众号、推特等信息,并附有其他Agent测试报告合集(如编程能力、电商购物、长视频总结等)的飞书下载链接。
本页内容由川海智库整理,用于帮助读者快速了解报告主题、核心观点和主要内容。由于报告量大、人工能力有限,部分观点、数据、统计口径或表述可能存在偏差,具体内容请以完整报告原文为准。





