职贝云数AI新零售门户

标题: 我给GPT Aegnt和Manus安排了场像素级对比,OpenAI就不该把PPT当卖点 [打印本页]

作者: jro 时间: 10 小时前
标题: 我给GPT Aegnt和Manus安排了场像素级对比,OpenAI就不该把PPT当卖点
这应该是上线以来案例最少的 Agent 了，

OpenAI GPT Agent

奥特曼你不给我用，就别怪我用 Manus 跟你硬碰硬了。

先上结论，GPT Agent曾经末尾向Pro、Plus和Team用户推送，Pro每月400条音讯，其他付费用户每月40条。原有的Operator（阅读器操作智能体）几周后会中止服务，原来的深度研讨（Deep Research）会被收到下拉菜单里，Agent成功上位。

经过对话框里的工具（Tools）下拉菜单选择 “Agent mode” 就能调用 GPT Agent。

GPT Agent 目前能调用的工具用有图形阅读器（相似Chrome、Edge、Safari）、文本阅读器（相似Lynx，只显示纯文本内容的阅读器）、终端（也会叫命令行）和各种APIs。

这个Agent实际上会本人选择最佳途径，包括运转代码，生成幻灯片和电子表格，同时在各个步骤中保持残缺的上下文，是支持随时打断并接管阅读器的。随时打断也是OpenAI Operator、Manus的常规功能了，没啥新颖的。

比较有意思的一个点是在执行的过程中，GPT Agent 还会把本人的内心旁白写到操作界面上，我可以第一工夫了解它在做什么。

(, 下载次数: 0)

说了那么多，直接上案例！

评分这类纸面实力我们留到后面。

我要先吐槽吐槽发布会上跑的案例非常细碎，发布会也就25分钟，我看最长的那个案例都花了23分钟，一会展现A、一会展现B、再过会C来了。。。

怪不得这次拉了五个人下去，能够是由于Agent运转的工夫太长，按照之前的四人配置唠不了那么久。但一次拉那么多人上直播真的没成绩吗？别下周又被Meta挖走了。

(, 下载次数: 0)

还是先来看看GPT Agent PPT做的怎样样吧，也是被吐槽最多的点。

做的PPT太素了，

从云端硬盘获取ChatGPT智能体评价数据并制造PPT，无需引言或结语部分，直接用图表展现结果即可。

(, 下载次数: 0)

这样看其实还好吧。

但异样是做ppt，提早拿到内测资历的人跑出来的是这样：

(, 下载次数: 0)

(, 下载次数: 0)

(, 下载次数: 0)

(, 下载次数: 0)

这几张图都被盘包浆了，不夸张地说每一家能做PPT的Agent都可以秒杀这个。异样的提示语在Manus上表现怎样样？

由于不确定原来的文件长啥样，所以我第一次是让Manus自行搜索，

(, 下载次数: 0)

没想到变相添加了难度，做出来的图表还没 GPT Agent 好。

第二次我把刚刚那个素到不行的PPT的同款提示语丢给Manus了。

(, 下载次数: 0)

(, 下载次数: 0)

OpenAI 这波的确没得洗，

硬要说的话 GPT Agent 的长处是画图和数据处理，反而不是文字排版。

再看看第二个主case，也是发布会第一个case

"我们的冤家往年晚些时分要结婚了！这是婚礼网站：

www.zola.Com/wedding/minniaandsarah

请协助完成：

输入方式是报告，按理来说就是 GPT Agent 的温馨区，毕竟内置了Deep Research，感觉要不是提示语外面指定了网址和操作的话，原版 Deep Research 的结果会比找这更详细。。。

(, 下载次数: 0)

我来讲解一下，报告首先概述了婚礼和早午餐的工夫、地点及当地天气状况（第1部分）；接着，根据“黑领结可选”的着装要求和当地气候，引荐了多款中高档西装/礼服（第2部分）和配套的9.5码正装皮鞋（第3部分）；然后，报告为9月19-24日的五晚住宿提供了四个酒店选项，并列出了价格和亮点（第4部分）；最后，由于新人的礼物清单未公开，报告建议了一款价格低于500美元的 Sonos 智能音响作为礼物（第5部分）。

异样的提示语下，Manus中间执行操作基本也是网页阅读（点击、滑动）、联网搜索等，

(, 下载次数: 0)

在逐字对比两个的报告后，我和裁判 Gemini-2.5-pro 给出的答案是GPT Agent出来的报告更好：

GPT的报告缺陷是错误地判别了礼物清单的公开性，但它为用户提供了高度详细、可直接执行的建议，例如引荐了特定品牌的西装和皮鞋，并且其酒店引荐都集中在与婚礼地点（Wailea）分歧的区域。

Manus的报告它只提供了着装的风格方向而非详细商品，而且引荐的酒店大多位于间隔较远的 Kaanapali 地区，降低了对参会者的便利性。

第三个，也是最难的case是游览数据分析，

第一遍看的时分我也没看出来，由于这个case没有输入的镜头，是由于跑好了直接切换出来的。
📍
构建并预定在美丽国境内参观一切30个职棒大联盟（MLB）球场的最佳行程（从旧金山出发）

要求概述：

(, 下载次数: 0)

(, 下载次数: 0)

可以看到GPT列出的数据是很详细的，并且顺利完成了顺路规划，这个顺路图一打眼看上去还有点小震撼，在这么大的数据处理量下依然成功完成义务。

异样的提示语下，Manus就拉跨了，我跑了三次，最短一次20分钟，最长一次60分钟左右，烧了快8000积分，真实是烧不动了。。。

搜索工夫表、文件下载、文件格式转换都没啥成绩，就卡在规划最佳道路上了。

目前看来GPT Agengt最大的败点还是拿ppt当卖点。明明数据处理才能是相当不错的，在后面的数据表也能表现出来。

最后一个case是唯逐一个图像相关的，

(, 下载次数: 0)
🎉
为我们的 GPT Agent 发布制造团队宣传品——根据附件中的团队吉祥物照片设计心爱搞怪的动漫风格图案，将其制成 1x1 英寸的笔记本电脑贴纸，并订购 500 份寄至旧金山佛罗里达街 575 号。

(, 下载次数: 0)

GPT，我问你我那么大只狗呢？贴纸在哪里啊？光看到最后的订购了。

再看看 Manus 表现怎样样，

(, 下载次数: 0)

Manus做的还是挺心爱的，和我提供的原图狗狗笼统分歧，看完我都想给我家猫猫也做一套贴纸玩玩了。

完成贴纸设计之后，两个Agent都选择了让用户最后的时分输入本人的信息完成下单。这一趴的话没有拉出差距。

(, 下载次数: 0)

我还是那句话，

奥特曼你就不应该把PPT作为宣传主力啊。

最后来看看目的吧，

在人类的最后考试 Humanity’s Last Exam (HLE) 中，GPT Agent 的得分达到了 41.6，假如允许它运转八次，选一次可信度最高的话，提分还可以提升到44.4，跟隔壁Grok 4 Heavy（工具加强版）持平。

(, 下载次数: 0)

在FrontierMath（已知最难的数学测试）里，

GPT Agent的准确率达到了 27.4%，比o3高了17.1%

(, 下载次数: 0)

在 BrowseComp（评价 Agent 信息检索才能数据集）上，GPT Agent的得分是 68.9% ，比 Deep Research 高出 17.4。

(, 下载次数: 0)

在真实电子表格编辑义务 SpreadsheetBench 数据集中，ChatGPT Agent 准确率达到 45.5%。

(, 下载次数: 0)

在 DSBench 数据迷信基准测试中，GPT Agent 在数据分析和数据建模两打义务上超越了人类专家。

(, 下载次数: 0)

一句话总结，

GPT Agent是一个擅长处理各类学科成绩、能完成网页阅读和信息检索，在电子表格上编辑有优秀功能的Agent。

是不是应该叫学科Agent啊，

细心想想OpenAI好像也没说本人是通用Agent。

写在最后

昨天风评两极分化都给我整迷糊了，

我本人第一次看的时分就觉得没啥特征，第二次看内测用户放出来的ppt案例觉得是渣滓。

但是为什么他们发布会上做的两页ppt会比放出来的效果好那么多呢？

所以，我才写决议写下这篇文章，

去测测看到底是不是真的拉。

但是还是有反转啊，

Manus优势没那么大，

GPT Agent也没想象那么拉跨。

我还是那句话，

奥特曼给我点钱吧，

我给你当PR，

明明就有更好的，

你到底藏啥呢？！

@ 作者 / 卡尔

最后，感激你看到这里👏假如喜欢这篇文章，不妨随手给我们点赞👍｜在看👀｜转发📪｜评论📣

假如想要第一工夫收到推送，不妨给我个星标🌟

更多的内容正在不断填坑中……

欢迎光临职贝云数AI新零售门户 (https://www.taojin168.com/cloud/)