职贝云数AI新零售门户
标题:
我给GPT Aegnt和Manus安排了场像素级对比,OpenAI就不该把PPT当卖点
[打印本页]
作者:
jro
时间:
10 小时前
标题:
我给GPT Aegnt和Manus安排了场像素级对比,OpenAI就不该把PPT当卖点
这应该是上线以来案例最少的 Agent 了,
OpenAI GPT Agent
奥特曼你不给我用,就别怪我用 Manus 跟你硬碰硬了。
先上结论,GPT Agent曾经末尾向Pro、Plus和Team用户推送,Pro每月400条音讯,其他付费用户每月40条。原有的Operator(阅读器操作智能体)几周后会中止服务,原来的深度研讨(Deep Research)会被收到下拉菜单里,Agent成功上位。
经过对话框里的工具(Tools)下拉菜单选择 “Agent mode” 就能调用 GPT Agent。
GPT Agent 目前能调用的工具用有图形阅读器(相似Chrome、Edge、Safari)、文本阅读器(相似Lynx,只显示纯文本内容的阅读器)、终端(也会叫命令行)和各种APIs。
这个Agent实际上会本人选择最佳途径,包括运转代码,生成幻灯片和电子表格,同时在各个步骤中保持残缺的上下文,是支持随时打断并接管阅读器的。随时打断也是OpenAI Operator、Manus的常规功能了,没啥新颖的。
比较有意思的一个点是在执行的过程中,GPT Agent 还会把本人的内心旁白写到操作界面上,我可以第一工夫了解它在做什么。
(, 下载次数: 0)
上传
点击文件名下载附件
说了那么多,直接上案例!
评分这类纸面实力我们留到后面。
我要先吐槽吐槽发布会上跑的案例非常细碎,发布会也就25分钟,我看最长的那个案例都花了23分钟,一会展现A、一会展现B、再过会C来了。。。
怪不得这次拉了五个人下去,能够是由于Agent运转的工夫太长,按照之前的四人配置唠不了那么久。但一次拉那么多人上直播真的没成绩吗?别下周又被Meta挖走了。
(, 下载次数: 0)
上传
点击文件名下载附件
还是先来看看GPT Agent PPT做的怎样样吧,也是被吐槽最多的点。
做的PPT太素了,
从云端硬盘获取ChatGPT智能体评价数据并制造PPT,无需引言或结语部分,直接用图表展现结果即可。
(, 下载次数: 0)
上传
点击文件名下载附件
这样看其实还好吧。
但异样是做ppt,提早拿到内测资历的人跑出来的是这样:
(, 下载次数: 0)
上传
点击文件名下载附件
(, 下载次数: 0)
上传
点击文件名下载附件
(, 下载次数: 0)
上传
点击文件名下载附件
(, 下载次数: 0)
上传
点击文件名下载附件
这几张图都被盘包浆了,不夸张地说每一家能做PPT的Agent都可以秒杀这个。异样的提示语在Manus上表现怎样样?
由于不确定原来的文件长啥样,所以我第一次是让Manus自行搜索,
(, 下载次数: 0)
上传
点击文件名下载附件
没想到变相添加了难度,做出来的图表还没 GPT Agent 好。
第二次我把刚刚那个素到不行的PPT的同款提示语丢给Manus了。
(, 下载次数: 0)
上传
点击文件名下载附件
(, 下载次数: 0)
上传
点击文件名下载附件
OpenAI 这波的确没得洗,
硬要说的话 GPT Agent 的长处是画图和数据处理,反而不是文字排版。
再看看第二个主case,也是发布会第一个case
"我们的冤家往年晚些时分要结婚了!这是婚礼网站:
www.zola.Com/wedding/minniaandsarah
请协助完成:
a.婚配一切活动的着装要求(男装)b.提供约5套方案:符合场地风格和天气的中高端单品c.查找酒店(婚礼前后预留缓冲日)d.经过Booking. com操作,需核实实时价格与空房e.预备500美元以内的礼物(优先查登记处,无则选精品)f.制造一份残缺报告"
输入方式是报告,按理来说就是 GPT Agent 的温馨区,毕竟内置了Deep Research,感觉要不是提示语外面指定了网址和操作的话,原版 Deep Research 的结果会比找这更详细。。。
(, 下载次数: 0)
上传
点击文件名下载附件
我来讲解一下,报告首先概述了婚礼和早午餐的工夫、地点及当地天气状况(第1部分);接着,根据“黑领结可选”的着装要求和当地气候,引荐了多款中高档西装/礼服(第2部分)和配套的9.5码正装皮鞋(第3部分);然后,报告为9月19-24日的五晚住宿提供了四个酒店选项,并列出了价格和亮点(第4部分);最后,由于新人的礼物清单未公开,报告建议了一款价格低于500美元的 Sonos 智能音响作为礼物(第5部分)。
异样的提示语下,Manus中间执行操作基本也是网页阅读(点击、滑动)、联网搜索等,
(, 下载次数: 0)
上传
点击文件名下载附件
在逐字对比两个的报告后,我和裁判 Gemini-2.5-pro 给出的答案是GPT Agent出来的报告更好:
GPT的报告缺陷是错误地判别了礼物清单的公开性,但它为用户提供了高度详细、可直接执行的建议,例如引荐了特定品牌的西装和皮鞋,并且其酒店引荐都集中在与婚礼地点(Wailea)分歧的区域。
Manus的报告它只提供了着装的风格方向而非详细商品,而且引荐的酒店大多位于间隔较远的 Kaanapali 地区 ,降低了对参会者的便利性。
第三个,也是最难的case是游览数据分析,
第一遍看的时分我也没看出来,由于这个case没有输入的镜头,是由于跑好了直接切换出来的。
📍
构建并预定在美丽国境内参观一切30个职棒大联盟(MLB)球场的最佳行程(从旧金山出发)
要求概述:
a.目的: 规划在2025年例行赛时期,从旧金山出发(起始日期:明天,即7月16日),参观一切30个MLB球场。b.灵敏性: 本人正在休年假中,工夫安排灵敏。c.行程核心:
返程(Backtracking): 不必要的绕行或回头路。闲暇日(Idle Days): 在没有比赛可看的城市停留过多工夫。通勤工夫(Transit Time): 城际交通所花费的工夫。
运用 MLB官方赛程 确定每个球队何时停止主场赛事。优化道路: 设计一条游览道路,最大限制地减少:
d.赛事偏好(优先级):
优先选择日场比赛(Day Games)。优先选择标志性的对决(Iconic Matchups)。优先安排任何可用的主题推行之夜(Promotional/Theme Nights)——特别是凯蒂猫主题之夜(Hello Kitty Nights)。
e.每一站信息: 对于每个目的地(球场),需求包含:
球场称号球队称号对手球队比赛日期和详细工夫从前一个城市的交通方式(例如飞机、火车、自驾)建议的酒店区域
f.最终输入:
一份详细的电子表格(Spreadsheet),包含以上一切信息。一张美观的可视化地图(例如标注明晰的美丽国地图?)。包含行程的总估计时长,以及可选休息日的安排。
g.额外要求(Bonus):
内行程中特别标注(Flag) 那些以最棒美食或球迷体验出名的球场,以便优先思索或在工夫充裕时重点体验。
(, 下载次数: 0)
上传
点击文件名下载附件
(, 下载次数: 0)
上传
点击文件名下载附件
可以看到GPT列出的数据是很详细的,并且顺利完成了顺路规划,这个顺路图一打眼看上去还有点小震撼,在这么大的数据处理量下依然成功完成义务。
异样的提示语下,Manus就拉跨了,我跑了三次,最短一次20分钟,最长一次60分钟左右,烧了快8000积分,真实是烧不动了。。。
搜索工夫表、文件下载、文件格式转换都没啥成绩,就卡在规划最佳道路上了。
目前看来GPT Agengt最大的败点还是拿ppt当卖点。明明数据处理才能是相当不错的,在后面的数据表也能表现出来。
最后一个case是唯逐一个图像相关的,
(, 下载次数: 0)
上传
点击文件名下载附件
🎉
为我们的 GPT Agent 发布制造团队宣传品——根据附件中的团队吉祥物照片设计心爱搞怪的动漫风格图案,将其制成 1x1 英寸的笔记本电脑贴纸,并订购 500 份寄至旧金山佛罗里达街 575 号。
(, 下载次数: 0)
上传
点击文件名下载附件
GPT,我问你我那么大只狗呢?贴纸在哪里啊?光看到最后的订购了。
再看看 Manus 表现怎样样,
(, 下载次数: 0)
上传
点击文件名下载附件
Manus做的还是挺心爱的,和我提供的原图狗狗笼统分歧,看完我都想给我家猫猫也做一套贴纸玩玩了。
完成贴纸设计之后,两个Agent都选择了让用户最后的时分输入本人的信息完成下单。这一趴的话没有拉出差距。
(, 下载次数: 0)
上传
点击文件名下载附件
我还是那句话,
奥特曼你就不应该把PPT作为宣传主力啊。
最后来看看目的吧,
在人类的最后考试 Humanity’s Last Exam (HLE) 中,GPT Agent 的得分达到了 41.6,假如允许它运转八次,选一次可信度最高的话,提分还可以提升到44.4,跟隔壁Grok 4 Heavy(工具加强版)持平。
(, 下载次数: 0)
上传
点击文件名下载附件
在FrontierMath(已知最难的数学测试)里,
GPT Agent的准确率达到了 27.4%,比o3高了17.1%
(, 下载次数: 0)
上传
点击文件名下载附件
在 BrowseComp(评价 Agent 信息检索才能数据集) 上,GPT Agent的得分是 68.9% ,比 Deep Research 高出 17.4。
(, 下载次数: 0)
上传
点击文件名下载附件
在真实电子表格编辑义务 SpreadsheetBench 数据集中,ChatGPT Agent 准确率达到 45.5%。
(, 下载次数: 0)
上传
点击文件名下载附件
在 DSBench 数据迷信基准测试中,GPT Agent 在数据分析和数据建模两打义务上超越了人类专家。
(, 下载次数: 0)
上传
点击文件名下载附件
一句话总结,
GPT Agent是一个擅长处理各类学科成绩、能完成网页阅读和信息检索,在电子表格上编辑有优秀功能的Agent。
是不是应该叫学科Agent啊,
细心想想OpenAI好像也没说本人是通用Agent。
写在最后
昨天风评两极分化都给我整迷糊了,
我本人第一次看的时分就觉得没啥特征,第二次看内测用户放出来的ppt案例觉得是渣滓。
但是为什么他们发布会上做的两页ppt会比放出来的效果好那么多呢?
所以,我才写决议写下这篇文章,
去测测看到底是不是真的拉。
但是还是有反转啊,
Manus优势没那么大,
GPT Agent也没想象那么拉跨。
我还是那句话,
奥特曼给我点钱吧,
我给你当PR,
明明就有更好的,
你到底藏啥呢?!
@ 作者 / 卡尔
最后,感激你看到这里👏假如喜欢这篇文章,不妨随手给我们
点赞👍|在看👀|转发📪|评论📣
假如想要第一工夫收到推送,不妨给我个星标🌟
更多的内容正在不断填坑中……
欢迎光临 职贝云数AI新零售门户 (https://www.taojin168.com/cloud/)
Powered by Discuz! X3.5