LOADING

AI智能体的炒作与现实:GPT-4都撑不起,现实任务成功率不到15%

2024/05/28 机器之心
20

AI智能体的炒作与现实:GPT-4都撑不起,现实任务成功率不到15%

AIGC动态欢迎阅读

原标题:AI智能体的炒作与现实GPT-4都撑不起,现实任务成功率不到15%
关键字:智能,任务,现实,模型,上下文
文章来源:机器之心
内容字数:5195字

内容摘要:


机器之心报道
编辑:亚鹂AI 智能体的宣传很好,现实不太妙。随着大语言模型的不断进化与自我革新,性能、准确度、稳定性都有了大幅的提升,这已经被各个基准问题集验证过了。
但是,对于现有版本的 LLM 来说,它们的综合能力似乎并不能完全支撑得起 AI 智能体。多模态、多任务、多领域俨然已成为 AI 智能体在公共传媒空间内的必须要求,但是在具体的功能实践中所展现的真实效果却差强人意,这似乎也再次提醒各个 AI 智能体初创公司以及大型科技巨头认清现实:脚踏实地一点,先别把摊子铺得太大,从 AI 增强功能开始做起。
近日,一篇就 AI 智能体在宣传和真实表现上的差距而撰写的博客中,强调了一个观点:「AI 智能体在宣传上是个巨人,而现实却很不妙。」
不可否认的是,自主 AI 智能体能够执行复杂任务的前景已经引起极大的兴奋。通过与外部工具和功能的交互,LLMs 可以在没有人为干预的情况下完成多步骤的工作流程。
但现实证明,这比预期的要更具挑战性。
WebArena 排行榜(一个真实可复现的网络环境,用于评估实用智能体的性能)对 LLM 智能体在现实任务中的表现进行了基准测试,结果显示即使是表现最好的


原文链接:AI智能体的炒作与现实:GPT-4都撑不起,现实任务成功率不到15%

联系作者

文章来源:机器之心
作者微信:almosthuman2014
作者简介:专业的人工智能媒体和产业服务平台