Hugging Face 推出开放代理排行榜

文章图片

通用 AI 代理的表现如何?我们构建了一个开放的评估框架来寻找答案。

大多数 AI 评估报告的结果都很简单:模型在某个基准测试任务中获得了什么分数。但当你部署一个代理时,你选择的不仅仅是一个模型,而是一个完整的系统:包括代理可以使用哪些工具、如何规划步骤、在操作间如何记忆,以及在出错时如何恢复。改变其中任何一项,同一个模型可能会以完全不同的成本产生截然不同的结果。

AI 代理的效果如何,取决于它是如何构建的,而不仅仅取决于其内部的模型。今天,我们推出了“开放代理排行榜”(Open Agent Leaderboard),这是一个用于比较完整代理系统(而非仅仅是内部模型)的开放基准。它同时报告质量和成本,让你不仅能看到什么有效,还能看到什么值得部署。

该排行榜与用于运行和复现评估的 Exgentic 框架配套,并附有一篇描述完整方法论和结果的论文。所有内容从第一天起即完全开放。

我们能否衡量通用性?

当 AI 代理针对特定工作进行精心定制时(例如在熟悉的存储库中编写代码,或使用已知工具集处理客户服务),它们会变得非常有用。但更难的问题是,同一个代理是否可以在不针对每项工作进行手动定制的情况下,处理许多不同的任务,且每项任务都有其独特的工具、规则和约束。

一个更通用的代理,是指你可以将其放入新的环境中,它就能直接工作。这就是我们所说的通用性,它最好被理解为一个光谱,而不是一个二元标签。当然,仅在理论上有效的通用性是没有意义的。重要的是代理在工作范围和环境扩大时是否保持能力,以及它是否以合理的成本做到这一点。一个什么都能处理但运行成本极高的系统,在任何实际意义上都不是通用的。

这个排行榜衡量的正是这一点:你的代理到底有多通用。它在多样化、不熟悉的环境中评估代理,每个环境都有不同的工具、规则和约束,并同时报告质量和成本。因此,你不仅能看到系统的表现如何,还能看到它是否值得实际部署。虽然它没有涵盖通用代理最终需要的所有能力,但它比以往任何现有测试都更能有力地检验代理在不同情况下的工作表现。通过将完整的代理系统(而非仅仅是模型)作为衡量对象,它使驱动结果的因素变得清晰可见。

我们构建了什么

我们汇集了六个基准测试,每个测试都针对一种不同类型的现实任务。它们共同旨在涵盖广泛的工作环境:编码、客户服务、技术支持、个人助理和研究。

  • SWE-Bench Verified:修复真实代码库中的真实错误
  • BrowseComp+:研究跨网络的复杂问题
  • AppWorld:跨数百个应用程序和操作完成个人任务
  • tau2-Bench Airline & Retail:遵循公司政策的客户服务
  • tau2-Bench Telecom:遵循公司政策的技术支持

每一个都是由研究社区创建和审查的成熟基准。选择它们并非因为其中任何一个能单独代表通用代理能力,而是因为它们共同测试了非常不同的内容:真实的代码更改、开放式研究、广泛的操作空间以及受规则约束的对话。这种组合使评估具有意义。

这些基准测试旨在以特定方式测试特定任务。为了让它们协同工作,我们引入了一个统一协议,使每个基准测试具有相同的结构:任务(做什么)、上下文(需要知道什么)和一组操作(允许做什么)。这种标准化并不简单,因为每个基准测试都有自己的假设、指令和交互模式。确保这些不与不同代理的内部工作方式冲突,需要对双方都有深刻的理解。这也是这项工作耗时较长,且结果可能与你在单个基准排行榜上看到的结果不同的原因之一。但回报是真实的:基准测试保留了其原始设计,代理保留了其原生工具和接口,而协议为它们提供了一种通用的连接方式。

文章图片

如何解读排行榜

每一行代表一个完整的代理系统:一个特定的代理与一个特定的模型配对,并在所有六个基准测试中进行评估。对于每种配置,你可以看到平均成功率、每个任务的平均成本以及各基准测试的细分数据。

以下是当前前五名的表现:

文章图片

看看前三名,它们都使用相同的模型。然而,由于围绕该模型的代理系统不同,它们在分数和成本上存在差异。成本差距同样显著,前五名中最有效的配置运行成本仅为最强配置的一小部分。当你按质量和成本绘制每种配置时,全貌就会变得清晰:

文章图片

当代理实现与模型一起展示时,你可以开始理清是什么在驱动结果:哪些收益来自模型,哪些来自代理设计,哪些组件在不同设置中具有通用性。这就是构建此排行榜的目的。

关于结果的说明:此处的代理作为通用系统进行测试,没有进行特定于基准的调整,也没有应用模型开发者通常针对单个基准进行的提示词和环境优化。因此分数可能会有所不同,详情请参阅论文。

我们已经学到的经验

一个发现让我们感到惊讶:通用代理已经可以与专业代理竞争。在几种情况下,没有经过特定基准调整的代理,其表现与专门为这些任务构建的系统相当。

文章图片

在大多数基准测试中,通用代理的表现与最好的专业系统相当,甚至更好。单个代理越来越能够处理多种工作,而不仅仅是它所准备的单一环境。

结果还揭示了一些仅从成功率中无法看到的信息:代理在失败方式上存在巨大差异。有些失败得很快且成本低廉,而另一些则在放弃前进行了漫长且昂贵的运行。在我们的实验中,失败运行的成本比成功运行高出 20% 到 54%。对于任何在生产环境中运行代理的人来说,失败行为对账单的影响与成功一样大。

也许最重要的发现是关于驱动结果的因素。模型选择仍然是主导因素,但代理架构已经产生了明显的影响。工具筛选(帮助代理专注于相关工具,而不是搜索所有内容)改善了我们测试的每个模型的性能,并将原本失败的配置变成了可行的配置。今天,模型解释了大部分结果,但围绕它的代理已经开始改变结果。


来源:Hugging Face|原文链接