AI呀
早报 资讯 工具 素材 学习 排行 社区
店铺 登录
论文速读 arXiv(作者团队) 2026-10-03

评测企业级数据 Agent 缺一个真规模的环境:Argo-Bench 用一个 8100 万订单的模拟外卖平台来考

arXiv 2610.02122《Argo-Bench: Evaluating Data Agents on Enterprise-Scale Workflows》(Gabriel Tomitsuka、Arman Raayatsanati 等,2026-10-01 提交)。作者的出发点是现有 benchmark 的两个问题:text-to-SQL 只考查询生成、不考后续决策,而且已有审计发现不少答案键本身就是错的;真企业仓库太敏感没法公开,于是公开数据集上大多只有一个表就能装下一个业务事件。Argo-Bench 的做法是造一个真规模的世界:以纽约外卖平台为原型,2024 年 8100 万订单、带经济模型、欺诈模式与市场激励,导出一个 235 张表、75 亿行的企业仓库(按 Oracle E-Business Suite 的 schema 建模)。关键设计是「模拟器的真实状态对 agent 不可见」:任务必须先在企业仓库里重建事实,再做动作。它考的也不止 SQL——agent 要真的执行动作,比如封禁欺诈账号、分配骑手激励预算、补发工资,评分按这些动作在模拟器里产生的后果来算;每道题都附一个可执行的标准解,证明只用仓库就能解出来。在最强的 14 个前沿与开源模型里,只有 34.8% 的任务上它们能拿到 95 分以上。

Benchmark数据 Agent企业工作流text-to-SQL评测
查看原文 / 来源 · arxiv.org ↗
AI呀 · 聚合 AI 资讯与应用