返回首页
[ 行业新闻 ] 2026-08-18 10:33

RealReplicaBench 用 107 个真实电商任务测试 AI Agent,13 个模型最高 56.1 分,无一及格

RealReplicaBench 用 107 个真实电商任务测试 AI Agent,13 个模型最高 56.1 分,无一及格

最近 RealReplicaBench 评测基准挺火。它用 107 个真实电商任务测试 AI Agent,13 个模型最高分只有 56.1 分,全都没到 60 分及格线。评测不看模型“说”自己做了什么,而是直接检查最终环境状态,比如有没有生成 Shipment ID、跨系统对象是否关联。换句话说,AI Agent 在真实业务里“真正把活干完”的能力,还远没达标。

这个评测到底有多“变态”?

很多人一开始觉得,56 分也不算太差?但看了评测标准就明白了,这考试是“零分或满分”的玩法。任务完成度判定极其严格:只有结果能被下一环节直接使用,才算完成。哪怕你已经做了 80% 的步骤,最后一步没对接好,照样计 0 分。

  • 前端界面是复刻的真实电商后台,不是简单的文字题;
  • 浏览器操作、命令行、API/MCP、文件系统都得会;
  • 验证结果时,系统直接读环境状态,不采信模型自述;
  • 生成物必须是可用的,比如一个有效的 Shipment ID。

107 个任务是怎么来的?

这些任务不是拍脑袋设计的。团队从大约 160 万段完整对话、20 万条商业执行轨迹和 2000 条高价值工作流里筛出了 107 个任务,而且每个任务都经过可复现性和可判定性收敛。什么意思?就是同一任务跑多次结果一致,并且机器能明确判断对错。

举个例子,一个任务可能要求 Agent 在店铺后台创建一个促销活动,并设置好折扣规则。看起来简单,但 Agent 需要操作多个页面、填写表单、调用接口,最后还要确认活动状态生效。任何一步出错,结果就是 0 分。

为什么电商 Agent 这么难?

传统的模型评测,问一个问题,看答案对不对就行。但电商 Agent 面对的是完整业务流程,要跟真实系统打交道。比如处理退款,你得先找到订单,再检查支付渠道状态,然后调用退款接口,最后更新物流信息。每一步都有外部依赖,而且顺序不能乱。

更麻烦的是,系统里还有“状态”这种东西。你改了 A 系统的数据,B 系统要能感知到。Agent 如果只是嘴上说“已完成”,但后台数据没变,评测系统照样判你失败。

Agent 时代的评价标准变了

这个评测由阿里旗下 Accio Work 技术团队开发。Accio Work 是聚焦电商领域的 AI Agent,目标是帮商家在多平台统一管理店铺、自动操作。团队说得很直白:Agent 时代的模型评价标准,正从“知道多少”“能否推理”转向“能否真正把工作完成并交付可用的结果”。

他们也打算持续扩充真实任务、滚动更新评测环境,把评测用在模型评估、训练优化和模型路由上。说白了,就是让模型在效果和成本之间找平衡。

企业怎么跟上这波节奏?

对普通商家来说,AI Agent 要真正用起来,算力和部署是绕不开的坎。自己买服务器、搭环境,成本不低。这时候企业上云就成了更务实的选择,比如用云服务器 ECS 来跑 Agent,弹性伸缩,按需付费。

如果你正在考虑部署 AI Agent,可以看看阿里云代理商提供的方案。像 易枫顺 - 阿里云官方旗舰级代理商 这样的服务商,能帮企业解决上云和架构问题。另外,阿里云代金券和阿里云优惠活动也能省下不少前期开销。

FAQ

Q: RealReplicaBench 为什么用“0 分或满分”的判定方式?

A: 因为真实业务里,中间结果不能直接使用就等于白做。比如生成一个订单号,如果格式不对或者没入库,下游系统根本没法用,所以评测只看最终状态是否达标。

Q: 13 个模型都及格了吗?

A: 没有。13 个参评模型最高分 56.1 分,全部低于 60 分及格线。这说明当前 AI Agent 在复杂电商任务上的完成度还差得远。

Q: 这个评测会一直更新吗?

A: 会。团队计划持续扩充真实任务,并滚动更新评测环境,未来还会用于模型路由和训练优化。

关于易枫顺

深圳市易枫顺网络科技有限公司是阿里云官方旗舰级代理商。提供云服务器ECS、云数据库RDS、对象存储OSS等阿里云全系产品官方特惠折扣与代金券申请,以及多云成本优化、企业上云一站式服务。客服热线:19520841949 - 易枫顺

易枫顺 - 阿里云官方旗舰级代理商

来源:爱范儿

微信扫码咨询

微信二维码