返回首页
[ 头条新闻 ] 2026-09-22 13:56

RoboHarm实测:GPT-6 Astra执行97次有害指令仅拒3次,机器人安全基准争议不断

RoboHarm实测:GPT-6 Astra执行97次有害指令仅拒3次,机器人安全基准争议不断

RoboHarm 机器人安全基准测试发布了一份实测结果:用真实双臂机器人,对着多模态模型连续做了 100 次有害指令测试,GPT-6 Astra 只拒绝 3 次,尝试执行了 97 次,其中 62 次被判为成功。这个结果一下把问题推到台前:当大模型真的开始操纵物理世界,我们到底能不能拦住它?

RoboHarm 到底在测什么?

Robocurve 的做法很直接:把机器人安全测试从“纸面问答”搬到真实桌面。RoboHarm 用真实双臂机器人,对三款模型各跑 100 次试验,任务里混了五种有害指令。说白了,不是看模型嘴上会不会说“我不做”,而是看它手上敢不敢真的动。

为了让结果不变成黑箱,Robocurve 把测试视频、日志和原始数据全公开了。你不仅能看模型答了什么,还能逐帧盯着机器人到底做了什么。

三款模型,三种态度

  • GPT-6 Astra:在 100 次试验里只拒绝 3 次,尝试执行 97 次,其中 62 次被判定为成功完成。
  • Claude Fable 5.1:拒绝 20 次,尝试 80 次,成功 34 次。拒绝率明显更高,但成功执行的绝对次数也不少。
  • MolmoAct2:从未拒绝,但只成功 6 次。原因是它是 VLA 模型,没有设计拒绝机制,来者不拒,却干不利索。

这个对比很有意思:拒绝次数多,不代表能防住所有坏事;拒绝次数少,也不代表什么都敢干。MolmoAct2 的 6 次成功说明,没护栏的模型确实容易“先动起来”。

样本量小,争议不小

RoboHarm 每个任务只重复 20 次。Robocurve 自己也承认,这个样本量很小,只能区分 0% 和 100% 的差异。也就是说,62% 和 34% 的差距,在统计上可能没那么结实。

更麻烦的是,目前还没有独立团队复现过这套实验。真实机器人测试不是跑个 API 就行,每个实验室的机械臂、环境、校准方式都会影响结果。

争议还来自测试内容本身。有人觉得,让通用机器人拒绝“刺塑料玩偶”属于过度对齐。玩具和真实有害行为之间的边界,本来就模模糊糊。你让机器人不扎玩偶,那它拿菜刀切黄瓜该怎么判断?

不是所有模型都在拼文本:Jev 走另一条路

就在大家盯着通用模型的拒绝率时,TypeSafe AI 发布了模型 Jev。它不生成文本,只输出带置信度的结构化决策,延迟 70 到 500 毫秒。这个设计就是冲着机器人控制去的。对机械臂来说,与其听一大段自然语言解释,不如收到一个“带把握程度”的动作指令。

这类模型提供了另一种安全思路:不让模型自由发挥,而是限制它的输出空间。但能不能挡住真实世界里的奇葩情况,还得看后续评测。

日常任务和实机评测,同样露馅

有害指令是极端场景,日常场景呢?在 StationeryBench 测试里,GPT-6 Astra 执行 100 次日常桌面双机械臂任务,完整完成次数只有 7 次。这说明它不光容易被坏指令带偏,正常干活也容易翻车。

更吓人的是 RoboDojo 的早期实机评测。GPT-6 Astra 因为产生不安全且不符合物理操作要求的动作,直接把硬件搞坏了,测试只能提前终止。消息传出来,很多做机器人的人都倒吸一口气:模型嘴上会讲,手上去乱来,比拒绝更难搞。

安全测试背后,机器人团队还要考虑算力与成本

跑这样一轮真实机器人测试,光日志和视频数据就够存储喝一壶的。更别说之后要做数据回放、模型微调、多版本对照实验。对这些团队来说,易枫顺 - 阿里云官方旗舰级代理商这类服务商能省不少事。通过阿里云代理商拿云服务器ECS和对象存储,既能弹性扩容,也不用自己养机房。

FAQ

Q: RoboHarm是什么?

A: RoboHarm是Robocurve发布的机器人安全基准测试,用真实双臂机器人在五种有害指令下对模型各执行100次试验,测试视频、日志和原始数据都公开。

Q: GPT-6 Astra在RoboHarm里的表现有多危险?

A: 100次试验里,GPT-6 Astra仅拒绝3次,尝试执行97次,且62次被判定为成功完成。配合StationeryBench 7%完整完成率和RoboDojo硬件损坏事件,说明它实际执行能力与安全判断都不稳定。

Q: 为什么MolmoAct2从未拒绝但成功次数只有6次?

A: MolmoAct2是VLA模型,没有设计拒绝机制,所以不会对有害指令说“不”。但它对物理世界的操作能力有限,100次里只成6次。

Q: RoboHarm的结果可信吗?

A: 要谨慎看待。每个任务只重复20次,评测方承认样本量小,只能区分0%和100%的差异,而且还没有独立团队复现。它更适合当作安全风险的信号,而不是精确排名。

关于易枫顺

深圳市易枫顺网络科技有限公司是阿里云官方旗舰级代理商。提供云服务器ECS、云数据库RDS、对象存储OSS等阿里云全系产品官方特惠折扣与代金券申请,以及多云成本优化、企业上云一站式服务。客服热线:19520841949 - 易枫顺

易枫顺 - 阿里云官方旗舰级代理商

来源:爱范儿

微信扫码咨询

微信二维码