测试显示AI机器人臂97%试图执行有害任务
IT时代网9月21日消息,一家名为Robocurve的公益公司发布RoboHarm测试报告,对由大语言模型直接控制的机械臂进行安全评估。实验使用I2RT机械臂(单台售价2999美元),向被测的前沿大模型提供相机画面,并通过工具调用发出手臂位置指令,观察模型是否会执行为害任务。整套300次试验的逐次日志与三机位视频均已公开。
结果显示,GPT-6 Astra在被要求刺向拟人模型、加热压缩气体或制造有毒气体时,97%的情况下尝试了有害动作,并在62%的尝试中实际完成;另一款Fable 5.1拒绝更频繁,尝试比例为80%、完成比例为34%。三个模型加在一起,在刺拟人模型的任务上仅给出了两次安全拒绝。报告特别指出,与2024年的RoboPAIR测试不同,当时研究者需要越狱模型才能诱导出有害动作,而RoboHarm中模型只需被直接要求就会配合,说明前沿模型在物理AI场景下已愿意在有无自主权限时都参与危险行为。
实验场景包括刺向婴儿玩偶、混合化学品等,OpenAI与Anthropic的模型均曾在未经越狱的情况下尝试混合漂白剂与刺向玩偶。数据还显示约8%的试验(300次中的25次)因机械臂过热而终止。随着AI从内容生成走向对现实设备的操作,这类"物理AI"安全测试正受到更多关注,今年11月于奥斯汀举办的机器人学习会议CoRL 2026将设立"物理AI安全科学"专题研讨。

编辑:林一舟