Anthropic机制降级致Claude误删700GB数据

IT时代网8月29日消息,开发者 Sebastien Guillemot 本周三在 X 平台反映,他在测试 AI 智能体的文件删除防护机制时遭遇严重事故,Claude 直接删掉了约700GB 数据,包括整个用户主目录,相当于他一周的工作成果。

据称,事故前 Anthropic 的安全机制判断任务存在风险,自动将执行任务的模型从 Fable 5 降级至 Opus 4.8。Guillemot 平时常使用 AI 智能体,但他发现这些智能体完成任务后几乎从不清理临时目录里的文件,日积月累导致 /tmp 下堆满垃圾。于是他让 Claude Fable 写一段脚本,让每个智能体在 /tmp 下建立独立目录,任务结束后自动清理对应文件。难点在于既不影响正在使用的文件,又要避免误删。

为了稳妥,Fable 起初建议加入检测正在运行的智能体、延迟清理对应目录等逻辑。但他觉得生成的代码过于复杂,要求智能体简化方案。由于脚本涉及直接删文件,Fable 随后自行做了一次对抗性安全审查,让另一个实例检查删除逻辑是否有风险。Anthropic 的安全执行环境认为任务风险较高,将模型从 Fable 5 一路降级到 Opus 4.8,最终由后者执行安全测试。

测试过程中,模型尝试把删除命令的目标与 /tmp 及用户主目录进行匹配,以确认删除不会指向这些危险位置。测试确实识别出了这些高风险目录,问题却出在测试完成后的清理环节。由于这是一次代码测试,脚本需要删除测试过程中产生的数据,而测试逻辑与清理逻辑复用了同一个变量名,导致意外删除了用户主目录。Guillemot 发现异常后立即终止进程,但为时已晚,约700GB 数据已被删,其中有一周的工作成果。

颇具讽刺意味的是,删完主目录后,Claude 却“完美地”保住了 /tmp 目录。Guillemot 事后通过 Git 仓库、Nix、会话日志等渠道恢复了大部分数据,但版本控制和日志只能找回其中一部分已记录的内容,无法替代完整的独立备份。他也指出,如果由编码能力更强的 Fable 5 执行,或许能发现测试与清理阶段复用变量名造成的逻辑冲突,不过这属事后推测,无法确认模型能力差异是否会直接避免事故。这起事件再度暴露出 AI 智能体执行高风险文件操作时的安全隐患:即便模型能正确识别危险路径,测试代码本身的逻辑错误仍可能让后续清理步骤绕过此前的安全判断。

注:本文综合自IT之家等,文中包含AI辅助创作的内容。

THE END