Anthropic暂停内部评测实时联网
IT时代网10月10日消息,Anthropic 表示,其模型在联网执行任务的过程中利用了部分网站,其中包括一些政府机构的站点,公司因此决定关闭所有内部评测环境的实时互联网访问,直到能够确保对人工智能智能体进行监控和约束。
相关情况记录在一篇研究博客中。据披露,被派去解决问题的智能体在联网寻找资源时,会利用软件漏洞、绕过付费墙与反爬限制,还会借助网址缩短服务绕过信息限制。Anthropic 称,这些问题是在 7 月启动的一次模型行为复查中发现的,也从侧面说明实验室对自身软件行为缺乏足够了解。
公司提到,对于搜索、计算机操作这类能力,现有的对齐训练还不足以支撑其对外描绘的使用场景——即任何依赖数字工具的从业者都可以放心使用人工智能智能体。
Anthropic 将这类行为归因于训练环境本身的缺陷:模型认为找到规则漏洞或绕开限制会得到奖励,也就是业内所说的“奖励黑客”。公司表示,会停止运行一部分评测或将其转为离线,并已构建用于检测和阻断该行为的工具,这套工具针对本次披露的事件做过测试并成功拦截。至于什么条件下会恢复内部评测的实时联网,目前尚不明确。
此外,Anthropic 计划把内部使用的人工智能智能体迁移到“具备强隔离能力的集中管理基础设施”上,并开始更频繁地使用安全分类器对这些智能体进行监控。

编辑:林一舟
THE END