Anthropic自曝生物武器过滤器曾失效近一年

IT时代网8月16日消息,Anthropic在8月14日发布的最新安全报告中披露,公司用于拦截化学、生物武器相关危险请求的部分安全分类器曾长期失效。这一问题导致2025年5月至2026年4月期间,外部承包商提供人工反馈时产生的大量请求未经过滤。

Anthropic表示,内部调查目前没有发现相关请求被实际用于滥用的证据。该机制属于公司针对化学、生物、放射性及核武器风险设置的多层安全措施之一,会对用户输入与模型输出进行实时分析,识别风险时阻止模型提供可能用于危险行为的信息。

此次暴露的问题与外包环节有关。报告显示,约5万名承包商在相关时间段内产生了约1.33亿次对话,而这些流量在近一年里没有经过生物安全分类器的拦截。Anthropic称,承包商主要由外部供应商负责审核,筛查流程存在不足,公司随后提高了对外部承包商的相关要求。

事实上,Anthropic今年已将生物安全防护纳入AI安全体系。2025年5月启用AI安全等级3(ASL-3)防护措施,2026年7月公布Claude Fable 5相关安全措施时再次强调了生物与化学领域的风险。公司也承认,过于严格的安全分类器可能误伤正常科研活动。

注:本文综合自IT之家等,文中包含AI辅助创作的内容。

THE END