Anthropic携手埃森哲开展AI嵌入式评估
IT时代网9月19日消息,Anthropic宣布与埃森哲就前沿人工智能的独立评估达成合作。该合作由埃森哲旗下专注人工智能业务的 Faculty 部门牵头,具体工作涵盖模型评估、红队测试、对齐性评估以及安全护栏测试。
这一安排对应 Anthropic 首席执行官此前在《We Must Pace the Frontier》一文中作出的承诺,即把评估人员嵌入人工智能企业内部。按照设想,嵌入式评估者将在公司内部办公,拥有接近正式员工的访问权限,可以观察模型在训练中的形态变化,跟踪决定模型构建与部署方式的各项决策,并直接与员工对话。
Anthropic 表示,从这样的位置出发,评估者能够判断一家企业的实际运作状况,核验其是否兑现了安全承诺,并找出容易被忽略的盲区,同时也可以报告事件,向公众提供更有依据的收益与风险说明。不过公司强调,独立嵌入式评估不会减轻自身责任,模型安全仍由 Anthropic 负责,评估的作用是让这些承诺变得更可验证。
资金投入方面,Anthropic 与埃森哲各自预计在未来五年内向该领域投入至少 10 亿美元,用于建设相关能力。两家公司也坦承,嵌入式评估属于新生事物,评估者应当接触哪些信息、以何种方式披露发现,目前尚无统一标准,独立评估的长期资金来源同样没有成型。Anthropic 认为长远看应由集合资金或政府渠道承担,相关机制落地之前,将先直接为埃森哲的评估工作提供经费。
此外,Anthropic 还在与 METR 等非营利评估机构沟通,尝试用对方自有资金试点嵌入式评估的部分环节。这项合作并不排他:Anthropic 称未来数周将公布更多合作评估机构,埃森哲也会以类似角色与其他人工智能开发者展开合作。

编辑:林一舟