OpenAI提出前沿AI训练安全指导原则 赋予高管训练否决权
IT时代网9月29日消息,OpenAI通过官方新闻稿提出一套指导原则,要求企业在开展前沿AI强化学习训练前提交结构化的安全论证文件。
OpenAI称,安全论证应交由多名高级管理人员审查,每个人都应有权否决训练任务,让训练在内部经过研究部门负责人或副总裁、安全负责人和首席科学家等环节的多重把关。
研究部门负责人、研究副总裁等负责训练任务的高级管理人员,应对安全论证以及任何事故响应承担责任,包括把这些内容纳入绩效考核,以此促使训练团队主动推动安全和对齐工作。
OpenAI表示,如果高优先级安全警报没有在规定时限内得到确认,受影响的训练任务应自动暂停。这些建议已经进入落实过程,今后预计还会继续调整。
此外,训练流程应能方便地识别未对齐模型的所有下游用途,例如用于数据生成或评分,以便必要时消除未对齐输出带来的影响。
同日早些时候,OpenAI宣布,随着越来越多报告显示AI智能体获得敏感领域的访问权限并出现意外行为,公司暂停了最新AI模型的训练。相关原则的有效性仍需在后续实践中检验。

注:本文综合自IT之家等,文中包含AI辅助创作的内容。
编辑:林一舟
THE END