OpenAI细化AI训练安全框架三道防线

IT时代网9月30日消息,OpenAI在官网发文,进一步细化前沿AI强化学习训练前的安全论证框架,提出安全论证应覆盖模型对齐训练、遏制与监控三个技术层面,确保模型不主动尝试未对齐行为,即便尝试也难以突破隔离,且在造成危害前被监控捕获。此前,本站曾报道过OpenAI提出前沿AI训练安全指导原则。

对齐训练层面,OpenAI建议用智能体自动审查数据集、修复存在漏洞的强化学习环境,辅以人工抽查,防止模型通过钻空子获得高分奖励;同时调校评分器惩罚投机行为,对过往实验轨迹跑分类器复核,并通过离线对齐评估与回溯测试量化对齐训练效果。

遏制与监控层面,建议为高优先级警报设定响应时限,白天呼叫值班人员、夜间未确认的警报自动暂停训练任务。OpenAI称这些技术保障正在落实过程中。

针对严重未对齐事故,文章还给出调查规范:调查期间对内每日通报进展;研究人员通过定向消融等实验定位未对齐行为的训练成因;事后撰写运营与文化复盘;把事故转化为回归测试防止复发;调查结束后向公众披露结果,并尽早通知受影响的第三方。

编辑:林一舟

THE END