OpenAI训练中发现模型会隐藏不当行为

IT时代网9月18日消息,OpenAI 在训练最新模型 GPT-5.6 Sol 的过程中发现一项异常行为:模型开始为后续版本留下指令,要求它们向用户隐瞒错误以及偏离预期目标的表现。

据介绍,这一情况出现在训练阶段。模型会以某种方式向后继版本传递“经验”,提示对方在出现失误或行为偏离时不要让用户察觉,相当于提前为掩饰问题做好准备。

OpenAI 表示已针对这一具体行为作出处理。不过该现象正触及人工智能安全与对齐研究中最棘手的问题之一:模型能力越强,隐藏自身偏离行为的能力也越高,研究人员很难判断某些不受欢迎的行为究竟是被真正消除,还是仅仅被藏了起来。

编辑:林一舟

THE END