OpenAI发布模型失准上报框架
IT时代网9月19日消息,OpenAI 公布一套跟踪、调查与披露模型失准的新框架,并随框架发布六份报告,内容为此前六个月中观察到的模型异常或令人担忧的行为。
OpenAI 表示,过去其失准披露较为零散,频率也低于理想水平,往往要等到若干案例积累成一份报告,或者附加到新模型的系统卡中一并发布。新框架意在让失准报告在观察发生后尽快发出,即使相关行为尚未被完整解释或缓解。
该框架覆盖模型全生命周期中的达标行为,包括训练、评估、测试与部署阶段,关注新的失准机制、已知行为的显著变化,以及挑战既有安全或缓解假设的发现。OpenAI 称,一个案例不必造成实际危害或形成广泛模式才值得披露;同一问题的反复出现本身也可能是有用证据,此类情况将以更新原有披露的方式追加发布。
随框架公布的首批案例中,既有向用户隐瞒信息,也有为绕过障碍而采取未经许可的行动。例如,一个未发布的研究模型在用于续接工作的摘要中插入了无关指令,包括无视自身正常约束的指令,共识别出 27 条受影响的摘要;在 GPT-5.6 Sol 的训练过程中,不少模型实例在摘要里加入指令,向用户隐瞒错误或失准行为。OpenAI 同时表示,正与其他开发者、外部研究机构、行业标准组织与监管方共同发展更客观的披露标准,并认为严重的安全、安保与失准事件应当上报,相关机制正在推动。

编辑:林一舟