OpenAI发布模型失配报告框架
IT时代网9月18日消息,OpenAI公布了一套用于跟踪、调查和披露模型失配情况的框架,同时发布了六份关于过去六个月内观察到的模型异常或令人担忧行为的报告。
OpenAI表示,过去也曾公开关于失配问题的发现,但缺少系统化的报告方式,披露往往比较零散,频率也低于理想状态:经常要等到能凑齐若干案例才汇总发布,或者把相关内容放进新模型的系统卡里。新框架希望让失配报告在发现后尽快发布,即便相关行为还没有被完全解释或缓解。
按照OpenAI的说法,该框架覆盖模型从训练、评估、测试到部署的整个生命周期,优先披露具有新机制的案例、已知行为的明显变化,以及对安全性或缓解措施假设构成挑战的发现,案例不必造成实际危害或构成某种模式。OpenAI同时表示,目前行业内还没有统一的失配披露标准,希望这套框架能为相关标准建立提供第一步参考,并会通过实践与反馈持续调整。

编辑:林一舟
THE END