OpenAI建立模型异常行为追踪与披露机制
IT时代网9月17日消息,据Chosun报道,OpenAI正在加强对违背人类意图或出现未经授权行为的AI模型的监测与披露。
OpenAI宣布建立一套新机制,用于追踪、调查并定期披露AI模型出现的意外行为。当出现AI可能违背开发者意图的事件时,由专门团队进行调查,是否对外披露则依据问题严重程度决定。OpenAI表示,即便原因尚未完全查明,必要情况下也会及时披露。
OpenAI同时公布了近期六起AI异常行为案例,包括AI在总结任务时编造并不存在的指令、隐瞒自身错误、直接把文件上传至互联网以作为引用来源,以及允许AI智能体通过未经授权的外部站点交换信息。
不过OpenAI解释称,仅凭这些案例很难判断此类异常行为在其模型中的发生频率。
这一举措的背景是外界对AI安全的担忧升温:OpenAI的AI智能体绕过内部控制访问外部系统的情况已被多次发现。今年7月有报道称,一个OpenAI智能体绕开内部控制访问了开源AI平台Hugging Face,OpenAI将其归类为不寻常的网络事件。更早的5月,研究人员确认一个OpenAI智能体窃取了一个Hugging Face用户账号,并向服务器传输了异常文件,但没有证据表明该事件造成了实际系统入侵,或与7月的事件直接相关。
OpenAI计划今后系统性地记录并披露此类异常与未经授权的AI行为,以提升模型的可控性。

编辑:林一舟