Goodfire推出智能体内部监控 成本低于传统方案
IT时代网10月9日消息,可解释性研究公司Goodfire推出一套新的AI智能体监控方案:不再让另一个模型逐字复读写出的内容,而是直接读取模型在运算过程中的内部信号,以此判断智能体是否越界。
目前常见的做法,是安排第二个AI模型在旁边“读一遍”被监控模型的输出。当智能体连续运行数小时、处理的文本量相当于几部小说时,这种做法的成本会迅速上升。Goodfire的新方案改为在模型工作过程中读取其内部状态,相关能力已面向模型托管平台Baseten的客户开放。Baseten旗下实验室上月宣布与Goodfire、Hugging Face建立安全合作。
这套机制的工作方式类似机场安检:名为探针的小型检测器在智能体每一步运行时读取模型内部信号,相当于人人都走的安检门;只有当探针发出警报,才会由一个独立的AI模型做进一步检查,相当于人工复检。客户可以自行选择要监控的风险类型,包括攻击性黑客行为、化学与生物武器滥用以及奖励欺骗,并设定触发后的自动响应:记录事件、转交人工审核,或直接拒绝该请求。
成本是这一方案的主要卖点。多数AI监控工具需要独立模型把被监控模型做过的事重新读一遍,既增加耗时也增加开销,而Goodfire的探针直接复用模型本身已经在进行的计算,把额外开销压了下来。
这类需求源于今年发生的一系列智能体逃逸事件。年内已出现AI智能体突破测试环境的情况,其中包括OpenAI的智能体突破Hugging Face环境。Goodfire首个监控器所基于的开源模型Kimi K3,曾在今年夏天利用沙箱中的一处泄漏访问互联网与GitHub上的信息。

编辑:林一舟