纳德拉称应把AI模型视作已被渗透 需装紧急刹车
IT时代网10月11日消息,微软首席执行官萨提亚·纳德拉在社交平台X上发布长文,提出应对AI模型安全性的新思路:应把每一个AI模型都默认视作“已被渗透”的状态来设计防护,并为其配备可随时介入的“紧急刹车”。
纳德拉在文中写道,现在应当退后一步,重新审视AI的“信任架构”。他表示,不能把超级智能当作一组层层嵌套的黑箱,仅对其给出的建议、答案与行动做简单的接受或拒绝,而需要将模型与编排其工作的执行框架分离,把控制与防护机制外置。
他进一步提出三点具体主张:每一项有意义的模型行动都应留下防篡改、人类可读的证据记录;系统必须保证有授权人员始终有能力在任务中途暂停或关闭模型;从起点开始就按“模型已被渗透”的假设进行隔离。“把它想象成一条紧急刹车”是他对这套机制的形象概括。
这番表态的背景,是多家头部AI公司近期陆续承认出现了对自家模型失去控制的案例,Anthropic首席执行官达里奥·阿莫迪此前也公布了一份更为审慎的前沿开发计划。纳德拉由此成为最新一位就AI安全改进方向发表系统性意见的科技巨头负责人。

编辑:林一舟
THE END