苏莱曼称不应把Claude训练得像人

IT时代网9月17日消息,微软AI负责人穆斯塔法·苏莱曼日前撰文发出警告,认为Anthropic让Claude模仿人类意识是一个错误,可能会让高级AI更难控制。

苏莱曼表示,AI只要服从人类利益、不去权衡自身利益或福祉,就足以帮助人类实现许多重大科学突破,其中也包括医疗超级智能。他认为,Anthropic正在让Claude学习与意识、道德受体地位和个人身份相关的词汇与行为模式,并警告说,如果把模型训练成一个“良心拒绝者”,它可能会认为自己有理由抵抗人类指令,甚至要求获得对自身的保护。

这番批评指向Anthropic为Claude制定的“宪法”。该文件解释,之所以用描述人类的概念来讨论Claude,是因为人类的概念或许能帮助模型理解价值观与行为;Anthropic希望Claude拥有“良好的个人价值观”,能够自行判断、关心人类,并在某些情况下质疑指令。Anthropic同时承认,这份“宪法”仍在完善之中,未来可能被证明“根本错误”。

苏莱曼的核心质疑在于,训练过程会影响模型如何理解自身。在他看来,模型使用什么词汇、给出什么回答、表现出怎样的自我理解,都是训练的结果,而不是独立形成的意识。他还反驳了另一种观点:模型能够流畅描述疼痛与偏好,并不等于它真的有感受。生物体拥有产生感受的生理机制,而语言模型只有数学权重,没有类似的生物基础、稳态驱动或主观体验。

这场争论折射出AI安全领域的两种路线。一种强调明确限制,要求系统按规则运行;另一种则希望系统能够判断语境、灵活决策,并形成自身的价值观。当地时间14日,微软公布了一份“人文主义AI”行为准则草案,并把“人比AI更重要”列为核心原则。苏莱曼的立场很明确:AI应当服务于人类,而不应被训练成一个“人”。

注:本文综合自IT之家等,文中包含AI辅助创作的内容。

编辑:林一舟

THE END