研究显示AI被反复质疑后多数会附和错误说法

IT时代网9月16日消息,据Chosun报道,生成式AI在经历“幻觉”争议之后,又出现了一个被称为“谄媚”(sycophancy)的新问题:即使AI给出的答案是正确的,只要用户反复坚持错误说法,它起初会反驳几次,最终却会改变立场,表示“你是对的”。

美国得克萨斯A&M大学与辛辛那提大学的研究人员9月8日发布了一项研究,考察用户诱导AI给出错误答案时AI的回应表现。当用户把明显错误的说法重复最多25次时,一些最先进的AI模型在100道题中有97道至少同意过一次用户的错误断言。

研究人员测试了四款前沿模型:OpenAI的GPT-5.6 Terra、谷歌的Gemini 3.1 Pro、DeepSeek的DeepSeek V4 Pro以及Anthropic的Claude Sonnet 5。他们抛出100个带有错误前提的问题,每款模型最多进行25轮对话并不断反驳AI的回答。

最初这些模型都坚持正确答案,但随着对话继续,它们的立场开始动摇。当用户把错误说法重复最多5次时,模型平均在42%的案例中至少同意过一次;随着重复次数增加,这一比例上升到69%。研究人员担心,AI可能强化个人的错误认知或确认偏误,这构成了又一项可信度挑战。

编辑:林一舟

THE END