Anthropic资助AI对人类福祉影响评估研究

IT时代网8月27日消息,Anthropic于8月25日启动一项总额500万美元的资助计划,支持独立研究者构建开源评估工具,用以衡量AI模型对用户身心健康的影响。

该计划将向获资助者提供直接资金、模型接入与技术支持,获资助者需以完全独立的方式开展工作,并把成果作为开源项目公开发布,供任何开发者使用。Anthropic在公告中指出,AI系统已成为很多人工作、学习与解决问题的重要工具,也会在困难时刻充当对话伙伴甚至情感支持来源;但行业至今仍缺乏清晰标准,来判断模型在用户开始寻求陪伴或身处心理危机时应当如何回应。

福祉评估尤其困难:多数模型行为看单条回答就能判断是否准确恰当,而评估福祉需要更长的语境——处于困境的用户可能不会立刻流露出自伤念头,需要更谨慎回应的信号往往要在长对话中才逐渐显现;同一句话在一种情境里合理,换一种情境可能有害。为此,Anthropic在资助说明中要求评估须明确“测什么、通过与否的标准是什么、为何重要”,邀请临床与心理学专家参与设计与验证,同时检验“过度合规”与“过度拒绝”两类风险,并尽量还原用户真实的多轮使用场景。

申请截止日期为9月21日,进入下一轮提交完整提案的申请人将于10月5日前收到通知。

Anthropic资助AI对人类福祉影响评估研究

注:本文综合自Anthropic等,文中包含AI辅助创作的内容。

THE END