OpenAI发布心理健康对话评估基准MentalHealthBench

IT时代网9月24日消息,OpenAI发布名为MentalHealthBench的开放基准,用于评估AI在贴近现实的心理健康对话中的回应质量。该项目与超过80名持证心理健康专家合作开发,尝试填补此类评估长期偏重紧急场景的空白。

OpenAI在说明中提到,人们向AI寻求的对话类型十分多样:处理一段艰难的关系、纾解日常压力、支持在意的人,或者决定如何应对某个棘手处境。这些对话要求模型具备准确性、务实判断,并尊重用户自主性。在每周超过10亿人使用ChatGPT的背景下,相关研究聚焦于让模型在广泛需求中作出稳妥回应,把用户的安全与福祉放在首位。

以往针对该领域的评估大多集中于紧急场景,并采用宽泛的预设标准衡量表现,导致人们难以了解模型在心理健康对话全谱系上的表现,以及其回应在多大程度上符合各情境下的专家指导。MentalHealthBench据此设计,将评估范围扩展到非紧急的日常对话。

基准构建过程中,专家们参照心理支持领域的既定方法,为多类常见情境撰写了对话脚本与专家回应;模型在对话中的表现由多位专家依据统一评分标准独立打分,最终形成开放数据集。OpenAI同时公布了多个模型在该基准上的成绩,供研究者横向比较。

OpenAI表示,更好的心理健康评估应当成为共享资源,数据集与相关代码已开放给研究社区,供后续研究和模型改进使用。

编辑:林一舟

THE END