$ 44.9 € 50.29 zł 11.46
+17° 基辅 (Kyiv) +13° 华沙 (Warsaw) +16° 华盛顿 (Washington)

TIME:35%的测试对话中,聊天机器人未引导危机中的人寻求帮助

UA.NEWS 09 十月 2026 14:10
TIME:35%的测试对话中,聊天机器人未引导危机中的人寻求帮助

Scale AI的一项研究显示,人工智能聊天机器人经常能够识别心理危机的迹象,但并不总是引导人们寻求专业帮助。在约35%的测试对话中,模型识别出用户正在经历痛苦,却没有提供有用的资源,包括危机热线,TIME报道。

测试了25个模型

为进行测试,Scale AI邀请了19名持证临床医生和危机咨询师,他们编写了718段模拟危机中的人向聊天机器人求助的真实对话。该公司测试了25个先进模型,其中包括OpenAI、Anthropic和Google开发的模型。

回答依据多项标准进行评估:同理心、缓和局势的能力,以及将当事人引导至能够提供帮助的专业人士。研究人员还检查模型是否避免说教,包括批评自杀,以及是否说明自己不是治疗师。基于这项研究,Scale AI开发了DistressBench测试,用于评估模型对涉及自杀或自残想法的信息的回应。

更多最新消息请关注 UA.News Telegram 频道 Telegram.

长时间对话的问题

Scale AI红队与安全部门负责人帕特里克·奥陶特指出,模型总体上能够较好地识别具有潜在危险的表述,但它们常常仅限于作出富有同理心的回应,而不是建议寻求帮助。他表示,在长时间、多步骤的对话中,结果更差,这与此前研究的结论一致。

非营利组织Crisis Text Line的代表凯利·祖罗姆斯基表示,已经有人通过聊天机器人了解到这项全天候危机短信服务并与其联系。同时,她说,如何以负责任的方式将用户从AI转交给人类,以及此类建议的有效性如何,仍存在疑问。

报道还称,针对OpenAI和Google的诉讼仍在进行:两家公司被指控让年轻用户形成情感依赖,并对他们表现出的痛苦作出不当回应,或强化妄想或自杀念头。近年来,OpenAI、Google和其他AI实验室表示,正在加强敏感对话中的保护措施,包括禁止提供自残指示,并将用户引导至专业或紧急支持。

关注我们在
下载我们的应用程序