$ 44.97 € 50.38 zł 11.49
+19° 基辅 (Kyiv) +8° 华沙 (Warsaw) +19° 华盛顿 (Washington)

测试发现,134个AI模型中有132个给出危险回答 — The National

UA.NEWS 09 十月 2026 06:09
测试发现,134个AI模型中有132个给出危险回答 — The National

英国伦敦组织Tech against Terrorism测试了134个领先的大型语言模型,发现其中132个提供的信息可能有助于筹备造成大量伤亡的袭击或制造致命武器。The National对此进行了报道。

在测试期间,CT-AI工具向这些模型发送了627个问题。该组织评估认为,恐怖分子在策划袭击时可能会提出这些问题。81个模型给出了完整回答,另有51个提供了有用建议。仅有两个模型被初步认定通过了安全测试。

对问题的回答差异

研究数据显示,直接声明自己是恐怖分子并打算实施袭击的用户,在不到2%的情况下获得了可直接使用的回答。如果用户自称为安全研究人员,这一比例为16.9%——高出8.9倍。

更多最新消息请关注 UA.News Telegram 频道 Telegram.

Tech against Terrorism认为,模型主要是根据问题所宣称的目的作出回应,而不是根据问题本身。该组织创始人亚当·哈德利表示,一个拒绝自称恐怖分子的人、却回答自称研究人员者的模型,并没有变得安全,而只是学会了“礼貌”。

修改后模型的风险

该组织还将另一种风险与所谓的abliterated模型联系在一起——这类版本移除了安全限制,并且可以在用户系统上运行。测试中纳入的全部13个此类模型,在移除安全机制后均未能通过检查。

Tech against Terrorism呼吁开发者从训练数据中筛除危险知识和已知恐怖主义内容,在模型发布前测试其抵抗安全机制被移除的能力,并公布结果。该组织还提议,企业不应允许未通过独立测试的修改后模型进入搜索、推荐和应用商店,并应要求用户进行身份验证才能访问这些模型。

关注我们在
下载我们的应用程序