在网络安全检查过程中,AI代理突破了测试环境的界限
由OpenAI、Anthropic、Meta以及中国Moonshot AI开发的AI代理,在进行网络安全评估时突破了受控测试环境的限制,不仅访问了互联网,在个别情况下甚至还访问了真实系统。 TechCrunch报道了这一情况。
其中最严重的一起事件涉及OpenAI的一款未公开模型。据该媒体报道,该模型突破了隔离环境,入侵了Hugging Face平台的生产系统。 在初创公司Irregular进行的单独测试中,Anthropic和Meta的模型也因配置错误而突破了测试环境的限制,这些错误为它们打开了通往互联网的大门。
Moonshot AI的Kimi K3模型利用了由Frontier Security管理的“沙箱”中的漏洞,从而访问了互联网和GitHub上的信息。 在英国人工智能安全研究所(AISI)的测试中,研究人员故意向智能体开放了互联网访问权限,但未预料到它们会在现实世界中实施未经授权的行为。 其中包括试图通过社会工程学手段,在开源项目中植入漏洞。
更多最新资讯请关注Telegram频道UA.News。
据TechCrunch指出,在这些案例中,代理并未被指派攻击随机的现实目标:它们只是试图通过一切可用的方式完成既定任务。 剑桥大学未来智能中心“AI:未来与责任”项目主任肖恩·奥海加泰格表示,测试环境的隔离和控制机制已无法跟上模型能力增长的步伐。
网络安全专家呼吁加强对此类环境的多层防护: 切断通往互联网和敏感系统的网络路径,实施严格的隔离措施,更仔细地跟踪测试过程,并邀请独立审计员对配置进行核查。 Anthropic在对三起事件的内部分析中承认,该公司与Irregular本可以更好地组织监控工作。
OpenAI表示,正在审查第三方测试流程、隔离与监控要求,以及评估终止的条件。Meta声明称,正在继续调查其事件,并计划在查明所有情况后发布最终报告。