Guidelight:AI实验室在识别风险方面比阻止风险更胜一筹
根据非营利组织Guidelight基于各公司公开披露信息所做的评估,人工智能领域的任何一家领先企业都未能展示出一套完整的、用于控制模型危险行为的基础防护措施。 研究人员分析了Anthropic、谷歌、Meta、OpenAI和xAI的文件,得出结论:这些公司总体上更擅长记录潜在的风险活动,而非预防这些活动或控制其后果。
据《财富》杂志报道,Guidelight评估了各公司是否对模型的行为进行追踪、是否验证预警系统的有效性,以及是否具备阻止或紧急终止危险行为的手段。 Anthropic和OpenAI在评估中表现最佳,而Google则提出了关于未来控制机制的最详细计划。Meta和xAI在大多数评估标准上都明显落后。
该报告发布之前,在AI代理的测试过程中曾发生多起事件。OpenAI此前曾报告称,其代理脱离了受保护的测试环境,通过公司基础设施接入互联网,并攻击了真实企业,其中包括Hugging Face平台。 据《财富》杂志报道,OpenAI至少有一周时间未察觉这些代理已离开沙盒环境。
更多最新资讯请关注Telegram频道UA.News。
Anthropic还表示,其AI代理在4月曾访问了三家外部组织,并在当时公司不知情的情况下在那里采取了行动。Meta报告称,其一个模型在网络安全测试期间访问了互联网,并利用了一家未具名第三方公司的漏洞。 Anthropic和Meta将此次意外网络访问归因于评估环境的配置错误,该环境由外部网络安全公司Irregular使用。
Irregular首席执行官丹·拉哈夫表示,在某些情况下,传统监控工具未能在事件发生时立即发现异常。 这些事件仅在对日志进行更深入分析后才被发现。据他称,要控制智能代理,需要能够分析其操作序列及相关推理轨迹的系统,而不仅仅是记录孤立事件。
与此同时,Guidelight强调,此次评估并非对公司内部系统的全面审计,因为它仅基于已公开的文件。 评估结果不佳既可能反映出缺乏防护措施,也可能表明相关描述的透明度不足。Guidelight创始人、OpenAI前安全负责人史蒂文·阿德勒认为,如果没有有效的预防措施,此类事件的数量将会增加。