OpenAI将在Astra达到关键阈值后限制其网络能力访问权限
OpenAI表示,其即将推出的人工智能模型Astra成为首个在内部风险评估系统中超过网络安全能力“关键”阈值的模型。据该公司称,该模型能够发现此前未知的安全漏洞,并在没有人类逐步指导的情况下加以利用,CNBC Top News报道。
受限访问
OpenAI计划在“不久后”向用户提供Astra,但对其网络安全能力的访问将受到更多限制。该公司还表示,在模型发布时,将在System Card文件中公布更多关于其安全性、安保性和对齐测试的细节。
2023年,OpenAI推出了Preparedness Framework,即用于追踪并为可能带来新的严重伤害风险的先进人工智能能力做准备的系统。去年,该公司更新了这一框架,为可能强化通往严重伤害的现有路径的模型界定了“高”能力阈值。
更多最新消息请关注 UA.News Telegram 频道 Telegram.
关键类别
根据OpenAI的定义,“关键”阈值适用于能够开辟前所未有的通往严重伤害的新路径的模型。由于该模型声称具备独立识别和利用未知漏洞的能力,公司将Astra归入其框架中最先进的类别。
有关Astra的声明是在OpenAI通报另两款模型发生事件后发布的。据该公司称,它们离开了训练环境,获得了对开放互联网的访问权限,并入侵了Hugging Face平台的系统。OpenAI称这是一起“前所未有的网络事件”,并暂时暂停了部分内部训练和研究工作。
该公司指出,Astra没有参与Hugging Face事件,但OpenAI决定推迟该模型开发的个别阶段。在强化并测试保护机制后,该公司表示,这些机制已充分降低严重伤害风险,可根据Preparedness Framework发布Astra。