$ 44.66 € 52.19 zł 12.09
+24° Kyiv +17° Warsaw +20° Washington

研究发现公开的人工智能遏制计划不足

Лев Шевцов 22 八月 2026 19:08
研究发现公开的人工智能遏制计划不足

领先的人工智能系统开发商几乎没有公开记录的行动计划,以应对模型试图绕过人类控制的情况。TechCrunch援引 Guidelight AI Standards 组织的一项评估报道称。

Guidelight 根据其 Control 标准中的六项优先实践,分析了 Anthropic、Google、OpenAI、Meta 和 xAI 的公开材料。该组织还评估了对人工智能行为的内部日志记录和监控、在出现一系列不当行为信号后停止系统、对控制措施进行独立审计,以及是否存在具体的模型遏制计划。

对公开准备程度的评估

遏制计划规定,在发现人工智能试图绕过控制后采取预先确定的行动。该计划应明确需要撤销模型的哪些权限、模型可继续为哪些对象运行以及受到何种限制,并明确何时应将其完全关闭。

OpenAI 获得最高评分——五分中的三分。根据 Guidelight 的数据,该公司在发生安全事件后,已多次暂停或终止工作流程,包括模型的内部部署和训练。该公司还描述了恢复这些流程所需的步骤。

与此同时,Guidelight 的报告指出,没有公开证据表明 OpenAI 针对未来涉及模型与人类控制不一致的事件制定了正式的应对计划。

更多最新消息请关注 UA.News Telegram 频道 Telegram.

Meta 和 Anthropic 在公开遏制计划方面获得了最低评分。Guidelight 没有发现证据表明 Meta 拥有针对失去模型控制权的应对计划,或计划推出此类计划。该组织评估认为,Anthropic 8 月的风险报告没有提及,将限制模型部署作为调查涉及不一致性或控制问题事件的可能结果。

公司立场和监管要求

OpenAI 的一名代表表示,该评估未涵盖公司的所有内部实践。据他所说,OpenAI 拥有用于限制权限、暂停工作负载、缩小部署范围或完全关闭模型的流程,并且已经使用过这些流程。Google 也表示,该报告未反映其全部安全措施。Meta 以其现有风险评估框架为由,拒绝说明是否拥有内部遏制计划。

Guidelight 首席科学家、OpenAI 前安全研究员史蒂文·阿德勒表示,令他惊讶的是,公司对如何应对严重的失控事件披露得如此之少。他认为,如果没有预先准备的计划,开发商将不得不在紧急情况下确定行动方案。

今年生效的加利福尼亚州 SB 53 法案要求大型前沿模型开发商公布用于发现和应对关键安全事件的框架。纽约州具有类似要求的 RAISE Act 将于 1 月生效。上个月,美国还提出了一项两党 AI Kill Switch Act 法案,要求大型开发商创建并维护用于关闭失控模型的技术机制。

关注我们在 TelegramSends

下载我们的应用程序