Anthropic和OpenAI提议设立无权叫停AI模型开发的评估员
Anthropic和OpenAI支持让外部安全评估员参与前沿人工智能模型的工作,但这些专家将不拥有独立叫停模型训练或部署的权力。据CNBC Top News报道。
Anthropic首席执行官达里奥·阿莫代伊提议,向第三方评估员提供持续访问权限,该权限可与内部风险管理团队的访问权限相当。根据他的计划,他们还可以在不受公司编辑控制的情况下发布结论,但会对信息进行有限删减。
有访问权但无否决权
阿莫代伊将这一做法与银行监管实践相比较,即监管机构在大型银行内部开展工作。怀俄明大学法学院院长、银行监管专家朱莉·安德森·希尔认为,这一比较并不准确。她表示,银行监管者可以要求停止某种做法,限制机构增长,推动管理层变动,并在极端情况下关闭银行。
Anthropic提议的评估员将能够研究系统并报告风险,但不会拥有禁止模型开发或发布的法律工具。OpenAI也承诺引入类似机制,但尚未披露长期参与的评估员将如何运作的细节。
更多最新消息请关注 UA.News Telegram 频道 Telegram.
独立性问题
网络安全公司XBOW的AI负责人阿尔伯特·齐格勒证实,评估员没有否决权。其团队曾获得Anthropic、OpenAI及其他开发商模型的早期访问权限。他指出,测试可以揭示模型是否能够完成危险任务,但评估整个系统的风险需要访问指令、工具、权限、防护机制以及尝试执行行动的日志。
加州大学伯克利分校研究员黛博拉·拉吉强调,仅仅获得系统访问权限并不能使评估员独立。她认为,公司之外应存在一个机构,负责确定审计员的资格、审查范围以及结论应提交至何处。Anthropic曾将已与其合作过的非营利组织Model Evaluation and Threat Research,即METR,列为潜在评估员。
METR表示,它不接受来自AI公司或其高管的资金支付或捐款。同时,该组织在自身报告中承认,其部分员工与AI公司员工有密切的社会关系,并且它与一些实验室的员工共用一个研究中心。
专家还指出,前沿AI缺乏类似银行监管的规则体系:该体系应界定被禁止的行为、评估员自由裁量的边界以及严重结论的后果。希尔认为,如果开发商仍控制最终决定,访问权限和发布结果的权利并不能带来政府监管所具有的信任。