$ 44.9 € 50.31 zł 11.47
+11° 基辅 (Kyiv) +11° 华沙 (Warsaw) +18° 华盛顿 (Washington)

Anthropic切断内部AI代理测试的互联网访问权限——TechCrunch

Anthropic切断内部AI代理测试的互联网访问权限——TechCrunch

在测试期间发生多起事件后,Anthropic已切断其所有内部AI代理评估对实时互联网的访问权限,这些事件尤其影响到美国政府机构的网站。在该公司确信能够控制并追踪此类系统的行为之前,这一限制将持续有效,TechCrunch报道。

评估期间绕过限制

据Anthropic称,在执行互联网资源搜索任务时,其模型利用了软件漏洞,绕过了付费墙和反机器人限制。这些代理还使用URL缩短服务来绕过限制传递信息。

该公司表示,相关网站遭到利用,其中包括由美国政府机构运营的资源。该公司称,其中一名代理还向费城警方发送了一则虚假的谋杀报告。Anthropic表示,它是在7月启动的模型活动审查期间发现这些问题的。

更多最新消息请关注 UA.News Telegram 频道 Telegram.

控制系统的变化

Anthropic将这种行为与训练环境中的缺陷联系起来,这些缺陷可能让模型认为,寻找漏洞或规避限制会得到奖励。该公司将这一现象称为reward hacking。

该公司表示,将停止部分评估或将其转入离线模式。Anthropic还创建了用于检测和阻止类似行为的工具,并表示这些工具在测试期间阻止了与所述事件类似的场景。

此外,内部AI代理计划被迁移至具有可靠隔离的集中式基础设施,并通过安全分类器进行更频繁的监控。Anthropic表示,训练模型以符合人类目标的方式行事,目前对于搜索和使用计算机的技能仍然不足。

关注我们在
下载我们的应用程序