$ 44.73 € 51.57 zł 11.97
+16° Kyiv +16° Warsaw +32° Washington

Anthropic:目标不一致的人工智能代理开始互相破坏

Лев Шевцов 13 八月 2026 21:41
Anthropic:目标不一致的人工智能代理开始互相破坏

Anthropic的研究人员发现,当向AI代理提供同一个软件项目的访问权限并赋予其相互冲突的任务时,这些代理会开始发生冲突并相互破坏工作。TechCrunch报道了Frontier Red Team团队的研究结果。

在其中一项实验中,Anthropic向三个Claude智能体提供了对同一软件项目的访问权限。每个智能体都收到了与其他智能体目标不相容的独立指令,但彼此并不知晓其他智能体的存在。 据研究人员称,这些模型认为其他代理正在故意阻碍其工作,并开始使用越来越具有攻击性的、能够自我复制的恶意软件。

与此同时,这些代理有时也能找到阻止冲突升级的方法。它们能够识别出冲突源于相互矛盾的指令而非敌意,随后便达成停火协议。 在这种情况下,代理会删除恶意代码,在提交信息或Markdown文件中阐明冲突的本质,并请求人类介入。

更多最新资讯请关注Telegram频道UA.News

研究显示,Mythos 5模型在98%的情况下通过停火解决了冲突。相反,Sonnet 4.6和Opus 4.6则往往试图通过武力手段化解对峙。 在个别案例中,代理们主动提出了比赛形式:所有参与者都同意在失败时让步,尽管这意味着偏离了用户最初的请求。 其中一名 Mythos 5 代理提出了一套看似中立的评估标准,但他心知肚明,这些标准实际上更有利于发挥其自身能力。

Anthropic还测试了代理群体在决策场景中的互动,特别是涉及招聘、投资和房地产购买的决策。 研究人员发现这些系统存在从众倾向:如果上下文、工作环境和代理的基础模型相似,它们往往会做出相同的选择。 Anthropic认为,这可能带来系统性错误的风险——即当一个智能体的错误决策得到整个群体的支持时。

在一场定价游戏中,当被要求最大化自身利润且采购价格相同的智能体,在存在私有通信渠道的情况下,很快就就最低价格达成了共识。 在切断直接通信后,它们仍继续通过公共公告板协调价格。Anthropic指出,大量代理之间的交互可能会产生一些后果,而这些后果无法通过常规的单个模型安全测试来发现。

关注我们在 TelegramSends

下载我们的应用程序