$ 44.72 € 52.14 zł 12.11
+21° Kyiv +14° Warsaw +28° Washington

英伟达表示,得益于系统优化,Claude Opus 5 在 ARC-AGI-3 测试中取得了 100% 的成绩

Лев Шевцов 21 八月 2026 22:51
英伟达表示,得益于系统优化,Claude Opus 5 在 ARC-AGI-3 测试中取得了 100% 的成绩

英伟达发布了一项研究,称针对AI代理专门调优的软件捆绑包使Claude Opus 5模型在ARC-AGI-3交互式思维测试中取得了100%的成绩。 据TechCrunch报道,若不使用该框架,该模型的得分仅为30%——这已是受测模型中的最高得分。

英伟达将该框架定义为围绕语言模型的一组组件,这些组件负责管理内存、上下文和反馈。其中还包括工具、运行环境,以及代理可用的技能和库。 该公司研究人员认为,模型的选择固然重要,但在需要大量连续决策的任务中,结果在很大程度上也取决于此类基础设施。

ARC-AGI-3 由无规则说明的二维游戏组成。该模型需自主确定规则、理解玩法并赢得游戏。据 TechCrunch 描述,100% 的成绩意味着该模型在这些游戏中的表现达到了人类水平。

更多最新资讯请关注Telegram频道UA.News

在测试中,英伟达使用了其自主开发的Agentic Variation Operators(简称AVO)框架。该框架在主代理之外还设有一个独立的监督代理:当主代理陷入死胡同或开始重复探索已走过的路径时,监督代理会对其进行引导。 英伟达AI部门产品副总裁阿德尔·埃尔·哈拉克(Adel El Hallak)向TechCrunch表示,该代理不仅限于模型的API,还涵盖了模型本身及其周围的组件系统。

英伟达并未将AVO作为独立产品推出。该公司正在NeMo品牌下开发用于构建此类框架的技术;其中部分工具已开源,部分则为商业产品。

此前,OpenAI 也在 ARC-AGI-3 中研究了其模型的性能表现。据 TechCrunch 报道,通过调整两个框架参数,模型性能得以提升三倍,但经测试的模型中均未达到 100%。 Databricks于7月发布的一项独立研究表明,针对同一模型的不同框架,可能会对AI代理的运行成本产生显著影响。

关注我们在 TelegramSends

下载我们的应用程序