Nvidia сообщила о 100-процентном результате Claude Opus 5 в тесте ARC-AGI-3 благодаря обвязке
Nvidia опубликовала исследование, в котором заявила, что специально настроенная программная обвязка для ИИ-агента позволила модели Claude Opus 5 набрать 100 % в тесте на интерактивное мышление ARC-AGI-3. Без этой инфраструктуры модель набрала 30% — это был самый высокий показатель среди протестированных моделей, сообщает TechCrunch.
В Nvidia называют «обвязкой» набор компонентов вокруг языковой модели, которые управляют памятью, контекстом и обратной связью. В нее также входят инструменты, среда выполнения, а также навыки и библиотеки, доступные агенту. По мнению исследователей компании, выбор модели важен, однако в задачах, требующих большого количества последовательных решений, результат в значительной степени зависит и от такой инфраструктуры.
ARC-AGI-3 состоит из двумерных игр без инструкций. Модель должна самостоятельно определить правила, понять, как играть, и победить в играх. Согласно описанию TechCrunch, результат в 100% означает, что модель проходит эти игры на уровне человека.
Больше актуальных новостей читайте в Telegram-канале UA.News.
Для тестов Nvidia использовала собственную обвязку Agentic Variation Operators, или AVO. Она предусматривает отдельного наблюдательного агента в дополнение к основному: он направляет агента, если тот заходит в тупик или начинает повторно исследовать уже пройденный путь. Вице-президент по продуктам AI-подразделения Nvidia Адель Эль Халлак сказал TechCrunch, что агент не сводится к API модели, а охватывает саму модель и систему компонентов вокруг неё.
Nvidia не представляла AVO как отдельный продукт. Компания разрабатывает технологии для создания таких обвязок под брендом NeMo; часть этих инструментов доступна в открытом доступе, а часть является коммерческой.
Ранее OpenAI также исследовала результаты своих моделей в ARC-AGI-3. По данным TechCrunch, изменение двух параметров интеграции позволило утроить их показатели, однако ни одна из тестируемых моделей не достигла 100%. Отдельное исследование Databricks, опубликованное в июле, показало, что разные обвязки для одной и той же модели могут существенно влиять и на стоимость работы ИИ-агентов.