$ 44.65 € 52.13 zł 12.09
+21° Киев +19° Варшава +21° Вашингтон

Nvidia сообщила о 100-процентном результате Claude Opus 5 в тесте ARC-AGI-3 благодаря обвязке

Лев Шевцов 21 Августа 2026 22:51
Nvidia сообщила о 100-процентном результате Claude Opus 5 в тесте ARC-AGI-3 благодаря обвязке

Nvidia опубликовала исследование, в котором заявила, что специально настроенная программная обвязка для ИИ-агента позволила модели Claude Opus 5 набрать 100 % в тесте на интерактивное мышление ARC-AGI-3. Без этой инфраструктуры модель набрала 30% — это был самый высокий показатель среди протестированных моделей, сообщает TechCrunch.

В Nvidia называют «обвязкой» набор компонентов вокруг языковой модели, которые управляют памятью, контекстом и обратной связью. В нее также входят инструменты, среда выполнения, а также навыки и библиотеки, доступные агенту. По мнению исследователей компании, выбор модели важен, однако в задачах, требующих большого количества последовательных решений, результат в значительной степени зависит и от такой инфраструктуры.

ARC-AGI-3 состоит из двумерных игр без инструкций. Модель должна самостоятельно определить правила, понять, как играть, и победить в играх. Согласно описанию TechCrunch, результат в 100% означает, что модель проходит эти игры на уровне человека.

Больше актуальных новостей читайте в Telegram-канале UA.News.

Для тестов Nvidia использовала собственную обвязку Agentic Variation Operators, или AVO. Она предусматривает отдельного наблюдательного агента в дополнение к основному: он направляет агента, если тот заходит в тупик или начинает повторно исследовать уже пройденный путь. Вице-президент по продуктам AI-подразделения Nvidia Адель Эль Халлак сказал TechCrunch, что агент не сводится к API модели, а охватывает саму модель и систему компонентов вокруг неё.

Nvidia не представляла AVO как отдельный продукт. Компания разрабатывает технологии для создания таких обвязок под брендом NeMo; часть этих инструментов доступна в открытом доступе, а часть является коммерческой.

Ранее OpenAI также исследовала результаты своих моделей в ARC-AGI-3. По данным TechCrunch, изменение двух параметров интеграции позволило утроить их показатели, однако ни одна из тестируемых моделей не достигла 100%. Отдельное исследование Databricks, опубликованное в июле, показало, что разные обвязки для одной и той же модели могут существенно влиять и на стоимость работы ИИ-агентов.

Читай нас в Telegram и Sends

Загружай наше приложение