$ 44.68 € 52.18 zł 12.1
+35° +19° +21°

Nvidia заявила про 100% результат Claude Opus 5 у тесті ARC-AGI-3 завдяки обв’язці

Лев Шевцов 21 Серпня 2026 22:51
Nvidia заявила про 100% результат Claude Opus 5 у тесті ARC-AGI-3 завдяки обв’язці

Nvidia оприлюднила дослідження, у якому заявила, що спеціально налаштована програмна обв’язка для ШІ-агента дала моделі Claude Opus 5 змогу отримати 100% у тесті інтерактивного мислення ARC-AGI-3. Без цієї обв’язки модель набрала 30% — це був найвищий показник серед протестованих моделей, повідомляє TechCrunch.

У Nvidia називають обв’язкою набір компонентів навколо мовної моделі, які керують пам’яттю, контекстом і зворотним зв’язком. До неї також входять інструменти, середовище виконання, а також навички й бібліотеки, доступні агенту. На думку дослідників компанії, вибір моделі важливий, однак у завданнях, що потребують великої кількості послідовних рішень, результат значною мірою залежить і від такої інфраструктури.

ARC-AGI-3 складається з двовимірних ігор без інструкцій. Модель має самостійно визначити правила, зрозуміти, як грати, та перемогти в іграх. За описом TechCrunch, результат у 100% означає, що модель проходить ці ігри на рівні людини.

Більше актуальних новин читайте у Telegram-каналі UA.News.

Для тестів Nvidia використала власну обв’язку Agentic Variation Operators, або AVO. Вона передбачає окремий наглядовий агент на додаток до основного: він спрямовує агента, якщо той заходить у глухий кут або починає повторно досліджувати вже пройдений шлях. Віцепрезидент із продуктів AI-підрозділу Nvidia Адель Ель Халлак сказав TechCrunch, що агент не зводиться до API моделі, а охоплює саму модель і систему компонентів навколо неї.

Nvidia не представляла AVO як окремий продукт. Компанія розвиває технології для створення таких обв’язок під брендом NeMo; частина цих інструментів доступна відкрито, а частина є комерційною.

Раніше OpenAI також досліджувала результати своїх моделей у ARC-AGI-3. За даними TechCrunch, зміна двох параметрів обв’язки дала змогу потроїти їхні показники, однак жодна з протестованих моделей не досягла 100%. Окреме дослідження Databricks, опубліковане в липні, показало, що різні обв’язки для тієї самої моделі можуть істотно впливати і на вартість роботи ШІ-агентів.

Читай нас у Telegram та Sends

Завантажуй наш додаток