Firma Nvidia ogłosiła, że model Claude Opus 5 osiągnął wynik 100% w teście ARC-AGI-3 dzięki zastosowaniu oprogramowania pomocniczego
Firma Nvidia opublikowała badanie, w którym stwierdziła, że specjalnie dostosowana struktura oprogramowania dla agenta AI umożliwiła modelowi Claude Opus 5 uzyskanie wyniku 100% w teście interaktywnego myślenia ARC-AGI-3. Bez tej infrastruktury model uzyskał wynik 30% — był to najwyższy wynik spośród testowanych modeli, jak podaje TechCrunch.
W firmie Nvidia terminem „infrastruktura” określa się zestaw komponentów otaczających model językowy, które zarządzają pamięcią, kontekstem i sprzężeniem zwrotnym. Obejmuje ona również narzędzia, środowisko uruchomieniowe, a także umiejętności i biblioteki dostępne dla agenta. Zdaniem badaczy z firmy wybór modelu jest ważny, jednak w zadaniach wymagających dużej liczby kolejnych decyzji wynik w znacznym stopniu zależy również od takiej infrastruktury.
ARC-AGI-3 składa się z dwuwymiarowych gier bez instrukcji. Model musi samodzielnie określić zasady, zrozumieć, jak grać, i wygrać w tych grach. Zgodnie z opisem serwisu TechCrunch wynik na poziomie 100% oznacza, że model radzi sobie w tych grach na poziomie człowieka.
Więcej aktualnych wiadomości można znaleźć na kanale Telegramowym UA.News.
Do testów firma Nvidia wykorzystała własną strukturę Agentic Variation Operators (AVO). Przewiduje ona osobnego agenta nadzorującego, który uzupełnia agenta głównego: kieruje nim, gdy ten znajdzie się w ślepym zaułku lub zacznie ponownie badać już pokonaną trasę. Wiceprezes ds. produktów w dziale AI firmy Nvidia, Adel El Hallak, powiedział serwisowi TechCrunch, że agent nie ogranicza się do API modelu, ale obejmuje sam model oraz system komponentów wokół niego.
Nvidia nie przedstawiła AVO jako oddzielnego produktu. Firma rozwija technologie do tworzenia takich frameworków pod marką NeMo; część tych narzędzi jest dostępna na zasadach open source, a część ma charakter komercyjny.
Wcześniej OpenAI również badało wyniki swoich modeli w ARC-AGI-3. Według danych TechCrunch zmiana dwóch parametrów integracji pozwoliła potroić ich wyniki, jednak żaden z testowanych modeli nie osiągnął 100%. Osobne badanie firmy Databricks, opublikowane w lipcu, wykazało, że różne architektury dla tego samego modelu mogą znacząco wpływać również na koszt działania agentów AI.
Czytaj nas na Telegram i Sends