$ 44.69 € 51.91 zł 12.04
+14° Київ +13° Варшава +27° Вашингтон

OpenAI змінювала показники оцінювання моделі GPT-6 Astra — Fortune

Лев Шевцов 05 Вересня 2026 03:46
OpenAI змінювала показники оцінювання моделі GPT-6 Astra — Fortune

3 вересня за східним часом США OpenAI після публікації анонсу GPT-6 Astra змінювала наведені в ньому результати тестів моделі. Частина коригувань тимчасово покращувала її позиції порівняно з розробками конкурентів, повідомляє Fortune з посиланням на архівні версії сторінки та коментарі компанії.

Затримка публікації

OpenAI планувала оприлюднити допис 3 вересня о 14:00 за східним часом США, однак сторінка стала доступною приблизно через дві години. Компанія спочатку пояснила проблему помилкою системи керування контентом, а згодом — перебоями з інтернетом. Вона також повідомила Fortune, що відкликала першу версію публікації з нерозкритих причин, які, за твердженням компанії, не стосувалися результатів тестів.

За даними архівних копій, заявлений рівень галюцинацій Astra спочатку становив 4,2%, а у версії сторінки, збереженій о 17:20, знизився до 2%. Показник попередньої моделі GPT-5.6 Sol у той самий період змінили з 12,2% до 9,4%. На час підготовки матеріалу Fortune обидва значення знову повернулися до 4,2% та 12,2% відповідно.

Більше актуальних новин читайте у Telegram-каналі UA.News.

Зміни в оцінках моделей

У тесті FrontierMath Tier 4 (v2) результат Astra залишався на рівні 97,6%, проте змінювалися оцінки GPT-5.6 Sol та Fable 5.1 від Anthropic. Бал Fable 5.1 спершу становив 87,8%, потім знизився до 78%, а пізніше був скоригований до 83%. Для Sol показник змінювався з 83% до 80,5%, а згодом повернувся до 83%.

OpenAI також змінила результат Sol у внутрішній версії кібербезпекового тесту ExploitBench із 5,5% до 11,5%. Компанія заявила, що розглядає повернення попереднього числа, оскільки вищий результат відображає рівень міркування, який комерційно недоступний для Sol.

Представник OpenAI пояснив Fortune, що результати оцінювання можуть відрізнятися на кілька відсоткових пунктів залежно від версії моделі, набору інструментів і конкретного запуску тесту. За словами компанії, зміни в анонсі мали відобразити її найкращу оцінку доступної продуктивності. Дослідники Стенфордських лабораторій інтелектуальних систем і надійного ШІ зазначили, що повторне проведення тестів за різних умов може бути вигідним для маркетингу. Водночас інженер Snorkel AI Вінсент Санн Чен сказав, що оновлення показників напередодні запуску моделі не є незвичними через уточнення версії моделі, конфігурації, обчислювальних ресурсів і методики оцінювання.

Читай нас у Telegram та Sends

Завантажуй наш додаток