$ 44.63 € 51.84 zł 12.03
+21° Kijów +17° Warszawa +28° Waszyngton

OpenAI zmieniała wskaźniki oceny modelu GPT-6 Astra — Fortune

Lew Shewtsow 05 września 2026 03:46
OpenAI zmieniała wskaźniki oceny modelu GPT-6 Astra — Fortune

3 września czasu wschodniego USA OpenAI po publikacji zapowiedzi GPT-6 Astra zmieniała podane w niej wyniki testów modelu. Część korekt tymczasowo poprawiała jego pozycję w porównaniu z rozwiązaniami konkurentów, informuje Fortune, powołując się na zarchiwizowane wersje strony i komentarze firmy.

Opóźnienie publikacji

OpenAI planowała opublikować wpis 3 września o godz. 14:00 czasu wschodniego USA, jednak strona stała się dostępna około dwie godziny później. Firma początkowo wyjaśniła problem błędem systemu zarządzania treścią, a później zakłóceniami w dostępie do internetu. Poinformowała również Fortune, że wycofała pierwszą wersję publikacji z nieujawnionych przyczyn, które według firmy nie dotyczyły wyników testów.

Według zarchiwizowanych kopii deklarowany wskaźnik halucynacji Astra początkowo wynosił 4,2%, a w wersji strony zapisanej o godz. 17:20 spadł do 2%. Wskaźnik wcześniejszego modelu GPT-5.6 Sol w tym samym okresie zmieniono z 12,2% na 9,4%. W chwili przygotowywania materiału przez Fortune obie wartości ponownie wynosiły odpowiednio 4,2% i 12,2%.

Więcej aktualnych wiadomości na kanale UA.News w Telegramie Telegram.

Zmiany w ocenach modeli

W teście FrontierMath Tier 4 (v2) wynik Astra pozostał na poziomie 97,6%, jednak zmieniano oceny GPT-5.6 Sol i Fable 5.1 firmy Anthropic. Wynik Fable 5.1 początkowo wynosił 87,8%, następnie spadł do 78%, a później został skorygowany do 83%. Wskaźnik Sol zmienił się z 83% na 80,5%, a następnie wrócił do 83%.

OpenAI zmieniła także wynik Sol w wewnętrznej wersji testu cyberbezpieczeństwa ExploitBench z 5,5% na 11,5%. Firma oświadczyła, że rozważa przywrócenie poprzedniej liczby, ponieważ wyższy wynik odzwierciedla poziom rozumowania, który nie jest komercyjnie dostępny dla Sol.

Przedstawiciel OpenAI wyjaśnił Fortune, że wyniki ocen mogą różnić się o kilka punktów procentowych zależnie od wersji modelu, zestawu narzędzi i konkretnego uruchomienia testu. Według firmy zmiany w zapowiedzi miały odzwierciedlać jej najlepszą ocenę dostępnej wydajności. Badacze ze Stanfordzkiego Laboratorium Systemów Inteligentnych i Centrum Badań nad Modelami Bazowymi zauważyli, że ponowne przeprowadzanie testów w różnych warunkach może być korzystne marketingowo. Jednocześnie inżynier Snorkel AI Vincent Sun Chen powiedział, że aktualizowanie wskaźników przed premierą modelu nie jest czymś niezwykłym ze względu na doprecyzowanie wersji modelu, konfiguracji, zasobów obliczeniowych i metodologii oceny.

Czytaj nas na Telegram i Sends

Pobierz naszą aplikację