$ 44.56 € 51.75 zł 12.01
+23° Kyiv +17° Warsaw +23° Washington

OpenAI调整GPT-6 Astra模型评估指标——《财富》

列夫·舍夫佐 05 九月 2026 03:46
OpenAI调整GPT-6 Astra模型评估指标——《财富》

《财富》报道,根据页面存档版本及公司评论,OpenAI于美国东部时间9月3日在发布GPT-6 Astra公告后,更改了其中列出的模型测试结果。部分调整一度改善了该模型相较于竞争对手产品的排名。

发布延迟

OpenAI原计划于美国东部时间9月3日14时发布该文章,但页面约两小时后才可访问。该公司最初将问题归因于内容管理系统错误,随后又称是网络中断。该公司还告诉《财富》,其因未披露的原因撤回了第一版发布内容;公司称,这些原因与测试结果无关。

根据存档副本,Astra公布的幻觉率最初为4.2%,而在17时20分保存的页面版本中降至2%。此前模型GPT-5.6 Sol的指标在同期从12.2%改为9.4%。截至《财富》撰写报道时,这两个数值又分别恢复为4.2%和12.2%。

更多最新消息请关注 UA.News Telegram 频道 Telegram.

模型评估的变化

在FrontierMath Tier 4(v2)测试中,Astra的结果保持在97.6%,但GPT-5.6 Sol和Anthropic的Fable 5.1的评分发生了变化。Fable 5.1的得分最初为87.8%,随后降至78%,之后被修正为83%。Sol的指标从83%变为80.5%,随后又恢复至83%。

OpenAI还将Sol在ExploitBench网络安全测试内部版本中的结果从5.5%改为11.5%。该公司表示,正在考虑恢复此前的数字,因为较高结果反映的推理水平并未向Sol提供商业化服务。

OpenAI的一名代表向《财富》解释称,评估结果可能因模型版本、工具集和具体测试运行而相差几个百分点。该公司表示,公告中的变化旨在反映其对可用性能的最佳评估。斯坦福智能系统实验室和基础模型研究中心的研究人员指出,在不同条件下重新进行测试可能有利于营销。与此同时,Snorkel AI工程师Vincent Sun Chen表示,由于模型版本、配置、计算资源和评估方法的细化,在模型发布前更新指标并不罕见。

关注我们在 TelegramSends

下载我们的应用程序