OpenAI 多次修改 GPT-6 Astra 测试数据,部分成绩大幅变化
上周日
OpenAI 于当地时间 9 月 3 日发布 GPT-6 Astra 模型公告,发布过程波折,先是发布后撤下,页面长时间无法正常访问,官方先后称是内容管理系统故障、互联网中断所致,且表示撤稿与基准测试成绩无关。但博客重新上线后及后续,多项评测数据多次调整:Astra 的幻觉率先从 4.2% 降至 2%,后又调回 4.2%。GPT-5.6 Sol 的幻觉率、内部网络安全评测成绩等也有变动。Anthropic 旗下模型的部分成绩也出现下调后回升的情况,部分数据调整甚至早于首次发布博客前。OpenAI 称是为确保数据代表模型可用性能的最佳估计,且测试条件等因素会影响结果。这引发 AI 专家对其是否存在「刷榜」的质疑,也凸显 AI 行业长期存在的基准测试准确性争议,这类争议此前在 Meta 等公司也出现过。业内人士呼吁行业形成规范,修改成绩时明确说明评测条件变化。基准测试成绩对 AI 公司意义重大,但数据变动和外界质疑可能让客户、投资者难以判断模型适配性,也可能影响 OpenAI 的市场叙事。
OpenAI 多次修改 GPT-6 Astra 测试数据,部分成绩大幅变化
ITBear 科技资讯
OpenAI 多次调整 GPT-6 Astra 评测数据,基准测试「变数」引行业关注
ITBear 科技资讯
OpenAI 多次修改 GPT-6 Astra 基准测试数据,部分成绩一度大幅变化
IT 之家 / maomu.com
体验专业版特色功能,拓展更丰富、更全面的相关内容。