OpenAI 多次修改 GPT-6 Astra 测试数据,部分成绩大幅变化
2 小时前

当地时间9月3日,OpenAI发布了GPT-6 Astra模型公告,但发布过程并不顺利。公告发布后很快被撤下,且页面长时间无法正常访问。官方解释称,这是由于内容管理系统故障和互联网中断所致,并强调撤稿与基准测试成绩无关。然而,博客重新上线后,多项评测数据却经历了多次调整:Astra的幻觉率从4.2%降至2%,随后又调回4.2%;GPT-5.6 Sol的幻觉率和内部网络安全评测成绩也发生了变动。与此同时,Anthropic旗下模型的部分成绩也出现了类似的下调后回升情况,部分数据调整甚至在首次发布博客前就已发生。OpenAI表示,这些调整是为了确保数据能最佳地代表模型可用性能,同时指出测试条件等因素会影响结果。但这一解释引发了AI专家对其是否存在“刷榜”行为的质疑,也再次凸显了AI行业长期存在的基准测试准确性争议,此前Meta等公司也曾面临类似争议。业内人士呼吁,行业应形成规范,明确说明评测条件变化。基准测试成绩对AI公司至关重要,但数据变动和外界质疑可能让客户和投资者难以判断模型适配性,也可能影响OpenAI的市场形象。