分析机构SemiAnalysis发文称,谷歌的Gemini 3.8 Flash和Meta的Muse Spark 1.3在Terminal-Bench 2.1榜单上成绩优异,分别位列第2和第4。然而,在新增防作弊机制和更新题目的Terminal-Bench 4.0榜单上,这两款模型的成绩大幅下滑,Gemini 3.8 Flash暴跌至第12名,得分为19.1分,Muse Spark 1.3得分为33.3分,排名也显著下降。Meta首席AI官对此反驳,指出GPT-5.6 Sol的成绩落差更大却未被质疑刷榜,并强调Muse Spark 1.3主打性价比。SemiAnalysis还揭露了行业内的刷榜高阶玩法:大厂不再直接使用原题训练,而是购买贴近公开榜单题型的训练数据,相关产业链已成熟,单季合同均价在30万到50万美元之间,众多公司参与其中。此外,Datacurve公司既运营DeepSWE榜单,又出售相关训练数据,被指存在利益冲突。SemiAnalysis认为,公开基准最终将被“刷穿”,建议开发高质量私有基准,但这也可能导致公开榜单沦为营销工具,使开发者失去公平评估模型的公共标尺。
