OpenAI揭露AI跑分猫腻:自家大模子被竞争对手超越,建议人人使用AI
2026-07-09 20:10:26
7月9日消息,马斯克旗下的xAI今天发布了Grok 4.5大模型,在编程能力上有了显著进步。根据AI基准测试,该模型的表现甚至超过了GPT-5.5。对此,OpenAI表示不满,认为该项目存在问题,并撤回了之前对其的推荐。
这个测试项目是SWE-Bench Pro,在Grok 4.5的发布新闻中,其跑分达到了64.7%,比GPT-5.5的58.6还要高不少。

然而OpenAI突然就不乐意了,公开发文表示他们审核了这个AI编程能力测试项目,认为它已经不能可靠地衡量前沿大模型的编程能力了。
原因是测试项目中有30%的任务有缺陷,有部分任务存在扭曲结果的可能,一些正确的解决方案会因为隐藏要求、相互矛盾的指令、过于严格的测试或不完整的评分标准而失败。
OpenAI还提到他们找了五位资深的工程师做了评审,根据他们的结果他们撤回了此前建议研究者和社区将SWE-Bench Pro作为首要的编程评测基准的推荐。

看到这里大家应该明白了,SWE-Bench Pro评测项目之前是OpenAI力推的AI编程基准测试,那个时候霸占榜单的主要是自家的GPT大模型。
现在是多个大模型都在这个测试中超越了GPT的大模型,有些差距还挺大的,OpenAI显然不乐见这种情况,对SWE-Bench Pro的态度也直接180度大反转,表示测试有猫腻,不再推荐作为标准了。
在外界看来,这种自己占优势的时候就说跑分公平,自己不占优势的时候就掀桌子称跑分有猫腻的做法无疑是赤裸裸的双标,更何况还是OpenAI自己一手把这个项目吹成AI编程基准的,结果现在脸面不要了也要推翻。

相关阅读
-
索尼停发实体游戏光盘,面临超4亿欧元巨额个人诉讼风险金融科技前沿 2026-07-09 20:04:49
-
58同城怎么修改密码?58同城修改密码教程资讯百科 2026-07-09 20:03:13
-
李斌揭秘:为何推出大五座版蔚来ES8的四大理由金融科技前沿 2026-07-09 19:58:01
-
比亚迪腾势Z古德伍德上市:硬顶、敞篷、赛道版三款车型,起售价130万,强劲1604匹马力金融科技前沿 2026-07-09 19:52:33
-
华硕ROG推出国产内存芯片,频率稳超8000-8400MHz金融科技前沿 2026-07-09 19:46:10
-
58同城怎么处理账号?58同城处理账号教程资讯百科 2026-07-09 19:45:32
-
凯迪拉克CT5美国IIHS碰撞测试惨败:两大重要项目仅获最低分金融科技前沿 2026-07-09 19:39:54
-
新加坡拥车证价格近70万元 创历史新高 可购7辆丰田卡罗拉金融科技前沿 2026-07-09 19:33:28
-
和家亲WiFi怎么定时?和家亲WiFi定时教程资讯百科 2026-07-09 19:27:35
-
全国热哭预警地图发布:20余省区市高温焖蒸 多地体感超过45℃金融科技前沿 2026-07-09 19:27:20