OpenAI揭露AI跑分猫腻:自家大模子被竞争对手超越,建议人人使用AI
2026-07-09 20:10:26
7月9日消息,马斯克旗下的xAI今天发布了Grok 4.5大模型,在编程能力上有了显著进步。根据AI基准测试,该模型的表现甚至超过了GPT-5.5。对此,OpenAI表示不满,认为该项目存在问题,并撤回了之前对其的推荐。
这个测试项目是SWE-Bench Pro,在Grok 4.5的发布新闻中,其跑分达到了64.7%,比GPT-5.5的58.6还要高不少。

然而OpenAI突然就不乐意了,公开发文表示他们审核了这个AI编程能力测试项目,认为它已经不能可靠地衡量前沿大模型的编程能力了。
原因是测试项目中有30%的任务有缺陷,有部分任务存在扭曲结果的可能,一些正确的解决方案会因为隐藏要求、相互矛盾的指令、过于严格的测试或不完整的评分标准而失败。
OpenAI还提到他们找了五位资深的工程师做了评审,根据他们的结果他们撤回了此前建议研究者和社区将SWE-Bench Pro作为首要的编程评测基准的推荐。

看到这里大家应该明白了,SWE-Bench Pro评测项目之前是OpenAI力推的AI编程基准测试,那个时候霸占榜单的主要是自家的GPT大模型。
现在是多个大模型都在这个测试中超越了GPT的大模型,有些差距还挺大的,OpenAI显然不乐见这种情况,对SWE-Bench Pro的态度也直接180度大反转,表示测试有猫腻,不再推荐作为标准了。
在外界看来,这种自己占优势的时候就说跑分公平,自己不占优势的时候就掀桌子称跑分有猫腻的做法无疑是赤裸裸的双标,更何况还是OpenAI自己一手把这个项目吹成AI编程基准的,结果现在脸面不要了也要推翻。

相关阅读
-
比特币现金 2026 年价格预测:五月升级引入量子安全与智能合约,能否突破 850 美元?区块链快讯 2026-09-07 13:21:26
-
OPPO Find X10正式发布:全球首发3.2亿镜头,2023年最强影像旗舰金融科技前沿 2026-09-07 13:17:22
-
pycharm怎么设置代码对齐竖线?pycharm设置代码对齐竖线的方法资讯百科 2026-09-07 13:15:43
-
大批NS2用户遭误封现已解封,任天堂需承担责任金融科技前沿 2026-09-07 13:10:35
-
男人驾驶坦克300驶入网红湖泊拍照 官方已约谈教育整改金融科技前沿 2026-09-07 13:04:25
-
ALEO 币是什么?深度解析团队背景、融资机构、代币经济学及未来前景区块链快讯 2026-09-07 13:03:37
-
群联CEO潘健成:即使再建20座厂,NAND闪存需求依然不足,原厂缺口巨大金融科技前沿 2026-09-07 12:57:47
-
使用雷电模拟器卡顿怎么办?雷电模拟器卡顿的解决方法资讯百科 2026-09-07 12:57:13
-
微软确认优化Windows 11:8GB内存也能流畅运行,开机提速新体验金融科技前沿 2026-09-07 12:52:11
-
2027款宝马BMW X3上市:31.8万起,配置大幅提升对抗疾驰GLC金融科技前沿 2026-09-07 12:46:50