OpenAI员工指责马斯克Grok 3基准测试结果具有误导性
创始人
2025-02-24 13:48:01

三言科技2月24日消息,据报道,日前,OpenAI一名员工指责马斯克xAI发布的Grok 3模型基准测试结果具有误导性。而XAI联合创始人伊戈尔·巴布什金表示公司并无不当。

xAI 在其博客上发布了一张图表,展示了 Grok 3 在 AIME 2025(一项近期邀请制数学考试中的高难度数学题集)上的表现。图表显示,Grok 3 的两个版本 ——Grok 3 Reasoning Beta 和 Grok 3 mini Reasoning—— 在 AIME 2025 上的表现超过了 OpenAI 当前最强的可用模型 o3-mini-high。

不过,OpenaI的员工指出,xAi的图标并未包含o3-mini-high在“cons@64”条件下的 AIME 2025 得分。“cons@64”是指“consensus@64”,即允许模型在基准测试中对每个问题尝试 64 次,并将出现频率最高的答案作为最终答案。

在 AIME 2025 的“@1”条件下(即模型首次尝试的得分),Grok 3 Reasoning Beta 和 Grok 3 mini Reasoning 的得分低于 o3-mini-high。但是xAI仍然宣传Grok 3 是“最聪明的AI”。

对此,巴布金什回应称,OpenAI曾经也发布过类似的误导性基准测试图表。

相关内容

热门资讯

投资者提问:董秘你好,请问公司... 投资者提问:董秘你好,请问公司有脑机工程相关的产品或布局吗?董秘回答(复星医药SH600196):投...
投资者提问:公司积极开拓海外市... 投资者提问:公司积极开拓海外市场,请问近两年是否出口欧盟国家?董秘回答(南芯科技SH688484):...
投资者提问:公司走成这样,管理... 投资者提问:公司走成这样,管理层怎么办董秘回答(南芯科技SH688484):您好,谢谢投资者对公司的...
过敏预警、旅游规划……天气预报... (来源:中国妇女网)转自:中国妇女网1月初,气象预报显示,天津市将接连出现两次弱冷空气过程。同时,天...
古蜀人是华夏子孙吗?由三星堆看... (来源:上观新闻)《英雄祖先与弟兄民族》是历史人类学家王明珂的“华夏边缘”系列研究之一,是《华夏边缘...