网易首页 > 网易号 > 正文 申请入驻

OpenAI o3 模型基准测试成绩遭质疑,实测分数远不及宣称

0
分享至

IT之家 4 月 21 日消息,OpenAI 的 o3 人工智能模型的第一方与第三方基准测试结果存在显著差异,引发了外界对其公司透明度和模型测试实践的质疑。

去年 12 月,OpenAI 首次发布 o3 模型时宣称,该模型能够在 FrontierMath 这一极具挑战性的数学问题集上正确回答超过四分之一的问题。这一成绩远远超过了竞争对手 —— 排名第二的模型仅能正确回答约 2% 的 FrontierMath 问题。OpenAI 首席研究官 Mark Chen 在直播中表示:“目前市场上所有其他产品在 FrontierMath 上的成绩都不足 2%,而我们在内部测试中,使用 o3 模型在激进的测试时计算设置下,能够达到超过 25% 的正确率。”

然而,这一高分似乎是一个上限值,是通过一个计算资源更为强大的 o3 模型版本实现的,而并非是 OpenAI 上周公开发布的版本。负责 FrontierMath 的 Epoch 研究所于上周五公布了其对 o3 模型的独立基准测试结果,发现 o3 的得分仅为约 10%,远低于 OpenAI 此前声称的最高分数。

这并不意味着 OpenAI 故意撒谎,该公司在 12 月份公布的基准测试结果中也包含了一个与 Epoch 测试结果相符的较低分数。Epoch 还指出,其测试设置可能与 OpenAI 有所不同,并且其评估使用了更新版本的 FrontierMath。Epoch 在报告中写道:“我们与 OpenAI 的结果差异可能是因为 OpenAI 在内部评估时使用了更强大的计算框架、更多的测试时计算资源,或者是因为这些结果是在 FrontierMath 的不同子集上运行的(例如 2024 年 11 月 26 日版本的 180 个问题与 2025 年 2 月 28 日私有版本的 290 个问题)。”

此外,ARC Prize 基金会(一个测试了 o3 预发布版本的组织)在 X 平台上发布消息表示,公开发布的 o3 模型是一个“针对聊天 / 产品使用进行了调整的不同模型”,这进一步证实了 Epoch 的报告。ARC Prize 还指出:“所有发布的 o3 计算层级都比我们测试的版本要小。”一般来说,更大的计算层级通常可以获得更好的基准测试分数。

值得注意的是,尽管公开版本的 o3 未能完全达到 OpenAI 测试时的表现,但这在一定程度上已不再是关键问题,因为该公司后续推出的 o3-mini-high 和 o4-mini 模型在 FrontierMath 上的表现已经优于 o3。此外,OpenAI 计划在未来几周内推出更强大的 o3 版本 o3-pro。

然而,此事再次提醒人们,人工智能基准测试结果最好不要完全照单全收,尤其是当结果来自一家有产品需要销售的公司时。随着人工智能行业竞争的加剧,各供应商纷纷急于通过推出新模型来吸引眼球和市场份额,基准测试“争议”正变得越来越常见。

IT之家注意到,今年 1 月,Epoch 因在 OpenAI 宣布 o3 之后才披露其从 OpenAI 获得的资金支持而受到批评。许多为 FrontierMath 做出贡献的学者直到公开时才知道 OpenAI 的参与。最近,埃隆・马斯克的 xAI 被指控为其最新的人工智能模型 Grok 3 发布了误导性的基准测试图表。就在本月,Meta 也承认其宣传的基准测试分数所基于的模型版本与提供给开发者的版本不一致。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
谁错了?曹晖坐在马斯克身边,几乎没有与马斯克交流,被网友笑话

谁错了?曹晖坐在马斯克身边,几乎没有与马斯克交流,被网友笑话

蝴蝶花雨话教育
2026-05-20 00:05:10
突发!美财长:美方拟恢复部分对华关税,但税率水平不超过20%

突发!美财长:美方拟恢复部分对华关税,但税率水平不超过20%

贸易夜航
2026-05-20 09:57:59
前车顶住后车后续,央媒点赞,司机身份曝光,厂家赠送新车

前车顶住后车后续,央媒点赞,司机身份曝光,厂家赠送新车

奇思妙想草叶君
2026-05-20 00:18:52
用户通过豆包预订饭店座位,到店后被告知“你找豆包预约那你找豆包啊”,豆包客服回应:无法帮用户预订或者购买商品

用户通过豆包预订饭店座位,到店后被告知“你找豆包预约那你找豆包啊”,豆包客服回应:无法帮用户预订或者购买商品

浙江之声
2026-05-20 08:24:54
结束22年等待,阿森纳自2003/04赛季以来首次夺得英超冠军

结束22年等待,阿森纳自2003/04赛季以来首次夺得英超冠军

懂球帝
2026-05-20 05:01:11
西汉姆跪谢切尔西!热刺客场1-2后领先2分,下轮输埃弗顿或降级

西汉姆跪谢切尔西!热刺客场1-2后领先2分,下轮输埃弗顿或降级

体育知多少
2026-05-20 06:28:23
40天拉下5位院长!杀疯了的耿同学到了最危险时候!谁来保护他?

40天拉下5位院长!杀疯了的耿同学到了最危险时候!谁来保护他?

大江看潮
2026-05-20 06:46:22
愤怒冲脑!上海第二工业大学男生课堂喊杀:起因曝光,当事人发声

愤怒冲脑!上海第二工业大学男生课堂喊杀:起因曝光,当事人发声

李晚书
2026-05-20 08:39:29
确认了:中国提供稀土,美国提供飞机、农产品和牛肉

确认了:中国提供稀土,美国提供飞机、农产品和牛肉

黑噪音
2026-05-19 21:32:06
印度咬死不签!世界足联崩溃了:要中国6000万,你两届才3500万!

印度咬死不签!世界足联崩溃了:要中国6000万,你两届才3500万!

云舟史策
2026-05-19 07:40:28
深度科普:狗交配过程为何会很难分开?下次看到狗交配请默默离开

深度科普:狗交配过程为何会很难分开?下次看到狗交配请默默离开

宇宙时空
2026-05-18 17:30:14
舒淇 50 岁生日后大方承认:我卸了妆,就是个 50 岁的模样

舒淇 50 岁生日后大方承认:我卸了妆,就是个 50 岁的模样

TVB的四小花
2026-05-20 09:30:21
越扒越有!上海交大樊同学保送低分医学,两次转专业,差一步登顶

越扒越有!上海交大樊同学保送低分医学,两次转专业,差一步登顶

火山詩话
2026-05-20 06:13:53
40岁女强人长了一颗“痘”,随手涂了几十种药膏……两个月后脸被“掏空”一个洞!或永久毁容……

40岁女强人长了一颗“痘”,随手涂了几十种药膏……两个月后脸被“掏空”一个洞!或永久毁容……

大风新闻
2026-05-20 09:39:03
奇瑞的“千里马”进化论

奇瑞的“千里马”进化论

AutoBusiness
2026-01-08 13:49:31
科学家惊恐发现:47年前的决定,可能让外星人4万年后找上门

科学家惊恐发现:47年前的决定,可能让外星人4万年后找上门

心中的麦田
2026-05-18 19:33:14
为何是1976年?三位开国伟人,为何在同年告别我们?

为何是1976年?三位开国伟人,为何在同年告别我们?

历史人文2
2026-05-19 22:11:51
张雪机车连夺5冠!意大利媒体人发表专业文章,披露张雪机车真相

张雪机车连夺5冠!意大利媒体人发表专业文章,披露张雪机车真相

火山詩话
2026-05-20 08:11:33
烈性犬咬死2岁女童,狗主人毛某义犯过失致人死亡罪,获刑三年缓刑四年,赔偿25万元,为避免再次伤人,案发后该狗被警方无公害处理

烈性犬咬死2岁女童,狗主人毛某义犯过失致人死亡罪,获刑三年缓刑四年,赔偿25万元,为避免再次伤人,案发后该狗被警方无公害处理

大风新闻
2026-05-20 11:34:00
普京到了,美俄元首为何接连访华?

普京到了,美俄元首为何接连访华?

中国新闻周刊
2026-05-20 00:12:34
2026-05-20 13:47:00
IT之家
IT之家
爱科技,爱这里 - 前沿科技人气平台
345195文章数 607209关注度
往期回顾 全部

科技要闻

一文看懂谷歌I/O2026:谷歌打响智能体大战

头条要闻

烈性犬咬死2岁女童狗主人赔25万 狗被警方无公害处理

头条要闻

烈性犬咬死2岁女童狗主人赔25万 狗被警方无公害处理

体育要闻

不再美丽的阿森纳,终于成为英超冠军

娱乐要闻

舒淇大方承认:卸了妆就是50 岁的模样

财经要闻

白酒榜|汾酒营收净利双增 口子窖"造富"

汽车要闻

焕新极氪009上市41.38万起 齐家版让MPV回归家庭

态度原创

手机
游戏
艺术
亲子
公开课

手机要闻

外媒上手特朗普T1手机:不再标榜“美国制造”

索尼PS会员涨价?网友集体声讨!过半用户认为不值得

艺术要闻

18幅 玫瑰花与女子画作

亲子要闻

2026儿童DHA哪个品牌好:美国藻源+采用六零配方技术,吸收效率高

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版