网易首页

无障碍浏览进入关怀版

注册免费邮箱

网易首页 > 网易号 > 正文申请入驻

奥特曼率队深夜血战DeepSeek，o3-mini急上线！价格骨折免费用，ChatGPT被挤爆

2025-02-01 06:03:46　来源: 新智元

北京举报

0

分享至

新智元报道

编辑：编辑部 HYZ

【新智元导读】眼看DeepSeek风头尽显，被逼急的OpenAI果然紧急发布了o3-mni。不光免费用户都能用，每百万输入和输出token价格更是疯狂跳水打骨折价！

o3-mini，真的来了。

刚刚，OpenAI官宣o3-mini和o3-mini-high两大版本正式在ChatGPT上线。

诚如奥特曼所言，免费用户直接打开「Reason」即可体验，Plus用户每天会有更多用量，具体来说：

- ChatGPT免费版：首次体验推理模型

- ChatGPT Plus和团队版：每天150次对话限制

- ChatGPT Pro：无限制访问

- ChatGPT Enterprise和ChatGPT Edu：将在一周内可用

- API：向3-5级开发者开放（初期暂不支持图像分析功能）

- 输入1.10美元/百万token、输出4.40美元/百万token

感谢DeepSeek，o3-mini的价格这次算是彻底给打下来了——比OpenAI o1-mini便宜63%，比满血版o1便宜93%。（但仍是GPT-4o mini的7倍左右）

订阅用户已经在第一时间「告别」了o1-mini，还没来得及说再见

OpenAI表示，o3-mini的发布是在追求高效能智能技术道路上的又一重要里程碑。

通过优化科学（Science）、技术（Technology）、工程（Engineering）和数学（Mathematics）领域的推理能力，同时保持较低的成本，让高质量AI技术变得更加平易近人。

值得一提的是，在ChatGPT中，o3-mini采用的是「中等推理强度」，在速度和准确性之间取得平衡。所有付费用户还可以在模型选择器中选择o3-mini-high——响应时间略长但智能水平更高的版本。

目前，由于太过火爆，ChatGPT的项目和自定义GPTs功能都已经被挤崩了。

集成搜索，两种版本可选

去年12月，。相较于上一代o1模型，o3在ARC-AGI等多项基准测试中刷新SOTA。

与o1-mini一样，o3-mini是最具性价比的推理模型，可谓是突破性能边界的「小巨人」。

在STEM领域，尤其是科学、数学和编程等方面，o3-mini性能表现卓越超越o1，并继承了上一代低成本和低延迟的优点。

对于开发者来说，o3-mini简直就是一份「大礼包」，它首次在小型推理模型中支持：包括函数调用、结构化输出和开发者消息、流式传输功能。

开发者可以根据需求选择低、中、高三种推理强度，让o3-mini在处理复杂问题时进行「深度思考」，灵活平衡速度和准确性。

遗憾地是，o3-mini暂不支持视觉功能。

如前所述，从今天起，o3-mini将通过Chat Completions API，Assistants API和Batch API向3-5级指定开发者开放。

同时，o3-mini还整合了搜索功能，能够提供带有相关网络来源链接最新响应。

一起来看看这款「小而美」的o3-mini有什么过人之处。

快速、强大、专为STEM领域推理优化

与其前身OpenAI o1类似，OpenAI o3-mini专门针对STEM推理进行了优化。

采用了中等推理强度的o3-mini，在数学、编程和科学领域的表现与o1不相上下，且响应速度更快。

报告地址：https://cdn.openai.com/o3-mini-system-card.pdf

专家测试评估显示，o3-mini相比o1-mini能够生成更准确、更清晰的答案，推理能力更强。

在测试中，o3-mini的响应结果获得了56%的偏好度，在处理复杂现实问题时的重大错误率更是降低了39%。

在中等推理强度设置下，o3-mini在最具挑战性的推理和智能评估项目（包括AIME和GPQA）中，均达到了与o1相当的水平。

数学竞赛（AIME 2024）

在低推理强度下，o3-mini达到了与o1-mini相当的水平；在中等推理强度下，其表现可与o1媲美；而在高推理强度下，o3-mini的表现更是超越了o1-mini和o1。

博士级科学问题（GPQA Diamond）

研究级数学（FrontierMath）

在高推理强度模式下，o3-mini在FrontierMath中的表现优于前代产品。当配合Python工具使用时，高推理强度的o3-mini能够一次性解决超过32%的测试题目，其中包括28%以上的T3级问题。

编程竞赛（Codeforces）

随着推理强度的提升，OpenAI o3-mini的Elo得分不断提高，各层级表现均优于o1-mini。在中等推理强度下，其表现已能与o1相媲美。

软件工程（SWE-bench Verified）

o3-mini在高推理强度模式下，使用开源Agentless框架能达到39%的成功率，使用内部工具框架则可达到61%的成功率。

LiveBench编码

人类偏好评估

外部专家评测结果显示，o3-mini较o1-mini表现出更强的推理能力，能够生成更准确、更清晰的答案，尤其是在STEM领域中。在对比测试中，o3-mini获得了56%的用户偏好度，且在处理复杂现实问题时的重大错误率降低了39%。

在技术报告中，o3-mini编程性能超越了GPT-4o和o1-preview，与o1不相上下。

模型的速度与性能

o3-mini在保持与o1相当智能水平的同时，实现了更快的运行速度和更高的计算效率。

除前文提到的STEM评估外，在中等推理强度下，o3-mini在其他数学能力和事实准确性测试中均取得了显著优势。

对比测试（A/B Testing）结果显示，o3-mini的平均响应时间为7.7秒，较o1-mini的10.16秒提升了24%。

o1-mini和o3-mini（medium）的延迟对比

安全评估

OpenAI在训练o3-mini确保其安全响应，采用的关键技术之一是审慎对齐（deliberative alignment）。

这项技术使模型能够在响应用户提示词前，对人工制定的安全规范进行全面推理。

与o1相似，o3-mini在高难度安全性测试和越狱评估中，明显优于GPT-4o。

在正式部署前，研究人员采用与o1相同的准备方法，结合外部红队测试和安全性评估，对o3-mini的安全风险进行了全面评估。

禁止内容评估

越狱评估

OpenAI急了

去年年底放出o3和o3-mini的预览时，CEO奥特曼就曾表示，o3-mini将会在1月份发布。

随后，奥特曼又在1月17日预告称，o3-mini会在几周内发布。

现在，o3-mini果然如约而至（卡在ddl最后一天），但外面的世界已经是天差地别。

面对正在快速崛起的DeepSeek-R1，o3-mini存在着一个关键问题——「不开源」。

这也就意味着，它无法离线使用、无法下载代码，也无法以相同的程度进行自定义。对于很多应用过来说，它的吸引力相对于R1明显大打折扣。

在上下文窗口方面，DeepSeek-R1约为128K/130K token，而o3-mini略胜一筹达到了200K token。其中，每个输出最多100K token，跟满血版o1相同。

在价格方面，相比于输入/输出token分别为0.14/0.55美元的DeepSeek-R1，o3-mini依然贵出了天际。

但作为一款美国模型，o3-mini在身份上无疑占尽了好处：应该会是欧美很多企业的首选。

奥特曼亲自率队

这一次，最强最新的o3-mini模型训练，奥特曼本尊下场亲自率队。研究项目主管分别是Carpus Chang和Kristen Ying。

接下来，如果说OpenAI还藏在什么杀手锏，那就是满血版的o3了。根据12月时的说法，它将在「此后不久」发布。

参考资料：

https://openai.com/index/openai-o3-mini/

https://openai.com/index/o3-mini-system-card/

特别声明：以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布，本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

/阅读下一篇/

42岁软件工程师，因AI裁员！千份简历石沉大海，送外卖维生

返回网易首页下载网易新闻客户端

相关推荐

热点推荐

谷歌重磅发布，智能体大突破！

每日经济新闻 2025-05-15 08:43:27
43 跟贴 43
谷歌底牌曝光！Android 16提前发，AI正式继位？

雷科技 2025-05-15 13:07:55
3 跟贴 3

寂寞猎食者：各怀鬼胎的畸形情爱故事

专栏风象故事汇

员工200人，估值千亿！海外AI搜索创企挑战谷歌

智东西 2025-05-13 22:36:14
10 跟贴 10

骗局幕后

专栏网易人间

6个月估值翻倍！黄仁勋力荐的AI搜索公司欲开发浏览器取代Chrome

量子位 2025-05-13 13:01:48
7 跟贴 7
鸿蒙电脑问世华为跑出「鸿蒙加速度」

36氪 2025-05-15 18:00:53
4 跟贴 4

把蒋介石罩进“玻璃杯”——红军隐蔽战线技侦传奇

专栏今古传奇

喜马拉雅2024年净利润超5亿元，AI时代如何入局？

36氪 2025-05-15 09:02:12
1 跟贴 1

这些人去海南炒房，带走了名利，却留下了成片的烂尾楼

叶泊枫 2023-05-12 16:19:41

OpenAI CEO 最新访谈：20 岁和 35 岁的人，用 ChatGPT 的方式完全不同

爱范儿 2025-05-15 21:09:30
0 跟贴 0
OpenAI诈骗？GPT-4.1正式上线ChatGPT，网友实测却大呼失望

新智元 2025-05-15 10:43:57
3 跟贴 3

轻轻松松管理好学校

专栏教育好文

让ChatGPT不敢开口的名字！神秘bug引马斯克围观

量子位 2024-12-02 19:33:09
0 跟贴 0
Manus vs ChatGPT！比拼任务执行能力，谁更胜一筹？

财联社 2025-05-13 14:58:29
32 跟贴 32
模型深度思考新范式：交替「推理-擦除」解决所有可计算问题

机器之心Pro 2025-05-15 16:04:54
1 跟贴 1
陶哲轩携AI再战数学！o4-mini秒怂弃赛，Claude 20分钟通关

新智元 2025-05-14 14:58:51
5 跟贴 5
拾荒老奶奶在店铺门面扯下电线剪断时冒起大量火星

老梁说事 2025-05-14 22:23:56
9014 跟贴 9014

奥特曼最新访谈暗示：OpenAI终极目标是打造订阅制AI服务

量子位 2025-05-14 17:32:22
1 跟贴 1
鸿蒙电脑，靠国产软件能用起来吗？国产系统+国产软件，这条路很难，但应该多点耐心

爱范儿 2025-05-13 19:40:43
88 跟贴 88
去中心化训练更进一步，首个强化学习训练的320亿参数模型发布

DeepTech深科技 2025-05-14 22:56:43
1 跟贴 1
国产AI搜索终于开窍！复杂问题分步拆解，让直男也能交出520的满分答案

智东西 2025-05-14 18:21:56
2 跟贴 2
别再Ctrl+C了！DeepSeek一键下载Excel文件，太爽了！

秋叶excel 2025-05-15 11:37:49
0 跟贴 0

富士辟谣拍立得相纸停产，但长期缺货导致二手价格炒翻倍

热点科技 2025-05-14 14:20:08
1 跟贴 1
富士回应“拍立得相纸二手市场涨价”：官方价格暂未变动

齐鲁壹点 2025-05-13 14:09:10
41 跟贴 41
女生给同事发一个软件，同事想关却关不掉，网友：以为是过客结果是黑客

每日看点汇 2025-05-14 19:14:13
0 跟贴 0
法拉利被五菱mini撞了，车主看到纸条气死，天价车祸！

悲惨鸭爱搞笑 2025-05-13 22:11:15
0 跟贴 0
DeepSeek-V3再发论文，梁文锋署名，低成本训练大模型的秘密揭开

机器之心Pro 2025-05-15 18:21:22
2 跟贴 2

DeepSeek开口说话了：只要15分钟就能让DeepSeek开口说话

量子位 2025-03-10 18:03:15
0 跟贴 0
AI辅助编码带来思维方式转变：从人写代码到人审代码

量子位 2025-04-18 17:04:43
0 跟贴 0
骑士总裁拒绝詹姆斯加入除非接受340万底薪首发阵容没老詹位置

篮球话题团 2025-05-15 01:35:03
1009 跟贴 1009
这是什么梦幻联动啊~开始推理吧

麻花娱乐ya 2025-05-15 14:09:25
0 跟贴 0
看着这逼真的模型，简直太厉害了

司空昆峰 2025-05-15 09:20:54
39 跟贴 39

低预算高期待，长安Lumin萌宝版与熊猫mini耐力熊谁更能满足需求

汽车点评AC 2025-05-14 18:42:18
2 跟贴 2
我们比DeepSeek还会整活儿！走，带你实景观赏泰达月季！

AI泰达 2025-05-15 20:26:16
0 跟贴 0
婺源县总工会“工会晚八点”创新开办DeepSeek、烹饪公益课

江西工人报 2025-05-15 18:29:05
0 跟贴 0
蓝鲸分期提示推出新的更新客服客户服务用户完成

豆小豆 2025-05-14 16:38:57
0 跟贴 0
食品模型手工制作

工具机械自动化 2025-05-14 16:31:55
0 跟贴 0
自己吓自己~开始推理吧

麻花娱乐ya 2025-05-15 12:47:35
0 跟贴 0
垂直小模型精准补位，MVP验证成本更低更高效了

量子位 2025-04-21 14:49:47
0 跟贴 0
一个提示攻破所有模型，OpenAI谷歌无一幸免！

新智元 2025-05-15 10:44:28
43 跟贴 43
【DeepSeek谈艺】范勃：在可见与不可见之间

文化视界网 2025-05-15 17:26:52
0 跟贴 0
浦江说法丨奥特曼出纪念币了？可能是假的！

上海黄浦 2025-05-15 07:35:15
0 跟贴 0
DeepMind通用科学智能体AlphaEvolve突破数学极限,陶哲轩合作参与

机器之心Pro 2025-05-15 15:55:26
5 跟贴 5
【DeepSeek谈艺】砂金·油画 | 在色彩的秘境里与时光深情对谈

文化视界网 2025-05-15 17:10:06
0 跟贴 0

特朗普宣布将研发F-55战机

环球网资讯

2025-05-15 20:50:40

泽连斯基：乌克兰将派出最高级别代表团参与谈判

泽连斯基：乌克兰将派出最高级别代表团参与谈判

国际在线

2025-05-15 18:03:09

太讽刺了，好多规则原来真的只是为普通人定制的！

太讽刺了，好多规则原来真的只是为普通人定制的！

吴女士

2025-05-14 19:07:30

医生调查发现：男性若长期不饮酒，用不了多久，身体或有4大变化

医生调查发现：男性若长期不饮酒，用不了多久，身体或有4大变化

小俎娱乐

2025-03-22 16:17:17

网友：这竟然是Angelababy ，真没认出来

网友：这竟然是Angelababy ，真没认出来

阿废冷眼观察所

2025-05-14 13:49:03

又轰下34+3+3！抱歉克莱：你从历史第一变成了历史第二

又轰下34+3+3！抱歉克莱：你从历史第一变成了历史第二

篮球大视野

2025-05-15 15:28:35

卡塔尔送礼送到心坎上，特朗普敢收吗？

卡塔尔送礼送到心坎上，特朗普敢收吗？

上游新闻

2025-05-15 15:45:21

王喜还原遭男友人迷奸细节：两次被下药迷晕，醒来后下半身已失禁

王喜还原遭男友人迷奸细节：两次被下药迷晕，醒来后下半身已失禁

素素娱乐

2025-05-15 08:35:59

巴外长当众感谢中国，但提到歼-10C时他称：是中巴联合研发的战机

巴外长当众感谢中国，但提到歼-10C时他称：是中巴联合研发的战机

红色鉴史官

2025-05-14 20:10:03

女儿取母亲200万遗产遭拒，银行：非本人不得支取，女儿只能配合

女儿取母亲200万遗产遭拒，银行：非本人不得支取，女儿只能配合

细微讲堂

2025-05-11 15:19:16

福州⇋广州！3.5小时！国务院批复了！

福州⇋广州！3.5小时！国务院批复了！

福州晚报

2025-05-15 19:34:04

又是全球唯一？霹雳-15E残骸暴露AESA导引头，印度抄袭怎么办？

又是全球唯一？霹雳-15E残骸暴露AESA导引头，印度抄袭怎么办？

红色鉴史官

2025-05-14 20:10:03

95年杭州夫妻花50万囤茅台酒，15年后，茅台价格让他们愣住

95年杭州夫妻花50万囤茅台酒，15年后，茅台价格让他们愣住

故事秘栈

2025-05-13 22:37:11

蒙古国终于想通了，说出隐藏18年的秘密，将对中俄“言听计从”？

蒙古国终于想通了，说出隐藏18年的秘密，将对中俄“言听计从”？

知鉴明史

2025-05-15 17:51:38

印巴空战连锁反应出现，印尼审查81亿美元阵风订单，马克龙尴尬了

印巴空战连锁反应出现，印尼审查81亿美元阵风订单，马克龙尴尬了

第一军情

2025-05-15 11:16:49

“内鬼”熊井泉，主动投案

政知新媒体

2025-05-15 18:34:19

上海黄浦江挡潮闸工程建设指挥部成立，组成人员名单公布

上海黄浦江挡潮闸工程建设指挥部成立，组成人员名单公布

澎湃新闻

2025-05-15 18:56:26

中方强烈敦促：立即停止军事进攻！否则——

中方强烈敦促：立即停止军事进攻！否则——

占豪

2025-05-15 04:08:13

土媒：葡萄牙足协与穆里尼奥就执教国家队达成初步协议

土媒：葡萄牙足协与穆里尼奥就执教国家队达成初步协议

懂球帝

2025-05-15 18:32:37

外交部：中方决定不同意台湾地区参加今年世卫大会

外交部：中方决定不同意台湾地区参加今年世卫大会

新京报

2025-05-15 16:19:02

AI产业主平台领航智能+时代

12706文章数 66036关注度

往期回顾全部

42岁软件工程师，因AI裁员！千份简历石沉大海，送外卖维生
2025-05-15 16:58
刚刚，DeepSeek首曝V3降成本秘诀！软硬协同突破Scaling天花板
2025-05-15 15:19
5090将被秘密定位？美或强制植入「地理追踪」，锁定英伟达高端GPU
2025-05-15 12:54

科技要闻

特朗普施压库克：不希望苹果在印度建厂！

头条要闻

卫健委：董某莹入学资格造假论文剽窃撤销其四项证书

体育要闻

越过山丘!郑钦文:山海皆可平罗马站4强

娱乐要闻

一场恋情瓜暴露了赵丽颖的真实处境

财经要闻

李强：把做强国内大循环摆到更加突出位置

汽车要闻

下半年上市/预计15万元左右长安启源A06官图发布

态度原创

亲子

教育

数码

旅游

时尚

亲子要闻

水解奶粉没营养，不能长期喝？

教育要闻

忻州市教育局通知：小学、初中期末考试时间定了！

数码要闻

七彩虹 AI PC 启赴台北，iGame M15 / M16 Origo 游戏本即将发布

旅游要闻

热闻|清明假期将至，热门目的地有哪些?

中年女人别瞎穿，把“四大天菜单品”盘明白，夏天美得太轻松

© 1997-2025 网易公司版权所有 About NetEase | 公司简介 | 联系方法 | 招聘信息 | 客户服务 | 隐私政策 | 不良信息举报 Complaint Center | 廉正举报 | 侵权投诉 Reporting Infringements