网易首页 > 网易号 > 正文 申请入驻

DeepSeek又更新了,这次梁文锋没放大招|进击的独角兽

0
分享至


出品|虎嗅科技组

作者|宋思杭

编辑|苗正卿

头图|视觉中国

这是进击的独角兽第31篇,该系列关注月之暗面、智谱、MiniMax、阶跃星辰、零一万物、百川智能、面壁智能和DeepSeek共8家大模型独角兽公司。

梁文锋的热度一直在AI圈的Top级,尤其是今年。

从V4预览版发布,到后来的融资与IPO传闻,再到一份流传甚广的四小时谈话实录,DeepSeek的每一次动作,都能迅速成为行业话题。

7月31日下午,DeepSeek又更新了。

这次,DeepSeek只是在API文档的更新日志里宣布,V4-Flash正式版API上线公测。

从“正式版”和“公测”两个词同时出现来看,这并不是V4的最终形态。DeepSeek也特意强调,本次更新只涉及V4-Flash的API,V4-Pro及App、Web端模型均未发生变化,V4-Pro正式版还要再等等。

但这次更新依然值得关注。

从最新版本来看,V4-Flash-0731没有改变模型架构和参数规模,只重新进行了一次后训练。更新后,DeepSeek把几乎所有篇幅都用来强调它在Agent,尤其是Code Agent上的进步。

这意味着,V4-Flash并不是一次简单的模型更新。

DeepSeek正在尝试回答一个新的问题:到了Agent阶段,一家公司最需要的,究竟是一个能力最强的模型,还是一个足够强、足够快,也足够便宜的模型?


这一次,DeepSeek没有继续堆参数

V4-Flash并不是7月31日才第一次出现。

4月24日,DeepSeek发布V4预览版时,已经同时推出V4-Pro和V4-Flash。两者都是MoE模型,但体量差距明显:V4-Pro拥有1.6万亿总参数,每次推理激活49B参数;V4-Flash拥有284B总参数,每次只激活13B参数。两款模型均支持100万Token上下文。

在DeepSeek的定位里,Pro负责能力上限,Flash负责效率。

参数规模更大的V4-Pro,在世界知识以及高难度Agent任务上表现更好;V4-Flash则可以通过增加思考预算,在部分推理任务上接近Pro。换句话说,Flash牺牲了一部分知识容量,却用更小的激活参数换来了速度和成本。

7月31日的更新没有改变这套架构。

DeepSeek明确表示,V4-Flash-0731与预览版的模型结构、尺寸完全一致,仅重新进行了后训练。

但就是这次后训练,让V4-Flash的Agent能力出现了明显变化。

按照DeepSeek公布的结果,V4-Flash-0731在Terminal Bench 2.1上达到82.7,在NL2Repo上达到54.2,在DeepSWE上达到54.4,在Toolathlon Verified上达到70.3。DeepSeek称,这些结果已经大幅超过V4-Pro预览版。

这件事的意义在于,DeepSeek没有通过增加参数和重新预训练,来提高模型的Agent能力。

用通俗的话来讲就是,DeepSeek虽然继续在追求AGI,但是并没有通过一味地增加参数来实现这件事情,而是让模型学会更好地拆解任务、调用工具、执行代码,并在更长的任务轨迹中减少错误。

过去,大模型公司的主要竞争发生在预训练阶段。谁有更多算力、更多数据,谁就有机会训练出参数更大、知识更多的模型。但进入Agent阶段后,模型能力不再完全由预训练决定。

一个模型会不会使用终端,能不能在数百次交互中维持任务状态,遇到错误后能否修正,以及是否知道什么时候应该调用什么工具,这些能力越来越依赖后训练、强化学习和模型外部的执行框架。

V4-Flash的变化,恰好说明了这一点。

这也是为什么,DeepSeek这次除了更新模型,还原生支持了Responses API,并专门适配Codex。同时,DeepSeek在测试Code Agent任务时,使用了尚未正式发布的DeepSeek Harness minimal mode。

换句话说,这些Agent成绩不完全属于模型本身,而是属于“模型、推理预算与Harness”共同组成的系统。

这当然也意味着,目前公布的数据仍需谨慎看待。

一方面,部分结果来自DeepSeek内部测试集;另一方面,DeepSeek Harness尚未公开,外界还无法在完全相同的环境下复现这些成绩。正式版V4-Flash究竟比预览版进步了多少,还需要等待独立评测以及真实开发场景验证。

但至少从这次更新可以看出,DeepSeek正在从只提供模型和API,向Agent所需要的执行环境多走一步。

但DeepSeek目前还没有亲自做一个完整的Agent产品,却开始提供让模型进入Agent工作流所必需的接口、适配和Harness。

这是一种非常克制的产品化。


为什么是Flash?

既然V4-Pro的能力上限更高,DeepSeek为什么不先更新Pro?

最直接的原因是,Agent并不是一次模型调用。

在聊天机器人阶段,用户提出一个问题,模型生成一次答案,一次交互就结束了。但在Agent任务里,模型需要先理解目标,再拆解任务、检索信息、调用工具、读取结果、修正错误,最后完成交付。

一个复杂任务,可能包含几十次甚至数百次模型调用。

这时,模型单次推理增加的成本和延迟,会在整个任务轨迹中被不断放大。一个能力更强、但速度更慢、成本更高的模型,未必能带来更好的实际结果。

Agent真正需要的,往往不是每一步都调用能力最强的模型,而是在绝大多数步骤中,使用一个能力足够、价格更低、响应更快的模型。

这正是V4-Flash的价值。

根据DeepSeek技术报告,在100万Token上下文下,V4-Flash单Token推理所需的计算量,约为V3.2的10%,KV Cache则约为V3.2的7%。它的总参数只有V4-Pro的约六分之一,每次激活参数也只有Pro的约四分之一。

这种差距最终也体现在API定价上。

目前,V4-Flash每百万Token未命中缓存的输入价格为1元,输出价格为2元;V4-Pro分别为3元和6元。V4-Flash的并发限制为2500,Pro则为500。Responses API目前也只有V4-Flash支持,V4-Pro预计到8月初才会接入。

在V4的产品体系里,Pro负责证明DeepSeek的模型能力能够达到什么位置,Flash则负责承担真正高频、长链条的Agent任务。前者是能力模型,后者更像生产模型。

梁文锋曾在内部公开说道,“模型应该放在相同成本下比较;在现阶段,Coding Agent的优先级高于其他垂直Agent。”

从这个角度来看,V4-Flash此次更新的方向,确实与这两个判断形成了呼应。

DeepSeek没有选择通过扩大参数,让Flash在所有能力上追上Pro;它选择在模型架构不变的情况下,通过后训练和Agent框架,提高Flash完成真实任务的能力。

这背后是一种更现实的计算。

如果Agent最终要进入企业和开发者的日常工作流,那么决定模型能否被大规模使用的,不只是Benchmark,而是完成一个任务需要多少时间、消耗多少Token,以及最终成功率是多少。

不过,这也是V4-Flash目前最需要证明的地方。

DeepSeek公布的Agent成绩大多使用Max reasoning effort完成。更高的思考强度通常意味着更长的推理过程和更多Token消耗。一个模型每百万Token的价格很低,不等于完成一项任务的总成本一定更低。

如果V4-Flash需要消耗更多Token才能达到接近Pro的效果,那么它在单价上的优势,可能会被更长的任务轨迹部分抵消。

因此,真正有价值的对比,不是V4-Flash在某一项Benchmark上超过了谁,而是在完成同一个Agent任务时,它与V4-Pro、Kimi、GLM以及闭源模型分别需要多少Token、多少时间和多少次重试。

DeepSeek暂时还没有给出这个答案。

本文来自虎嗅,原文链接:https://www.huxiu.com/article/4879740.html?f=wyxwapp

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
2003年,傅作义之子怒斥亲姐傅冬菊多年,临终前道出心里话:我对她深仇大恨无关阵营,背后残酷内情首度公开!

2003年,傅作义之子怒斥亲姐傅冬菊多年,临终前道出心里话:我对她深仇大恨无关阵营,背后残酷内情首度公开!

磊子讲史
2026-07-28 11:20:06
唐屹峰同志任广东省委委员、常委

唐屹峰同志任广东省委委员、常委

上观新闻
2026-07-31 19:55:41
属虎人当心:8月1-3日这两天 三件事千万别碰,碰了容易惹祸上身

属虎人当心:8月1-3日这两天 三件事千万别碰,碰了容易惹祸上身

周哥一影视
2026-08-01 09:43:03
新诺基亚N73这颜值,要直接封神啊

新诺基亚N73这颜值,要直接封神啊

搞机小帝
2026-07-31 15:42:00
伊埃拉先后淘汰郑钦文和费尔南德斯!携手奶锁定华盛顿站女单八强!

伊埃拉先后淘汰郑钦文和费尔南德斯!携手奶锁定华盛顿站女单八强!

山野卢员外
2026-08-01 10:31:14
陈赓深夜路过莲花山时,被一彪形大汉拦住,陈赓:你想要干什么?

陈赓深夜路过莲花山时,被一彪形大汉拦住,陈赓:你想要干什么?

历史龙元阁
2026-07-31 06:00:20
生了孩子才懂,基因和教育都很无力,网友:生到学渣孩子才懂!

生了孩子才懂,基因和教育都很无力,网友:生到学渣孩子才懂!

另子维爱读史
2026-07-30 20:15:45
你在工作中捅过哪些篓子?网友:我捅的大,我先说!笑死在评论区

你在工作中捅过哪些篓子?网友:我捅的大,我先说!笑死在评论区

夜深爱杂谈
2026-07-31 20:26:52
10000mAh!新机官宣:8月4日,正式发布上市!

10000mAh!新机官宣:8月4日,正式发布上市!

科技堡垒
2026-07-31 08:58:17
反转!被骂了几十年的,“垃圾食品”,原来都是资本谎言?

反转!被骂了几十年的,“垃圾食品”,原来都是资本谎言?

命运自认幽默
2026-07-29 12:05:24
隔代亲能厉害到什么程度?网友:能打败嫡长子的只有嫡孙子!

隔代亲能厉害到什么程度?网友:能打败嫡长子的只有嫡孙子!

另子维爱读史
2026-07-31 20:21:42
美日欧偷笑:中国电商请继续内卷!千万别来祸害我们

美日欧偷笑:中国电商请继续内卷!千万别来祸害我们

菁菁子衿
2026-07-27 11:31:53
菲政坛大地震!杜特尔特儿子当众宣战,菲两大政治豪门正式决裂?

菲政坛大地震!杜特尔特儿子当众宣战,菲两大政治豪门正式决裂?

晓旓就是我
2026-07-31 09:55:18
为什么说印度重启边境贸易是场危险博弈?

为什么说印度重启边境贸易是场危险博弈?

烽火瞭望者
2026-08-01 06:24:08
什么审美?看看姆巴佩的审美,才叫顶级男人的征服欲

什么审美?看看姆巴佩的审美,才叫顶级男人的征服欲

莫地方
2026-07-13 22:58:13
越是高温,越要控制锻炼?提醒:60岁后,锻炼别犯这3个致命错误

越是高温,越要控制锻炼?提醒:60岁后,锻炼别犯这3个致命错误

观星赏月
2026-08-01 06:09:08
泰国部长称:钱可以买商品或服务,但买不到凌驾泰国人的特权!

泰国部长称:钱可以买商品或服务,但买不到凌驾泰国人的特权!

大稻网络科技
2026-07-31 09:46:32
太真实!为何大家永远爱周星驰,却慢慢看腻黄渤、张译、雷佳音?

太真实!为何大家永远爱周星驰,却慢慢看腻黄渤、张译、雷佳音?

许三岁
2026-07-30 11:19:56
多名院士呼吁快停止食用,吃一口等于14斤塑料袋,女子因肾衰走了

多名院士呼吁快停止食用,吃一口等于14斤塑料袋,女子因肾衰走了

任医生聊健康
2026-06-18 22:00:09
妻子的男同事坐在男主人的位置上,我妈端着一杯白酒就泼了过去

妻子的男同事坐在男主人的位置上,我妈端着一杯白酒就泼了过去

烟火人间故事汇
2026-02-09 19:00:13
2026-08-01 11:19:00
虎嗅APP incentive-icons
虎嗅APP
个性化商业资讯与观点交流平台
27040文章数 687960关注度
往期回顾 全部

科技要闻

特斯拉拆不掉中国制造

头条要闻

媒体:安倍晋三给中国添的堵 高市早苗又来一遍

头条要闻

媒体:安倍晋三给中国添的堵 高市早苗又来一遍

体育要闻

欧足联掀桌!因凡蒂诺这次真玩大了?

娱乐要闻

周星驰质疑董宇辉看《大话西游》500遍

财经要闻

宇树造富盛宴:王兴兴将跻身百亿富豪

汽车要闻

听劝!换回机械门把手,这才是碳基生物该开的车!

态度原创

教育
健康
时尚
旅游
本地

教育要闻

A-level预估成绩被指性别偏见:女生被给更高分?

中风易复发!谈中风康复与二级预防

推广中奖名单-更新至2026年7月10日推广

旅游要闻

滨水光影邂逅露台烟火,解锁上海夏夜新玩法

本地新闻

神仙也“蓉”漂,哪吒与八仙,皆是成都出品!

无障碍浏览 进入关怀版