![]()
进入前沿牌桌不等于改变牌桌规则。
作者 | 许有阳
来源 | 盒饭财经(ID:daxiongfan)
头图及封面来源 | GPT
K3突然成了关注的焦点。
先是马斯克。
北京时间7月17日凌晨,马斯克在Artificial Analysis一条Kimi K3的评测帖下回复“Impressive”(令人印象深刻)。第二天,他又在谈及xAI正在训练的2万亿参数模型时表示,它“可能超过Kimi”。
随后,月之暗面Kimi在微博上隔空喊话:“欢迎加入「2万亿+」俱乐部”。
![]()
微博截图
为什么是“2万亿+俱乐部”?
7月16日晚,月之暗面发布新一代大模型Kimi K3,而“2万亿+”便是K3的参数规模范围。据月之暗面介绍,Kimi K3参数规模达2.8万亿,上下文窗口100万token,原生支持视觉理解,搭载自研KDA注意力算法,以及每个token从896个专家中激活16个。
Kimi K3的讨论范围,不只在海外的社交媒体。
Arena联合创始人兼CEO Anastasios Angelopoulos接受媒体采访时称,这可能是今年最大的一次模型发布。与此同时,K3登上Frontend Code Arena第一,在Artificial Analysis智能指数发布时排到第三。
![]()
而算力紧缺,又为K3的出圈添了一把火。
7月19日晚间,月之暗面旗下AI助手Kimi发布《关于算力紧缺与会员暂停开放的说明》,宣布即日起暂停C端新用户订阅,将现有算力全部用于保障已订阅用户权益,并全速推进扩容。
气氛的烘托中,K3的讨论中带上了“下一次DeepSeek”“DeepSeek时刻2.0”等话题。事实上,截至发稿前,许可证尚未披露,完整技术报告也仍未发布。
但如果把两者放到同一张账单上,差异随即出现。Artificial Analysis测得K3完成一项加权评测任务平均花费0.94美元,同一口径下DeepSeek V4 Pro约为0.04美元。K3已进入全球前沿比较,却没有复制DeepSeek最关键的一击。
确实看起来像2025年的DeepSeek
K3制造的冲击,更多来自它的比较对象突然变了。
据月之暗面公布,K3拥有2.8万亿总参数、原生视觉和100万token上下文,每个token从896个专家中激活16个。Artificial Analysis给出57分,发布时位列第三;在现实知识工作评测GDPval-AA v2中,它获得1668 Elo,高于Claude Opus 4.8和GPT-5.5,低于Claude Fable 5;在AA-Briefcase长程知识工作评测中,发布时仅次于Fable 5。
![]()
x截图
“虽然其整体性能仍然落后于最强大的专有型号Claude Fable 5和GPT 5.6 Sol,但Kimi K3在我们的评估套件中展示了前沿级别的性能,始终优于其他测试型号。”《Kimi K3:开放前沿智能》这样写道。
这些名次都有边界。
截至7月21日,K3已由发布时的第三移至第四。而Frontend Code Arena测量的是前端页面的视觉、交互和用户偏好,并不等于全部代码能力。
但,这些变化,也无法否认kimi完成了一次身份切换:K3不再只是“国产模型里表现不错”,而是直接进入Fable、GPT和Opus构成的全球比较。
一个直观的变化是,关注度从K3转向杨植麟本人。
K3发布后,杨植麟的导师Russ Salakhutdinov在X上公开祝贺;不少媒体先后刊发其人物侧写,海外科技媒体甚至单独写了一篇月之暗面会议室的命名方式。
![]()
x截图
2015年从清华大学毕业后,他前往卡内基梅隆大学攻读博士,参与Transformer-XL和XLNet等研究,直到2019年毕业。有媒体写道,杨植麟在卡内基梅隆大学读博期间,就以喜欢Pink Floyd等摇滚乐队闻名。这种个人趣味后来也进入公司命名:“月之暗面”取自Pink Floyd的同名专辑,Kimi则是杨植麟的英文名。
Pink Floyd,翻译过来为“平克·弗洛伊德”,这支乐队在1973年发布了一张名为《The Dark Side of the Moon》的专辑。专辑名翻译过来,就是“月之暗面”。
这种种很容易唤起DeepSeek式联想:一个年轻的研究者、非互联网大厂组织、以架构创新逼近前沿,再由一次集中发布闯入全球舆论。
但相似的出场方式,并不等于相同的商业动作。Kimi要做的一直都很清晰,并不是下一个“DeepSeek”。
3月25日,杨植麟在2026中关村论坛年会全体会议上,以《开源AI:加速探索智能上限》为题发表演讲,提出大模型发展核心判断,并系统披露Kimi最新技术路线与行业价值。期间,他将月之暗面的扩展方向概括为三条:提高token效率、拉长上下文、组织Agent集群。
不到四个月后,K3几乎就是这三个判断的实体化。
Kimi的目标,沿着一条线程工作下去
Token效率解决成本,长上下文解决容量,Agent集群突破顺序执行瓶颈。杨植麟对月之暗面规划的方向,共同指向了一个目的地:模型竞争正在从“一次回答”,转向“一条持续运行的任务线程”。
盒饭财经此前相关的文章中,都谈到了这一趋势——AI竞争要从“问答”,转为“任务执行和交付”。
聊天的终点是一段回复,工作的终点则是一个能够继续使用的结果。这个曾经承载“咨询”“搜索”功能的助手,要进一步上岗干活了。
那自然就会对他有新的要求。比如,要完成任务时,他得记住目标,还要阅读文件和网页,过程中自然也要调用终端及浏览器,保存中间产物。相对过去,这个流程就变长变复杂了。
如果这个助手中途某一步出错,它需要知道从哪里恢复,而不是让用户从头再来。如果它在工作时忘掉一句重要要求或限制条件,过去或许只是体验瑕疵,现在却可能意味着全部返工。
而100万token上下文并不等于长线程。更长的上下文窗口,像一张足够大的工作台,决定一次能摊开多少资料;而长线程则是一项持续推进的项目,还取决于状态保存、工具反馈、任务拆解和错误恢复。
K3的厉害之处,是和DeepSeek一样用技术显化了战略。
比如,KDA先处理长任务为什么越来越贵。
2025年10月,Kimi Team发布了名为《Kimi Linear: An Expressive, Efficient Attention Architecture》的相关研究。该论文中,已经用KDA与MLA组成混合注意力架构。在48B总参数、3B激活参数的实验模型上,论文报告KV Cache最高减少75%,100万token下解码吞吐最高达到全MLA基线的约6倍。
![]()
这当然不是K3实测,却说明如果读取和保存历史的成本无法下降,线程越长,产品越难成立。
而Attention Residuals处理网络深度上的信息稀释问题。
相关论文显示,模型可以根据输入选择此前层的表示,而不是固定地逐层相加。验证同样来自48B模型,不能据此声称“Agent不会忘记目标”,只能说明它为超深模型提供了更稳定的内部信息流。
![]()
还有,Stable LatentMoE。
它能让每个token只激活896个专家中的16个,把总容量与单次计算拆开。月之暗面称,这些架构和训练配方合计将扩展效率提高到K2的约2.5倍。截至发稿前,技术报告尚未发布,暂时无法拆分各项贡献。
然而,单模型变得更能装,并没有消除顺序执行的限制。
Kimi从K2.5引入Agent Swarm,到2026年4月的K2.6已扩展到最多300个子Agent和4000多次工具调用。官方称大规模搜索速度相较单Agent最高提高4.5倍,当前集群已经由K3驱动。每个子Agent保留自己的上下文,只向协调者汇报关键结论。也就是说,月之暗面不仅在拉长线程,还打算把它拆成一支临时组织。
产品也沿着同一方向展开。
6月3日上线Beta的Kimi Work以Kimi Code为内核,把本地文件、WebBridge、Skills和权限控制接入桌面。它还能系统拆解目标、调用工具,并最终交付文档、表格、演示文稿或代码。
K3又同时进入Kimi.com、Kimi Work、Kimi Code和API。这意味着,Kimi正在从底模走向运行时和工作入口。
K3与DeepSeek,在这里分岔
进入前沿牌桌不等于改变牌桌规则,DeepSeek当年真正让市场不安的,是它顺手把牌桌的价格锚定点改了。
2024年5月6日,DeepSeek发布V2,并以极低的API价格引发国内大模型价格战。不久后,在《暗涌Waves》的专访中,梁文锋表示,公司只是核算成本后定价,原则是不补贴,也不追求暴利。
这个判断在2025年1月20日变成了一个完整动作。
R1和R1-Zero发布当天,DeepSeek给出6个从1.5B到70B的蒸馏版本;API未缓存输入价为0.55美元、输出价为2.19美元/百万token。能力、价格、权重、许可和不同尺寸的模型同一天到位,开发者不仅可以调用,还可以下载、修改、部署和继续蒸馏。
到2026年4月24日发布V4 Pro时,这套动作仍然连贯。
V4 Pro拥有1.6万亿总参数、49B激活参数和100万token上下文,发布时同步开放MIT许可权重,并兼容OpenAI Chat Completions与Anthropic接口。截至7月21日,官方未缓存输入价为0.435美元、输出价为0.87美元/百万token。
DeepSeek降低的不只是token标价,而是获得、迁移和改造模型的门槛。
R1发布一周后的2025年1月27日,英伟达市值在一个交易日内蒸发约5930亿美元,创下当时美国上市公司单日市值损失纪录。当然,这不能代表算力不再重要,但足以记录这次市场的恐惧:如果接近前沿的能力可以低价获得、立即下载,还能被压进不同尺寸的模型,围绕稀缺智能建立的价格和资本开支叙事就必须重算。
“DeepSeek时刻”代表的是,能力进入前沿、价格骤降、权重和蒸馏模型即时可得。三件事同时发生,强模型才从稀缺产品向可兼容、可改造的供应品移动。
Kimi走的是另一条路。
截至7月21日,K3已经进入Kimi Work、Kimi Code和API,但完整权重承诺最迟于7月27日发布。价格方面,API未缓存输入为3美元、输出为15美元/百万token。
月之暗面称,编程负载缓存命中率超过90%,命中后的输入价会降到0.30美元,这能降低实际调用成本,却仍没有把K3放进DeepSeek式的低价区间。
![]()
制作:盒饭财经
Artificial Analysis的同口径结果把分岔显示得更直接。
K3完成一项加权评测任务平均花费0.94美元,V4 Pro约为0.04美元,相差约23.5倍。当然,这一指标包含评测中的输入、缓存、推理和输出token,并不等于企业真实项目的总成本。如果模型可以把工程师一周的工作压缩到一天,昂贵的token依然可能是便宜的劳动力。
但这也意味着,K3的溢价不能再靠参数和榜单解释,只能靠结果解释——更少的重试、更少的人工接管、更低的返工概率,以及更高的最终交付成功率。
选择长线程,Kimi必须回答的问题
K3押注的是,用户愿意为更高的任务完成概率付费。
而这意味着,Kimi面对的竞争不再局限于模型榜单。它需要依次证明这条线程值钱、可靠、留得住结果,并且能够规模化交付。
用户付费,不是为了2.8万亿参数本身,而是希望模型可以解决实际的问题。比如,某程序员用AI产品连续工作数小时,读完代码库,调用终端与浏览器,处理数千页材料,他的目的是有一个能继续使用的结果。但如果无法交付这样可继续使用的结果,那么再低的token单价也没有意义。
K3的技术选择都在服务这场赌博。
![]()
制作:盒饭财经
比如,价格方面。
K3没有必要在token标价上击败DeepSeek,但必须证明多付的钱能够换来更少的失败。AA的0.94美元只是一个更接近任务经济性的代理指标,它仍没有计入人工审核、外部工具、错误恢复和返工。只有进入企业的真实流程之后,成功任务总成本才会揭晓。Kimi押注任务价值,就必须接受这种比跑分更苛刻的核算。
比如,运行方面。
7月9日,OpenAI推出ChatGPT Work,并披露Codex周活跃用户超过500万,其中100万以上已经用于非软件工作。Codex已经把沙箱、越界操作审批、diff和测试闭环做成基础能力。而Anthropic也为Claude Code提供文件和网络隔离、修改前检查点与恢复能力。竞争已经从模型能否完成任务,推进到模型出错之后系统能否限制损失、验证结果并恢复现场。Kimi需要证明的,不是它能调用多少工具,而是能否让一个会犯错的模型安全地行动。
比如,入口方面。
7月15日发布的WPS灵犀专业版可以直接调用WPS文档内核与原生API,生成可编辑、可审阅的文档、表格和演示文稿。微软则在4月把Word、Excel和PowerPoint中的Agent能力推向全面可用。它们未必始终拥有最强底模,却掌握文件对象、格式、版本、企业权限和协作关系。
Kimi Work也在连接WPS、Canva、Notion和专业数据库,但这既是扩张方式,也暴露了位置问题。如果成果最终仍要回到Office继续编辑、审阅和流转,Kimi究竟是新的工作入口,还是被旧入口调用的一层模型能力?模型越强,其他平台吸收它的价值反而越容易。
还有,来自K3自身。
7月19日的公告称,过去48小时的用户请求量已经逼近现有推理集群承载上限。
这证明了关注度,也直接暴露了长线程的供给账单。一次聊天可能只调用模型几轮,一项持续数小时的编程、研究或多Agent任务却会反复推理、读写上下文、调用工具。而K3官方又建议采用64个以上加速器组成的supernode。
热度越高,月之暗面越需要同时维持服务质量、单位任务成本和毛利。如果扩容只能换来更多昂贵推理,长线程会成为一张不断增长的成本表。
巧合的是,DeepSeek发布R1后,OpenAI CEO Sam Altman也曾用“impressive”评价它,与马斯克评价K3时用了同一个词。
DeepSeek的关键一击已经写进价格、权重和产业扩散,它让前沿智能从稀缺产品变成低价、兼容的供应品。
K3没有重复这一击。杨植麟选择把模型送进更长的任务,让它读取更多材料、调动更多工具、组织更多Agent,最终拿走更多工作价值。它试图改变的不是一单位智能的价格,而是模型参与工作的长度。
参考资料:
1.《Kimi K3 achieves #3 in the Artificial Analysis Intelligence Index, comparable to Opus 4.8 and GPT-5.5》,Artificial Analysis
2.《月之暗面杨植麟专访:AI不是接下来一两年找到PMF,而是接下来十到二十年如何改变世界》,腾讯科技《潜望》
3.《算力紧缺!Kimi宣布:暂停新用户订阅!》,e公司官微
4.《Kimi K3:开放前沿智能》,K3官方博客
5.《月之暗面杨植麟:未来每个研究员将配海量Token,AI研发将进入AI 主导时代》,每日经济新闻
6.《Copilot’s agentic capabilities in Word, Excel, and PowerPoint are generally available》,微软官网
7.《揭秘DeepSeek:一个更极致的中国技术理想主义故事 |36氪独家》,暗涌Waves
8.DeepSeek-R1,GitHub
9.《DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning》
10.《金山办公推出 AI 办公智能体灵犀专业版,支持专业 Office 操作》,it之家
11.《Kimi Linear: An Expressive, Efficient Attention Architecture》,arXiv论文和GitHub仓库
12.《The Meeting Rooms At Moonshot, Company Behind Kimi 3, Are All Named After US Rock Bands》,OfficeChai
13.《Attention Residuals》,arXiv论文和GitHub仓库
14.《Agent Swarm能力》,Kimi官网
15.《Kimi Work Overview》,Kimi官网
16.《Kimi Code Overview》,Kimi官网
17.《ChatGPT 现已成为你攻坚克难的得力伙伴》,OpenAI官网
18.《在OpenAI内部安全运行Codex》,OpenAI官网
19.《Beyond permission prompts: making Claude Code more secure and autonomous》,Anthropic官网
20.《Enabling Claude Code to work more autonomously》,Anthropic官网
欢迎在评论区留言~如需开白请加微信:YPYP01234567
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.