网易首页 > 网易号 > 正文 申请入驻

震撼,谷歌破解了RSI?AI靠「做梦」学会无限进化

0
分享至


新智元报道


谷歌,可能已经破解了RSI!

就在刚刚,谷歌联合 Google DeepMind、马里兰大学及弗吉尼亚大学,发表了一篇重磅论文。

这一次,他们展示了一条完全不同的RSI路线:AI自我进化,居然可以靠做梦?

这一次,谷歌是让智能体把自己走过的每一步存成一棵树,然后在树里「做梦」。

在梦里练出更优的探索策略,再回到现实继续干。


论文地址:https://arxiv.org/abs/2609.14858

Dream-RSI的效果可以说是相当震撼:

算法优化任务,主流进化搜索系统需要跑51200代,Dream-RSI调用317次就达到了同等水平。

圆填充问题,追平谷歌自家AlphaEvolveV2的最强纪录。

GPU内核优化,达到同等性能,生成次数暴降2.43倍。

底层权重一字未改,Gemini 3.1 Pro和3.7 Flash均可套用。

此外还有一个更有意思的结论,人给AI指方向,反而比不指更差。

论文一挂上arXiv,X上先炸了。网友Mark Kretschmann高呼:「谷歌可能刚刚破解了递归自我改进」!



论文一作Tong Zheng是马里兰大学二年级博士生,今年夏天才以学生研究员的身份进入谷歌。他身后是17人的作者团,包括DeepMind研究员与讲席教授。


要实现递归自我改进,智能体必须学会做梦。而历史,就是它们做梦的世界。

Tong Zheng在Hugging Face上留下这样一句话,它也是整篇论文的内核。

历史,就是它做梦的世界

Dream-RSI要解决的,是整个进化搜索领域最卡脖子的一环。

以AlphaEvolve为代表的系统早已证明,让编码智能体跑进化搜索,能发现人类没找到的算法。但它们有一个死穴,探索策略全靠人手写死。

哪个分支该多分配算力,哪个分支该尽早剪掉,什么时候该开并行,全靠工程师预先定好。搜索空间一大,固定策略就会把算力砸进死胡同,而且还不长记性。

那让策略自己进化行不行?理论上行,但问题出在评估成本上。

评估一段候选代码,跑一次就知道好坏。而评估一套探索策略,则需要让它带着智能体从头跑完几百上千轮,看最后挖出来的东西好不好,才能给这套策略打分。每改一版策略,就要重跑一遍整个发现过程,等几天出一个分数,没人耗得起。

对此Dream-RSI的解法是,跑过的过程存下来,评估新策略时不再重跑,直接拿旧过程回放。

具体来说,它把「干活」和「决定怎么干」拆成了两层。

-底层是负责执行的「发现智能体」(Discovery Agent),由Gemini 3.1 Pro或3.7 Flash驱动。它每次接过一个工作区,读取上下文,改出一版新候选代码,交由评估器打分。

-顶层是轻量的编排层,里面装着「探索策略」(一段Python代码),决定每一轮从哪个节点继续、一次开多少个并行尝试、何时止损。

底层模型不动,自我进化的对象只有这段策略代码。


每一次真实探索的结果都会存进一棵「发现树」。根节点是初始工作区,每个子节点记着一次尝试的完整现场,包括文件系统快照、生成的产物、评估诊断和得分。

这棵树,就是模拟器

策略要做的决定只有一类,从哪些节点继续、一次开几个。而每个节点往下走会得到什么结果,树里已经记着了。

所以策略要迭代时,不用再去真实环境跑代码,直接在长好的树上重走一遍历史就行——

想试「这条路多走两步」,就读取树里对应的记录;想试「那条路早点放弃」,就少读几个节点。

整个评估过程不调用一次模型,不跑一行代码,只读历史。


论文把这种机制叫做「做梦」。就像棋手复盘,不需要重新摆盘再下一遍,翻棋谱就够了。

Dream-RSI 的运行闭环

基于这个洞察,谷歌构建了 Dream-RSI 框架。它的自我改进循环主要分为三个阶段:

1.真实探索:当前最新的探索策略 引导 Agent 并在真实环境中运行(例如调用 LLM、编译并执行代码),并将探索产生的所有路径、决策和执行反馈记录下来,作为一棵新的结构化探索树追加到历史数据库中。

2.构建模拟器:将更新后的历史数据库 转化为一个可重用的「重放模拟器池」 。

3.基于做梦的策略改进:一个专门的 LLM 策略开发 Agent 在这个模拟器里开始疯狂「做梦」 。它不断修改和重写探索策略的代码,产生上千个候选策略,并在重放模拟器上快速重放它们。

做梦的打分由三项构成,一是这一轮梦里找到的最优分数,二是扣掉尝试次数对应的成本,三是并行奖励,鼓励策略一轮批量跑多个尝试。

得分高的策略,就意味着它「多快好省」。


负责修改策略的,是另一个「策略开发智能体」。

它会盯着三样东西:当前策略在梦里走过的轨迹和分数,前几版修改的反馈,还有整棵发现树。然后,看完直接改写策略代码。

一轮改出若干版,每一版都丢回梦里打一次分,得分最高的那一版成为下一轮的正式策略。

这就意味着,新策略的下限是「原地踏步」,上限则是「无限进化」。

RSI的飞轮就此闭环。

为什么这个策略永远不会变差?

在离线改进阶段,策略开发 Agent 会经历多轮的代码迭代。由于当前的策略本身就被包含在候选池中,只有当新重写的策略在模拟器上的综合重放得分(平衡了探索质量、算力成本和并行效率)高于当前策略时,新策略才会胜出并被部署。

因此,在数学上,Dream-RSI 部署的新策略表现绝不会弱于上一代。 随着新策略被重新部署到真实世界中探索,它会带回更深、更广的探索树,从而让模拟器也随之进化。

智能体与它眼中的「世界」,就这样在相互咬合的齿轮中一同成长。


策略改好之后上线发掘新算法,历史变多,梦境更准,梦境更准,策略继续进化。树里没有的分支,梦里也走不到,所以每一轮真实探索都在给下一轮的梦扩地盘

第一版策略很朴素,只会开一堆独立的工作区各自埋头跑。到了后面的轮次,策略学会了精打细算。

在ConvDiv内核实验里,性能处在上升期的时候,策略主动把每轮尝试从110次砍到50次;一旦性能停滞,它又把探索力度拉满,分数随即再涨一截。

没有人教它这么干,这是它从自身历史中「悟」出来的。


317次碾压5万代:人类反而成了累赘

论文在三个领域进行了实测。

1.算法工程:Lasso 正则化路径求解器

第一个领域是算法工程,任务是Lasso正则化路径。这是高维统计里的老难题,要求在保证数值正确的前提下,把整条路径算得尽可能快。

用Gemini 3.1 Pro跑Dream-RSI,只调用了317次,就把求解器的平均运行时间从3587.1毫秒降到了2931.0毫秒。

相比之下,同一个模型换成固定策略,要调用550次才能到这个水平。基线SimpleTES为了拿到差不多的结果,一共生成了51200次。

换成更便宜的Gemini 3.7 Flash后,模型消耗了1879次调用,成功把运行时间做到了2350.6毫秒。

因为进化发生在探索这一层,和底层模型的大小没有关系,所以小模型一样能受益。


它挖出的求解器,基线的做法是根据问题维度,在LARS和坐标下降两种算法里二选一。而Dream-RSI找出来的方案,直接把自适应做进了活跃集优化内部。

具体来说就是,先用强规则筛一遍特征,再用柯西-施瓦茨不等式做KKT剪枝,只有当上界判断不了某个特征时,才回头计算精确梯度。

2.数学优化:三大高难度数学任务

数学优化这个领域,差距拉得更大。

在「和差问题」、「圆装填」和「自相关不等式」三个极耗算力的离散和几何优化问题中,Dream-RSI 在 1000 代 以内就达到或超越了极强的基线性能。

与需要 51,200 代算力开销的 SimpleTES 相比,Dream-RSI 节省了超过 50 倍的计算预算,且拿到了同等甚至更优的结果。


3.GPU 算子工程:KernelBench 极限压榨

第三个领域是GPU内核工程,也是谷歌自己最在乎的地盘。

在这里,论文总共测了四种内核。

VGG16和LayerNorm比的是省多少,把内核优化到和固定探索同样的性能,Dream-RSI需要的生成次数分别只有对方的1/2.43和1/1.79。

ConvDiv和ConvMax比的是强多少,给两边同样的预算,Dream-RSI优化出的内核性能分别是固定探索的2.09倍和1.44倍。


最后,研究团队把之前的历史轨迹提炼成方向性提示,塞进Prompt里「手把手」教智能体往哪走。

结果有些出乎意料,在同等预算下,加了人类引导的始终比不加的更差。

深度剖析:直接给 AI 「总结经验」,反而效果更差?

论文中,有一个非常反直觉的实验。

研究人员尝试了「经验总结法」,让大模型把历史总结成高层指导意见,去指导下一轮的探索。

然而实验结果却令人大跌眼镜:注入了高层次经验总结的 Agent,在探索表现上不仅没有提升,反而显著差于没有任何指导的原始 baseline !

背后原因就是,一旦你将经验生硬地抽象为「高层原则」,它们立刻就会转化为 AI 的认知偏见,过度约束 AI 的搜索空间,扼杀了探索的多样性,让AI困在局部最优解里。

相反,Dream-RSI 的「做梦」机制不提供任何「空洞真理」,它直接让新策略去碰撞具体的历史树,在微观的并行控制、分支优先级和提早停止规则上进行代码级优化。

这种方式保持了探索空间的开放和多样性,反而远胜于前者。

暑期实习生操刀一作,

身后是17人豪华天团

一作Tong Zheng(郑童),2021年本科毕业于东北大学,本科期间就在国内最硬的机器翻译组(肖桐组)做研究。

2024年他进入马里兰大学读博,师从黄恒教授。Dream-RSI正是他2026年夏天在谷歌做Student Researcher时的产物。


他从ICLR 2025让模型一次出多个草稿的投机解码,到ICLR 2026和ICML 2026的Parallel-R1和Parallel-Probe(用强化学习教模型并行思考),死磕始终是同一件事——别让模型一条路走到黑。

Dream-RSI打分里那项「并行奖励」,与这条线一脉相承。只不过,以前是让模型的思维并行,现在是让智能体的探索并行。

导师黄恒,马里兰大学首任Brendan Iribe讲席教授,约300篇顶会论文,手里7个NSF项目、3个NIH项目。这两年,黄恒组里的学生一头扎进大模型推理。

17人的作者团里,通讯作者Xidong Wu和Zheng Zhang在谷歌,DeepMind一侧有推荐系统圈都认识的SASRec作者Wang-Cheng Kang。

一个暑期实习生挂一作,身后一群资深研究员署名,谷歌内部对这条路线的重视程度,不言而喻。

通往 ASI 的隐秘通道,已经被打通了?

此前,谷歌产品负责人 Logan Kilpatrick透露重磅消息:谷歌正在死盯前沿,并且已经看到了RSI的早期迹象!

他拿Gemini 3.5到3.8大约每三到四周一更当证据,而且表示,Gemini 4将是迄今最大、最野心勃勃的预训练模型,希望借此回到争霸位置。

他强调,要把算力和人力投给写代码、做研究、做科学,因为这些最可能把下一轮训练变快变便宜。


为什么谷歌如此坚信,RSI正在发生?

因为 AI 自我改进的范式正在悄然改变。过去十年,行业里谈起RSI,大家想到的总是「AI自动修改自己的权重,训出下一代神明」。

但而 Dream-RSI 展示了另一种可能性:模型权重不一定要先变,它可以通过自我重写外围的「Harness」,来让自己变得强大!

当模型拥有这种强大能力,就会用最便宜的算力,去解决最难的问题。

正如论文结尾所说:

智能体必须学会做梦才能递归自我改进,而历史,就是它做梦时所处的整个世界。

随着 Gemini 4 等超大型预训练模型的临近,这种「在虚拟历史中做梦」的RSI到来,我们距离那场智能大爆炸,或许只有一步之遥了。

参考资料:

https://dream-rsi.com/

编辑:摩西 Aeneas

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
不卷了!都活通透了?有互联网大厂员工发帖感慨,如今六点、七点下班的情况越来越普遍

不卷了!都活通透了?有互联网大厂员工发帖感慨,如今六点、七点下班的情况越来越普遍

火山詩话
2026-09-17 18:27:00
影视飓风Tim反掰iPhone Duo致闪屏,称并未用力,苹果回应:博主单台设备测评片面

影视飓风Tim反掰iPhone Duo致闪屏,称并未用力,苹果回应:博主单台设备测评片面

齐鲁壹点
2026-09-17 17:02:26
外卖小哥赵家驹夺得世界级越野赛冠军 对话教练:奔跑中承受孤独,过程中曾主动让出第一名

外卖小哥赵家驹夺得世界级越野赛冠军 对话教练:奔跑中承受孤独,过程中曾主动让出第一名

红星新闻
2026-09-17 10:10:38
9月17日新消息!大家苦等的2026退休养老金到底涨不涨,怎么涨?

9月17日新消息!大家苦等的2026退休养老金到底涨不涨,怎么涨?

兵卒史
2026-09-17 15:19:10
著名演员突发心梗!年仅49岁,每天健身打篮球,没去日本救了条命

著名演员突发心梗!年仅49岁,每天健身打篮球,没去日本救了条命

古事寻踪记
2026-09-16 14:21:40
陈建州术后晒合照,王力宏帮其提尿壶,发长文自省:不抽烟不喝酒不应酬,但6年每天只睡三四小时,6点起床送小孩上学,“我以为撑得住”

陈建州术后晒合照,王力宏帮其提尿壶,发长文自省:不抽烟不喝酒不应酬,但6年每天只睡三四小时,6点起床送小孩上学,“我以为撑得住”

极目新闻
2026-09-17 20:52:18
网传某知名机器人被清华大佬狠批为上市圈钱大量造假,评论区炸锅

网传某知名机器人被清华大佬狠批为上市圈钱大量造假,评论区炸锅

慧翔百科
2026-09-17 11:52:47
金与正:朝鲜拥核地位从物理和法律上永久固定!

金与正:朝鲜拥核地位从物理和法律上永久固定!

IN朝鲜
2026-09-17 12:19:36
知名抄手店退出外卖平台巨头 对话创始人:每单外卖平均亏1元,专心做好堂食让人们走进餐厅

知名抄手店退出外卖平台巨头 对话创始人:每单外卖平均亏1元,专心做好堂食让人们走进餐厅

红星新闻
2026-09-17 19:32:12
榨干百姓讨好外人?老祖宗早说透:护不住饭碗,就别指望太平

榨干百姓讨好外人?老祖宗早说透:护不住饭碗,就别指望太平

再战五百回合
2026-09-17 19:38:17
退休副省长家里被盗,说还是不说

退休副省长家里被盗,说还是不说

阿亮评论
2026-09-17 13:55:16
“敲骨吸髓”式查税?中小企业最怕的不是补税,而是突然翻旧账

“敲骨吸髓”式查税?中小企业最怕的不是补税,而是突然翻旧账

风向观察
2026-09-17 19:21:43
9月17日,人社部、财政部关于2026年上调退休人员基本养老金通知公布之前,看病就医率先迎来了3个好消息

9月17日,人社部、财政部关于2026年上调退休人员基本养老金通知公布之前,看病就医率先迎来了3个好消息

白昼说故事
2026-09-17 09:40:26
总价至少100亿,全球第4个歼-10C用户将确认:已经启动最后步骤

总价至少100亿,全球第4个歼-10C用户将确认:已经启动最后步骤

巅峰高地
2026-09-17 17:10:29
1999 年公安部下达秘密指令抓捕赖昌星,福建省公安厅一位副厅长深夜接连拨打四通电话,他在通话中的一句话,令专案组成员全部大为震惊

1999 年公安部下达秘密指令抓捕赖昌星,福建省公安厅一位副厅长深夜接连拨打四通电话,他在通话中的一句话,令专案组成员全部大为震惊

温柔记事簿
2026-09-17 10:41:47
没想到,在敬一丹告别仪式上,55岁康辉竟因一个动作实现口碑暴涨

没想到,在敬一丹告别仪式上,55岁康辉竟因一个动作实现口碑暴涨

古书奇谈
2026-09-17 20:11:30
已击毙!乌克兰宣布重大战果!

已击毙!乌克兰宣布重大战果!

故事终将光明磊落
2026-09-17 08:13:53
男子救助摔倒老人反被索赔92万余元,老人家属主张男子驾驶电动三轮车产生的气流、噪声、惊吓等非接触因素可能致老人摔倒,法院:不予支持

男子救助摔倒老人反被索赔92万余元,老人家属主张男子驾驶电动三轮车产生的气流、噪声、惊吓等非接触因素可能致老人摔倒,法院:不予支持

都市快报橙柿互动
2026-09-17 19:02:19
突发!3家科技巨头,被查!

突发!3家科技巨头,被查!

证券时报
2026-09-17 14:23:11
佛州38岁女子与宠物狗发生不当行为被捕,丈夫查监控抓现行

佛州38岁女子与宠物狗发生不当行为被捕,丈夫查监控抓现行

环球趣闻分享
2026-09-17 13:10:13
2026-09-18 01:07:00
新智元 incentive-icons
新智元
AI产业主平台领航智能+时代
16209文章数 67073关注度
往期回顾 全部

科技要闻

影视飓风Tim反掰iPhoneDuo被质疑

头条要闻

深圳商铺楼板坍塌致1名收废品人员死亡 调查报告公布

头条要闻

深圳商铺楼板坍塌致1名收废品人员死亡 调查报告公布

体育要闻

逆转朝鲜,国足亚运队“啃老”过关

娱乐要闻

rapper赵涛恋情曝光!带甜馨妈妈散步

财经要闻

缺钱的追觅 隐藏的债务?

汽车要闻

猛士X700内饰公布 打造家庭泛越野智能座舱

态度原创

艺术
游戏
教育
旅游
公开课

艺术要闻

海因里希·伯默:德国写实风景画家

索尼Project Canis掌机参数曝光 目标2027年底推出

教育要闻

都叫七中不是一所学校成都家长最容易认错的集团校一篇分清

旅游要闻

忻州这2个地方,专门用来“虚度秋天”

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版