Google、DeepMind 与大学合作团队于 9 月 14 日发布 Dream-RSI 论文,提出一种元探索框架:AI 代理无需重新执行实验,即可通过历史“探索树”的重播机制,在模拟环境中测试并改良搜索策略。现有 AI 代理每测试一种新的探索策略,都必须重新运行完整实验;Dream-RSI 则将过去的实验记录转换为可重复使用的模拟器。
Dream-RSI 的三步运行机制:线上探索、构建重播模拟器与做梦式策略改良Dream-RSI 的整体机制分为三个循环步骤:
Step 1:线上探索:使用当前探索策略派出 Coding Agent 执行真实实验,在探索过程中将所有分支决策及执行结果完整记录为 Discovery Tree(探索树),并存入历史记录。
Step 2:构建重播模拟器:将探索树转换为可重复使用的“模拟器”,并放入 Simulator Pool(模拟器池),从而可以在其中模拟各种搜索路径,而无需真正重新执行底层代码。
Step 3:做梦式策略改良:另一个“策略开发 Agent”在模拟器池中不断提出新的探索策略代码,直接在模拟器中评估这些策略应用于历史数据时的表现(包括性能曲线和执行记录),再根据反馈修改策略并反复循环,同时将每次尝试也存回历史记录。最终,改良后的策略会被送回 Step 1 重新部署,以积累更多探索树并充实模拟器池。
论文提出的 Replay Objective 公式会对每个候选策略进行评分,主要考量三点:策略在模拟中找到的最佳结果、总尝试次数(尝试次数越多,扣分越多,以避免盲目尝试),以及策略是否将尝试打包成并行批次执行(如果做到则加分)。在多段历史记录上取平均后,得分最高的版本将成为下一轮线上部署的策略。
Lasso 求解器测试:代理调用次数减少 42%,计算量比 SimpleTES 少约两个数量级论文的第一项测试是让 AI 代理编写更快的 Lasso 求解器(Lasso 是机器学习中常见的回归方法)。使用 Gemini 3.1 Pro 时,固定策略生成的求解器平均执行时间为 3,587.1 毫秒,共调用 AI 代理 550 次;Dream-RSI 仅调用 317 次,便达到 2,931.0 毫秒的平均执行时间,在减少调用次数的同时提升了性能。换用较轻量的 Gemini 3.7 Flash 后,Dream-RSI 通过 1,879 次调用达到 2,350.6 毫秒,相比固定策略的 3,200 次调用减少约 41%。
与 SimpleTES 相比,SimpleTES 生成了 51,200 个候选解;Dream-RSI 仅使用约少两个数量级(约 100 倍)的计算量,就找到了更优的解法。Dream-RSI 生成的代码优化方法包括:分两阶段判断哪些变量可以提前排除、通过特定筛选规则减少不必要的计算、使用 CPU SIMD 指令加速,以及将程序读取内存的次数减少 75% 的技巧。
数学优化与 GPU 代码调优测试结果第二组测试包含三道数学优化题。在 Sum-Diff 问题上,Dream-RSI 获得 1.145427 分,优于 SimpleTES 和固定探索两个对照组;在 Circle Packing 问题上,Dream-RSI 获得 2.635983 分,追平了目前已知的最佳纪录(为并列,而非超越);在 Autocorrelation 问题上,Dream-RSI 仅生成不到 1,000 个候选解便获得 1.456375 分,生成次数非常少,但相比前两题,成绩并不突出。
第三组测试是 GPU 代码调优。在 VGG16 和 LayerNorm 运算上,Dream-RSI 分别以固定策略 1/2.43 和 1/1.79 的生成次数达到相同的执行性能;在 ConvDiv 和 ConvMax 运算上,Dream-RSI 在使用相近计算资源的情况下,分别将执行速度提升了 2.09 倍和 1.44 倍。
Dream-RSI 的自适应节奏与框架的已知限制研究团队发现,Dream-RSI 学到的探索策略会自行调整节奏:当性能持续提升时,策略会自动减少每轮尝试次数,集中资源深入优化当前方向;一旦性能陷入停滞,策略则会增加尝试次数并开启更多并行分支,以寻找突破瓶颈的新方向。
论文同时明确指出了三项限制:Dream-RSI 改变的是探索策略代码,而不是模型本身的训练参数;重播只能依据已记录的结果进行模拟,策略开发过程本身的算力成本未计入评估;此外,模拟中的表现也无法保证与线上真实部署后的效果一致。
常见问题 Dream-RSI 框架的核心概念是什么?与传统 RSI 方法有何不同?根据 2026 年 9 月 14 日发布的论文,Dream-RSI 是一种元探索框架,其核心区别在于:它将历史实验记录(探索树)转换为可重复使用的模拟器,使策略开发 Agent 无需重新运行真实实验,即可评估和改良搜索策略。传统做法(线上探索)则要求每次测试新策略时都重新执行完整实验,因此会消耗大量算力。
在 Lasso 求解器测试中,Dream-RSI 相比固定策略和 SimpleTES 的具体改进幅度是多少?根据论文,使用 Gemini 3.1 Pro 时,Dream-RSI 通过 317 次代理调用达到 2,931.0 毫秒的平均执行时间,相比固定策略的 550 次调用减少约 42%;相比 SimpleTES 使用的 51,200 次候选解生成,Dream-RSI 仅使用约少两个数量级(约 100 倍)的计算量,就找到了更优的解法。
Dream-RSI 框架的主要限制是什么?根据论文,主要有三项限制:框架改变的是探索策略代码,而不是重新训练模型参数;重播模拟只能依据已记录的历史结果进行,策略开发过程本身的算力成本未计入评估;模拟中的表现无法保证与线上部署后的效果一致。
免责声明:以上内容(如有图片或视频亦包括在内)均为平台用户上传并发布,本平台仅提供信息存储服务,对本页面内容所引致的错误、不确或遗漏,概不负任何法律责任,相关信息仅供参考。
本站尊重他人的知识产权、名誉权等法律法规所规定的合法权益!如网页中刊载的文章或图片涉及侵权,请提供相关的权利证明和身份证明发送邮件到909075378@qq.com,本站相关工作人员将会进行核查处理回复


发表评论 取消回复