刚刚,Google DeepMind 联合马里兰大学等机构发布了一篇论文叫 Dream-RSI,研究的是递归自我改进(RSI,见:什么是RSI),但它的路线和我们的直觉上有点儿不太一样。
一般说到 RSI,首先想到的会是模型改自己的权重,或者自己训练自己。但 Dream-RSI 并不会改变模型权重,而是调整 Agent 的探索策略,也就是怎么搜索、开多少分支、什么时候止损、计算资源怎么分配等这些东西。
核心机制上,Agent 每次执行任务都会留下完整的探索历史,试过哪些方案、哪个分支失败了、花了多少计算。(有点像这个 AutoResearch :AI 交的实验报告,你敢信吗?)
Dream-RSI 把这些历史做成一个 Replay Simulator(重放模拟器),然后让 Agent 在里面“做梦”,去尝试各种反事实的假设:
如果当时先走另一个分支呢?
多开几个并行任务呢?
某个方向早点放弃呢?
……
因为历史结果都已经算过了并有结果了,所以这些实验几乎是零成本的。一次昂贵的真实探索后,便可以拿来跑成千上万次策略实验。
找到更好的策略之后,又可以再部署回真实世界。于是就形成了一个循环:探索 → 积累历史 → 做梦 → 改进策略 → 再探索。
效果方面,在 GPU Kernel 的四个任务里,最好的情况下达到同等性能只需要基线约 41% 的迭代次数(1/2.43),而在预算相当时性能最高可以达到基线的 2.09 倍。
论文里还有一个我觉得有点意思的实验:他们也尝试了更为传统的做法,把过去探索的经验总结出来后,塞回到 prompt 中用于指导下一轮。
结果,反而更差了。
因为这些总结出来的”经验”太容易变成偏见,让 Agent 过早集中在少数几个看起来对的方向上,探索多样性反而因此而变差了。
某个角度上来说,这有点儿像是带新人。
你把结论直接告诉他,他死死记住了,但遇到新的情况、变体,不会就还是不会。但如果让他自己把过程完整走一遍,该踩的坑都踩一踩,虽然慢一些,后面反而会走得更快。