芝芝 zzzhizhi⚒️ 创造、思考,或一切7天前感觉现在的 RSI 研究都跳不出旧方法论的审慎组合。Dream-RSI是一种好的工程效率手段,但仍然没有解决权重级自我改进这个更根本的问题。 这种方案还是无法跳出模型原有的数据分布,而且看起来也没有证明后一次的改进能够因为前一次的改进变得更会自我改进。以及,这种方法的 eval 仍然存在 reward hacking 的风险。 这些问题如果不解决,都不能算真正的 RSI。谷歌重磅发布Dream-RSI,最新RSI研究!mp.weixin.qq.comhttps://mp.weixin.qq.com/s