有趣的观点,赞同。RSI是远超任何其他任务的长程复杂任务,现在才刚刚开始。
👋 奇绩创坛 行研 NeoLab 投资孵化组
感觉现在的 RSI 研究都跳不出旧方法论的审慎组合。Dream-RSI是一种好的工程效率手段,但仍然没有解决权重级自我改进这个更根本的问题。
这种方案还是无法跳出模型原有的数据分布,而且看起来也没有证明后一次的改进能够因为前一次的改进变得更会自我改进。以及,这种方法的 eval 仍然存在 reward hacking 的风险。
这些问题如果不解决,都不能算真正的 RSI。
👋 奇绩创坛 行研 NeoLab 投资孵化组