Google DeepMind姚顺宇谈RSI技术方向
AGI House RSI Google DeepMind 姚顺宇访谈
姚顺宇:RSI 是一个 spectrum,和 RL / RFT 最大的区别是迭代自己的 recipe。终局条件下 RSI 是一个 system problem 而不是一个 model problem,包括 harness 和 cuda 等硬件。定义和 eval 是现在模型的弱点但不是不能解决的。
从效果上来说,需要 scale up 模型规模并不需要 scale up 模型团队规模;从需求上说,是现有模型的一个 bug / missing block。
在过去的几个月里有很多 startup 的出现,但是我们更关心 private 的落地,gemini 3.8 flash 后训练的 core recipe 是 model 自己决定的,作为一个 blue sky 的目标慢慢变成一个可以实际落地的问题,不只是 google 的 strategy 而是所有 lab 的 strategy。
我不觉得有什么事情是绝对不能让 model 做的,人就是在一直 change 自己的行为方式,存在某些场景更 sensitive 但是不存在一个第一性原理,比如 auto safeguard 是一个很难的事。当模型能力在不断提升并超过人类的时候,怎么去限制住是一个 positive 的研究方向,是一个我一直在花时间去更深刻学习的方向。
Q:来自华为,long horizon 我们用 multi agent 做,但是单 agent 怎么获得 PRM
A: 最大的问题是不 scalable,百分比 / LLM-based,这个问题是本质难的,需要 max 模型在这个 ctx 下的表现,但是没有一个明确的突破口
Q:腾讯投资,生产力场景很难 verify 模型结果而依赖人工,请问未来这些场景怎么任务闭环
A:还没人干出来,历史上都是 RM-based,我也不太懂法律,我可能会先去做 vertical 看人怎么 build RM system,包括 signal 和 query system
Q:基模研究员,作为一个 researcher 来说 taste 很重要,如果 model 真的能做 research,收集足够多 cot data 有什么本质难的卡点
A:没有,taste 个人感觉更多来自于经验积累没有什么 magic 就是合理的积累,存在模型做的不够好的事就是 internal diversity 不够深但是 empirical
Q:最难的是不是证明模型自己真的改进了
A:是,最难的是 reward hack versus 多个 model,model 怎么真的去 eval 它的进步,最难的是定义问题而不是解决问题
Q:researcher I+,AI researcher 可以积累大量 exp,能不能沉淀为 taste 的一部分;可以做大量 search space 的工作,但是怎么去发现非 search space 的
A:利用 latent 的 high level data;模型很强的是 reputation,diversity 没有那么强