通义千问被曝部分跑通Agent自主改进闭环
💥我靠!除了DeepSeek和质谱,刘大一恒的新作也含蓄佐证了阿里巴巴Qwen 已部分跑通 RSI,Agent自主复刻应用,打通自改进闭环!
RecreationWorld让Agent在真实环境中自主复刻应用,通过探索-实现-验证循环生成可验证轨迹反哺训练。
参考应用即Oracle,形成可验证的自我改进数据飞轮。结合团队披露的Qwen3.8-Max零人工长期迭代,这是Qwen内部RSI技术的有力实证。
RSI证据分点:
1️⃣Agent自主探索参考应用→恢复行为规格→写代码实现→运行验证→对比差异迭代,交付可独立运行源码,不依赖原技术栈。
2️⃣参考应用作Oracle自动生成隐藏测试,支持长程自我纠错(单任务最长20小时,轨迹中位数282.5次工具调用)。
3️⃣生成的轨迹经筛选后SFT训练,模型在5个分布外基准全面提升,最高+17.9个百分点,并更频繁自验证输出。
4️⃣能力迁移到训练环境外的Agent任务,论文明确支持self-improvement,构成Agent生成数据→模型变强→更强Agent的递归闭环。
#Qwen #RSI #递归自改进 #Agent #通义千问 #刘大一恒