📡
谷歌DeepMind用强化训练让AI练临床看病
𝕏2026 年 8 月 11 日
📡
研究员用大模型做强化学习 意外重识人性
𝕏2026 年 8 月 11 日
📡
slime_framework 开源GLM-5.2级训练对齐工具
𝕏2026 年 8 月 11 日
📡
这项开源研究解决了大模型训练推理不一致问题
𝕏2026 年 8 月 7 日
📡
不用云端API,教你本地训练智能体
𝕏2026 年 7 月 29 日
📡
一个通用框架搞定足式机器人两类运动任务
𝕏2026 年 7 月 28 日
📡
原来强化学习给大模型带来的增益可以提前预测
𝕏2026 年 7 月 27 日
📡
强化学习环境数据整理才是RSI的核心?
𝕏2026 年 7 月 27 日
📡
有人提前猜连锁餐厅会转做强化学习环境
𝕏2026 年 7 月 26 日
📡
找RLVR新任务?可以试试这个全栈框架
𝕏2026 年 7 月 22 日
📡
现有强化学习基准太假,新基准更贴合真实场景
𝕏2026 年 7 月 14 日
📡
前沿实验室保密的RL训练环境,现在开源免费了
𝕏2026 年 7 月 13 日
📡
强化学习扩参竟能稳定提升元学习能力
𝕏2026 年 7 月 3 日
📡
整理了10款用于智能体强化学习的开源工具
𝕏2026 年 6 月 22 日
📡
PPO算法在大语言模型时代迎来第二发展浪潮
𝕏2026 年 6 月 18 日
📡
HomeMadeGarbage用OpenAI Codex构建具生物特征的交互机器人
𝕏2026 年 6 月 14 日
📡
Kyutai实验室用强化学习优化全双工语音模型交互性
𝕏2026 年 6 月 11 日
📡
新方法QGF优化扩散策略训练,避开BPTT不稳定性
𝕏2026 年 6 月 11 日
📡
SAERL用稀疏自编码器激活指导大模型训练数据工程
𝕏2026 年 5 月 28 日
📡
RL微调居然在拖大模型推理后腿
𝕏2026 年 5 月 23 日
📡
7B小模型当上了GPT-5的老板
𝕏2026 年 5 月 12 日
📡
UCLA教授把RL+LLM训练拆成手把手教程
𝕏2026 年 5 月 11 日
📡
GPT-5.4没训练,靠改代码打满分砖块
𝕏2026 年 5 月 9 日
📡
不用啃公式,写代码就能从CartPole玩到RLHF
𝕏2026 年 5 月 8 日
📡
训练AI代理不用手写奖励函数了
𝕏2026 年 4 月 29 日
📡
RL微调让大模型过早‘死机’?
𝕏2026 年 4 月 24 日
📡
经验回放能让大模型训练省掉四成算力
𝕏2026 年 4 月 15 日