AI Pulse

强化学习

1 篇文章 · 54 条信号 · 持续更新

📡

适配多模型的Multi-harness RL训练工具开源

𝕏2026 年 9 月 17 日
📡

MiMo-V2.6 正在进行强化学习扩展训练

𝕏2026 年 9 月 17 日
📡

小米MiMo团队押注RL 砸算力训练大模型

𝕏2026 年 9 月 17 日
📡

fal优化H3 Max,5秒视频3秒内生成

𝕏2026 年 9 月 16 日
📡

博主整理AI Agent强化学习学习材料

𝕏2026 年 9 月 16 日
📡

natolambert发布《通过永不放弃学习解决大语言模型强化学习中的难题》(2609.13443)

𝕏2026 年 9 月 16 日
📡

FlashREINFORCE 解决异步 RL 经典取舍问题

𝕏2026 年 9 月 14 日
📖

前沿实验室的共同做法:一次尝试,一台真机

AI大语言模型2026 年 9 月 12 日
📡

T1模型超GLM-5.1,强化学习性能提升显著

𝕏2026 年 9 月 11 日
📡

dsh配合大语言模型内部强化学习的五个技术发现

𝕏2026 年 9 月 11 日
📡

Gradient提出DynaWeb,靠想象训练网络智能体

𝕏2026 年 9 月 10 日
📡

JustRL II 优化长上下文强化学习 GRPO

𝕏2026 年 9 月 8 日
📡

研究员回忆 RLSlow 最初的研究思考

𝕏2026 年 9 月 7 日
📡

adithya_s_k发布代码模型强化学习涂鸦完整开源复现项目

𝕏2026 年 9 月 3 日
📡

批量缩放研究对大模型强化学习训练的启示

𝕏2026 年 9 月 3 日
📡

网友分享4个AI入门有用的教程视频

𝕏2026 年 9 月 3 日
📡

Cameron Wolfe 拆解了LLM后训练烧算力环节

𝕏2026 年 9 月 1 日
📡

AI研究者看好HuggingFace合作方的强化学习训练项目

𝕏2026 年 8 月 28 日
📡

@Thom_Wolf发布Microduck 定价不到400美元

𝕏2026 年 8 月 27 日
📡

DiffusionOPSD 优化扩散模型训练效率最高提44%

𝕏2026 年 8 月 27 日
📡

adaption_ai发布AutoScientist Alignment 功能

𝕏2026 年 8 月 25 日
📡

@kickingkeys提出可用代码模型强化学习做JS绘图

𝕏2026 年 8 月 24 日
📡

NVIDIA开源Molt:轻量可扩的智能体训练框架

𝕏2026 年 8 月 23 日
📡

siddarthv66 @ MistralAI发布LE CRITIQUE 研究论文(2)

𝕏2026 年 8 月 19 日
📡

radixark发布Miles v0.1开源强化学习框架

𝕏2026 年 8 月 19 日
📡

Sergey Levine发布Deep Reinforcement Learning 2026春季版课程资料(2026)

𝕏2026 年 8 月 17 日
📡

业内人士惊叹多架构智能体委托的强化学习系统搭建

𝕏2026 年 8 月 17 日
📡

TEMPO方法提升ARC-AGI-3平均分超三成

𝕏2026 年 8 月 15 日
📡

谷歌DeepMind用强化训练让AI练临床看病

𝕏2026 年 8 月 11 日
📡

研究员用大模型做强化学习 意外重识人性

𝕏2026 年 8 月 11 日
📡

slime_framework 开源GLM-5.2级训练对齐工具

𝕏2026 年 8 月 11 日
📡

这项开源研究解决了大模型训练推理不一致问题

𝕏2026 年 8 月 7 日
📡

不用云端API,教你本地训练智能体

𝕏2026 年 7 月 29 日
📡

一个通用框架搞定足式机器人两类运动任务

𝕏2026 年 7 月 28 日
📡

原来强化学习给大模型带来的增益可以提前预测

𝕏2026 年 7 月 27 日
📡

强化学习环境数据整理才是RSI的核心?

𝕏2026 年 7 月 27 日
📡

有人提前猜连锁餐厅会转做强化学习环境

𝕏2026 年 7 月 26 日
📡

找RLVR新任务?可以试试这个全栈框架

𝕏2026 年 7 月 22 日
📡

现有强化学习基准太假,新基准更贴合真实场景

𝕏2026 年 7 月 14 日
📡

前沿实验室保密的RL训练环境,现在开源免费了

𝕏2026 年 7 月 13 日
📡

强化学习扩参竟能稳定提升元学习能力

𝕏2026 年 7 月 3 日
📡

整理了10款用于智能体强化学习的开源工具

𝕏2026 年 6 月 22 日
📡

PPO算法在大语言模型时代迎来第二发展浪潮

𝕏2026 年 6 月 18 日
📡

HomeMadeGarbage用OpenAI Codex构建具生物特征的交互机器人

𝕏2026 年 6 月 14 日
📡

Kyutai实验室用强化学习优化全双工语音模型交互性

𝕏2026 年 6 月 11 日
📡

新方法QGF优化扩散策略训练,避开BPTT不稳定性

𝕏2026 年 6 月 11 日
📡

SAERL用稀疏自编码器激活指导大模型训练数据工程

𝕏2026 年 5 月 28 日
📡

RL微调居然在拖大模型推理后腿

𝕏2026 年 5 月 23 日
📡

7B小模型当上了GPT-5的老板

𝕏2026 年 5 月 12 日
📡

UCLA教授把RL+LLM训练拆成手把手教程

𝕏2026 年 5 月 11 日
📡

GPT-5.4没训练,靠改代码打满分砖块

𝕏2026 年 5 月 9 日
📡

不用啃公式,写代码就能从CartPole玩到RLHF

𝕏2026 年 5 月 8 日
📡

训练AI代理不用手写奖励函数了

𝕏2026 年 4 月 29 日
📡

RL微调让大模型过早‘死机’?

𝕏2026 年 4 月 24 日
📡

经验回放能让大模型训练省掉四成算力

𝕏2026 年 4 月 15 日

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新