1.强化学习+扩散模型重大创新思路分享:

轨迹扩散 × 离线强化学习(Offline RL)

LDCQ++:基于潜变量轨迹扩散约束开展离线Q学习

ReDiffuser-X:具备置信门控功能的轨迹扩散规划器

 

2.扩散策略(Diffusion Policy)× 在线微调与探索

DPPO-Q:融合扩散策略的策略梯度与价值引导进行协同微调

EDP-URL:基于无奖励预训练的探索型扩散策略

 

3.扩散世界模型(World Model)× 模型式RL(MBRL)

DIAMOND-Lite:具备高保真视觉的扩散世界模型的轻量化决策方案

DOME-Drive:基于3D占用网格的扩散世界模型的自动驾驶规划方案

 

4.人类偏好对齐(RLHF/DPO)× 扩散生成/决策一体

Diffusion-DPO-RL:构建从偏好对齐到可执行策略的端到端链路

RLHF-T2I-to-Act:将文本 - 图像扩散的偏好对齐迁移至机器人动作领域

 

5.安全/约束/风险敏感 × 扩散策略与轨迹

FISOR-Diff:在可行域引导下开展安全离线扩散策略学习

CVaR-Guided Sampler:基于风险敏感的扩散采样与策略改进方案

 

6.采样效率/可控性 × 扩散引导的统一优化框架

Auto-Guidance:将扩散梯度引导视为一种一阶优化的自适应调度方法

PolyGRAD:利用策略 - 引导的轨迹扩散合成进行on-policy评估

 

📚另外,我整理了十篇关于强化学习的最新论文及代码,方便大家参考。

 

Logo

魔乐社区(Modelers.cn) 是一个中立、公益的人工智能社区,提供人工智能工具、模型、数据的托管、展示与应用协同服务,为人工智能开发及爱好者搭建开放的学习交流平台。社区通过理事会方式运作,由全产业链共同建设、共同运营、共同享有,推动国产AI生态繁荣发展。

更多推荐