今年强化学习搭配扩散模型可谓大放异彩!
1.强化学习+扩散模型重大创新思路分享:
轨迹扩散 × 离线强化学习(Offline RL)
LDCQ++:基于潜变量轨迹扩散约束开展离线Q学习
ReDiffuser-X:具备置信门控功能的轨迹扩散规划器
2.扩散策略(Diffusion Policy)× 在线微调与探索
DPPO-Q:融合扩散策略的策略梯度与价值引导进行协同微调
EDP-URL:基于无奖励预训练的探索型扩散策略
3.扩散世界模型(World Model)× 模型式RL(MBRL)
DIAMOND-Lite:具备高保真视觉的扩散世界模型的轻量化决策方案
DOME-Drive:基于3D占用网格的扩散世界模型的自动驾驶规划方案
4.人类偏好对齐(RLHF/DPO)× 扩散生成/决策一体
Diffusion-DPO-RL:构建从偏好对齐到可执行策略的端到端链路
RLHF-T2I-to-Act:将文本 - 图像扩散的偏好对齐迁移至机器人动作领域
5.安全/约束/风险敏感 × 扩散策略与轨迹
FISOR-Diff:在可行域引导下开展安全离线扩散策略学习
CVaR-Guided Sampler:基于风险敏感的扩散采样与策略改进方案
6.采样效率/可控性 × 扩散引导的统一优化框架
Auto-Guidance:将扩散梯度引导视为一种一阶优化的自适应调度方法
PolyGRAD:利用策略 - 引导的轨迹扩散合成进行on-policy评估
📚另外,我整理了十篇关于强化学习的最新论文及代码,方便大家参考。

魔乐社区(Modelers.cn) 是一个中立、公益的人工智能社区,提供人工智能工具、模型、数据的托管、展示与应用协同服务,为人工智能开发及爱好者搭建开放的学习交流平台。社区通过理事会方式运作,由全产业链共同建设、共同运营、共同享有,推动国产AI生态繁荣发展。
更多推荐


所有评论(0)