深度强化学习几大尚未解决问题

收敛困难，调参困难。DRL算法通常需要海量的Agent和环境的交互数据，而这些数据只有在模拟场景下（游戏）才很充足并且廉价，想象一下自动驾驶和机器人领域，如果拿真的汽车和机器人去做Action，万一是负奖赏的Action，那损失也太大点了。奖赏函数需要定义的很准确，这其实很难。最重要的是：很多应用，比较成熟的方法效果都不比DRL差，所以公司不愿意去冒这个风险吧。...

BBlue-Sky

1304人浏览 · 2020-03-29 14:30:10

BBlue-Sky · 2020-03-29 14:30:10 发布

收敛困难，调参困难。
DRL算法通常需要海量的Agent和环境的交互数据，而这些数据只有在模拟场景下（游戏）才很充足并且廉价，想象一下自动驾驶和机器人领域，如果拿真的汽车和机器人去做Action，万一是负奖赏的Action，那损失也太大点了。
奖赏函数需要定义的很准确，这其实很难。
最重要的是：很多应用，比较成熟的方法效果都不比DRL差，所以公司不愿意去冒这个风险吧。

魔乐社区

魔乐社区（Modelers.cn) 是一个中立、公益的人工智能社区，提供人工智能工具、模型、数据的托管、展示与应用协同服务，为人工智能开发及爱好者搭建开放的学习交流平台。社区通过理事会方式运作，由全产业链共同建设、共同运营、共同享有，推动国产AI生态繁荣发展。

更多推荐

【计算机视觉】Pixel逐像素分类&Mask掩码分类理解摘要

魔乐社区

计算机视觉（opencv）实战三十二——CascadeClassifier 人脸微笑检测（摄像头）

本文从原理到实现，详细介绍了基于 OpenCV Haar 分类器的人脸与微笑检测：讲解了 Haar 特征和级联检测原理。对代码逐行拆解并解释参数含义。画出完整流程图，帮助理解执行过程。给出了常见问题和优化建议，甚至扩展到深度学习方法。这种方法简单、轻量、实时性好，非常适合入门和小型应用项目。但如果需要更高准确率和更强鲁棒性，建议使用深度学习检测器替代 Haar 分类器。