智能体任务学习方法及装置数据集
收藏数据链接:
官方服务:
资源简介:
在本文中,我们开发了一个策略生成网络,该网络通过将低维任务特征映射到高维策略参数来对任务间关系进行非线性建模,以便更有效地表示共享知识。同时,我们提出了一种新的终身强化学习目标函数,通过增加误差的权重约束来缓解计算误差的不足。我们实证证明,我们的方法改善了各种动态系统中的零样本策略性能。
提供机构:
中国科学院脑科学数据中心创建时间:
2023-11-15

在本文中,我们开发了一个策略生成网络,该网络通过将低维任务特征映射到高维策略参数来对任务间关系进行非线性建模,以便更有效地表示共享知识。同时,我们提出了一种新的终身强化学习目标函数,通过增加误差的权重约束来缓解计算误差的不足。我们实证证明,我们的方法改善了各种动态系统中的零样本策略性能。