期刊界 All Journals 搜尽天下杂志传播学术成果专业期刊搜索期刊信息化学术搜索

全文获取类型

收费全文	1篇
免费	0篇

学科分类

工业技术

1篇

出版年

2015年

1篇

排序方式： 共有1条查询结果，搜索用时 15 毫秒

Keepaway抢球任务中基于策略重用的迁移学习算法

李学俊陈士洋张以文李龙澍《计算机科学》2015,42(4):190-193, 225

在RoboCup Keepaway中,球员使用强化学习能获得很好的高层策略.然而由于Keepaway任务的状态空间巨大,强化学习需要探索很多步才能收敛,学习过程十分耗时.针对这一问题,对于5v4规模的Keepaway任务,将策略重用技术应用于抢球球员高层决策的强化学习中,以实现迁移学习.首先合理设计了球员在4v3和5v4任务间的迁移学习方案及状态与动作空间的映射,然后提出了基于策略重用的迁移学习算法.实验表明,对于5v4任务,在训练时间约束下,迁移学习比强化学习获得了更短的任务完成时间和更高的抢断成功率,从而学习到了较优的高层策略.因此,为达到相同策略水平,迁移学习所需的训练时间明显比强化学习少. 相似文献