期刊导航
期刊开放获取
cqvip
退出
期刊文献
+
任意字段
题名或关键词
题名
关键词
文摘
作者
第一作者
机构
刊名
分类号
参考文献
作者简介
基金资助
栏目信息
任意字段
题名或关键词
题名
关键词
文摘
作者
第一作者
机构
刊名
分类号
参考文献
作者简介
基金资助
栏目信息
检索
高级检索
期刊导航
共找到
1
篇文章
<
1
>
每页显示
20
50
100
已选择
0
条
导出题录
引用分析
参考文献
引证文献
统计分析
检索结果
已选文献
显示方式:
文摘
详细
列表
相关度排序
被引量排序
时效性排序
基于拉普拉斯特征映射的启发式Q学习
被引量:
6
1
作者
朱美强
李明
+2 位作者
程玉虎
张倩
王雪松
《控制与决策》
EI
CSCD
北大核心
2014年第3期425-430,共6页
在基于目标的强化学习任务中,欧氏距离常作为启发式函数用于策略选择,其用于状态空间在欧氏空间内不连续的任务效果不理想.针对此问题,引入流形学习中计算复杂度较低的拉普拉斯特征映射法,提出一种基于谱图理论的启发式策略选择方法.所...
在基于目标的强化学习任务中,欧氏距离常作为启发式函数用于策略选择,其用于状态空间在欧氏空间内不连续的任务效果不理想.针对此问题,引入流形学习中计算复杂度较低的拉普拉斯特征映射法,提出一种基于谱图理论的启发式策略选择方法.所提出的方法适用于状态空间在某个内在维数易于估计的流形上连续,且相邻状态间的连接关系为无向图的任务.格子世界的仿真结果验证了所提出方法的有效性.
展开更多
关键词
强化学习
启发式策略选择
q
学习
拉普拉斯特征映射
原文传递
题名
基于拉普拉斯特征映射的启发式Q学习
被引量:
6
1
作者
朱美强
李明
程玉虎
张倩
王雪松
机构
中国矿业大学信息与电气工程学院
出处
《控制与决策》
EI
CSCD
北大核心
2014年第3期425-430,共6页
基金
国家自然科学基金项目(61072094
61273143)
+4 种基金
教育部高等学校博士学科点专项科研基金项目(20110095110011
20110095110016)
中央高校基本科研业务费专项资金项目(2013XK09)
江苏省自然科学基金项目(BK20130207)
江苏省博士后基金项目(1301029C)
文摘
在基于目标的强化学习任务中,欧氏距离常作为启发式函数用于策略选择,其用于状态空间在欧氏空间内不连续的任务效果不理想.针对此问题,引入流形学习中计算复杂度较低的拉普拉斯特征映射法,提出一种基于谱图理论的启发式策略选择方法.所提出的方法适用于状态空间在某个内在维数易于估计的流形上连续,且相邻状态间的连接关系为无向图的任务.格子世界的仿真结果验证了所提出方法的有效性.
关键词
强化学习
启发式策略选择
q
学习
拉普拉斯特征映射
Keywords
reinforcement
learning
,
heuristic
policy
selection
.
q
-
leaming
Laplacian
Eigenmap
分类号
TP181 [自动化与计算机技术—控制理论与控制工程]
原文传递
题名
作者
出处
发文年
被引量
操作
1
基于拉普拉斯特征映射的启发式Q学习
朱美强
李明
程玉虎
张倩
王雪松
《控制与决策》
EI
CSCD
北大核心
2014
6
原文传递
已选择
0
条
导出题录
引用分析
参考文献
引证文献
统计分析
检索结果
已选文献
上一页
1
下一页
到第
页
确定
用户登录
登录
IP登录
使用帮助
返回顶部