期刊文献+
共找到1篇文章
< 1 >
每页显示 20 50 100
基于HTML特征与层次聚类的Web查询接口发现 被引量:4
1
作者 魏佳欣 叶飞跃 《计算机工程》 CAS CSCD 北大核心 2016年第2期56-61,共6页
针对各网站Web查询接口(WQI)因结构异构而难以被自动发现的问题,提出一种基于超级文本标记语言(HTML)特征和层次聚类的Web查询接口发现方法。利用HTML控件元素之间的层级结构、依附关系和HTML交互控件的终端特性,通过前序和后序遍历相... 针对各网站Web查询接口(WQI)因结构异构而难以被自动发现的问题,提出一种基于超级文本标记语言(HTML)特征和层次聚类的Web查询接口发现方法。利用HTML控件元素之间的层级结构、依附关系和HTML交互控件的终端特性,通过前序和后序遍历相结合的方式解析页面,建立合适的页面树状模型。按照查询区域交互密度的局部集中性定位并初始化聚类集合。将聚类集合中各潜在接口区域结构距离的相似性进行层次聚类,并对所得潜在接口中的交互控件选择合适的文本节点进行语义标注,得出完整WQI区域,利用接口中的文本特征过滤非查询接口。实验结果表明,该方法克服了传统方法对<form>标签的过度依赖,具有较强的通用性,接口识别率与准确率分别达到90.7%和92%。 展开更多
关键词 Web查询接口 超级文本标记语言 层次聚类 结构距离 交互密度 文本过滤器
下载PDF
上一页 1 下一页 到第
使用帮助 返回顶部