-
题名基于HTML特征与层次聚类的Web查询接口发现
被引量:4
- 1
-
-
作者
魏佳欣
叶飞跃
-
机构
上海大学计算机工程与科学学院
-
出处
《计算机工程》
CAS
CSCD
北大核心
2016年第2期56-61,共6页
-
文摘
针对各网站Web查询接口(WQI)因结构异构而难以被自动发现的问题,提出一种基于超级文本标记语言(HTML)特征和层次聚类的Web查询接口发现方法。利用HTML控件元素之间的层级结构、依附关系和HTML交互控件的终端特性,通过前序和后序遍历相结合的方式解析页面,建立合适的页面树状模型。按照查询区域交互密度的局部集中性定位并初始化聚类集合。将聚类集合中各潜在接口区域结构距离的相似性进行层次聚类,并对所得潜在接口中的交互控件选择合适的文本节点进行语义标注,得出完整WQI区域,利用接口中的文本特征过滤非查询接口。实验结果表明,该方法克服了传统方法对<form>标签的过度依赖,具有较强的通用性,接口识别率与准确率分别达到90.7%和92%。
-
关键词
Web查询接口
超级文本标记语言
层次聚类
结构距离
交互密度
文本过滤器
-
Keywords
Web Query Interface(WQI)
Hyper Text Markup Language(HTML)
hierarchical clustering
structure distance
interaction density
text filter
-
分类号
TP391
[自动化与计算机技术—计算机应用技术]
-