期刊文献+

航班信息抽取规则的自动生成技术 被引量:2

Auto Generation Technology for Flight Information Extraction Rules
下载PDF
导出
摘要 在基于包装器的Web信息提取工作中,抽取规则占有重要的地位。由于网页经常改版,使得抽取规则需要不断更新,且手工生成抽取规则是一项费时费力的工作。为此,提出一种自动生成抽取规则的方法,通过扫描HTML源码,生成带语义信息的TABLE树,用以识别网页中的数据表格,并在此基础上利用贪心算法自动生成抽取规则。实验结果表明,该方法具有较高的准确率和F指数,且对于识别出的表格具有较高的规则生成率。 Extraction rule plays an important role in Web information extraction based on wrappers.As the Web pages often change,the rule is updated frequently.However,it is a hard work to find extraction rule by hand.This paper proposes an auto extraction rule generation method,which constructs a semantic TABLE tree after scanning HTML code.The semantic TABLE trees is used to identify the data table,and the extraction rule is generated automatically through a greedy algorithm.Experiment result shows that it has high precision and F-score,and has high rule generation rate to the identified table.
出处 《计算机工程》 CAS CSCD 北大核心 2011年第6期65-67,共3页 Computer Engineering
基金 国家"863"计划基金资助重点项目(2006AA12A106) 中国民航大学科研基金资助项目(07kym04)
关键词 WEB信息提取 抽取规则 语义TABLE树 贪心算法 Web information extraction extraction rules semantic TABLE trees greedy algorithm
  • 相关文献

参考文献5

二级参考文献33

  • 1胡东东,孟小峰.一种基于树结构的Web数据自动抽取方法[J].计算机研究与发展,2004,41(10):1607-1613. 被引量:21
  • 2彭智勇,罗义,单喆,李青.基于对象代理模型的工作流视图实现[J].计算机学报,2005,28(4):651-660. 被引量:7
  • 3张慧颖,曲著伟.基于子树匹配的交互式Web数据抽取方法[J].计算机工程,2006,32(9):78-80. 被引量:8
  • 4Hammer J,Garcia-Molina H,Cho J,et al.Extracting semistructured information from the Web[J].SIGOD Record,1997,26(2):18-25. 被引量:1
  • 5Lim S,Ng Y.An automated approach for retrieving heirarchicsl data from HTML tables[A]//Proceedings of the 8th International Conference on Information and Knowledge Management (CIKM'99)[C].1999:466-474. 被引量:1
  • 6Hurst M.Classifying Table Elements in HTML[A]//Proc.The 11th International World Wide Web Conference[C].WWW 2002,Sheraton Waikiki Honolulu,Hawaii,USA,May 2002.http://www2002,org/CDROM/poster/115/index,html. 被引量:1
  • 7Wang Y,Hu J.A Machine Learning-based Approach for Table Detection on the Web[A]//Proceedings of the 11th International Conference on WWW[C].2002:242-250. 被引量:1
  • 8Cui Tao.Schema Matching and Data Extraction over HTML Tables[D].USA:Brigham Young University,2003. 被引量:1
  • 9Chen H,et al.Mining Tables from Large Scale HTML Texts[A]//Proceedings of the 18th International Conference on Computational Linguistics[C].2000:166-172. 被引量:1
  • 10Chen Hsin-Hsi,Tsai Shih-Chung,Tsai Jin-He.Mining tables from large scale html texts[A]//The 18th International Conference on Computational Linguistics[C].July 2000:166-172. 被引量:1

共引文献36

同被引文献11

引证文献2

相关作者

内容加载中请稍等...

相关机构

内容加载中请稍等...

相关主题

内容加载中请稍等...

浏览历史

内容加载中请稍等...
;
使用帮助 返回顶部