期刊文献+
共找到3篇文章
< 1 >
每页显示 20 50 100
基于可视块的多记录型复杂网页信息提取算法 被引量:13
1
作者 王卫红 梁朝凯 闵勇 《计算机科学》 CSCD 北大核心 2019年第10期63-70,共8页
网页具有丰富的内容和复杂多变的结构,现有的网页信息提取技术解决了单记录型简单页面的信息提取问题,但是对于多记录型复杂页面的信息提取效果往往不佳。文中提出了一种全新的基于可视块的复杂网页信息自动化提取算法(Visual Block Bas... 网页具有丰富的内容和复杂多变的结构,现有的网页信息提取技术解决了单记录型简单页面的信息提取问题,但是对于多记录型复杂页面的信息提取效果往往不佳。文中提出了一种全新的基于可视块的复杂网页信息自动化提取算法(Visual Block Based Information Extraction,VBIE),通过启发式规则构建可视块与可视块树,然后通过区域聚焦、噪声过滤及可视块筛选,实现了对复杂网页中数据记录的提取。该方法摒弃了以往算法对网页结构的特定假设,无需对HTML文档进行任何人工标记,保留了网页的原始结构,且能够在单页面上实现无监督的信息提取。实验结果表明,VBIE的网页信息提取精确度最高可达100%,在主流搜索引擎的结果页面和社区论坛的帖子页面上的F1均值分别为98.5%和96.1%。相比目前方法中在复杂网页上提取效果较好的CMDR方法,VBIE的F1值提高了近16.3%,证明了该方法能够有效解决复杂网页的信息提取问题。 展开更多
关键词 WEB数据抽取 WEB挖掘 数据记录提取 网页数据提取 结构化信息
下载PDF
远程勘验取证分析软件开发与实现 被引量:4
2
作者 朱峰 刘捷 李军 《信息网络安全》 2011年第11期73-74,共2页
远程勘验分析技术是计算机取证技术的一个重要分支,而如何实现自动、智能远程勘验分析目标网站是一项重要研究课题。文章简要介绍了远程勘验取证分析软件"网际无痕特种兵"基本原理和功能,进行了实证性分析并取得了积极的成果。
关键词 计算机应用 网页数据提取 计算机成像 勘验分析
下载PDF
正则表达式在油价事件网页提取中的应用 被引量:1
3
作者 邵增荣 李英 范体军 《现代图书情报技术》 CSSCI 北大核心 2009年第2期83-88,共6页
利用正则表达式在字符串操作上的优势,实现从不规则含噪页面中对油价事件信息的抓取,指出实现中的难点要点,并验证正则表达式在字符串处理中强大的结构描述能力。
关键词 正则表达式 网页数据抓取 数据清洗 字符串处理
下载PDF
上一页 1 下一页 到第
使用帮助 返回顶部