-
题名一种基于时序窗口的动态热点话题提取模型
- 1
-
-
作者
马慧芳
尹旻
何清
史忠植
-
机构
中国科学院计算技术研究所智能信息处理重点实验室
中国科学院研究生院
联想(中国)研究院网络服务研究室
-
出处
《高技术通讯》
EI
CAS
CSCD
北大核心
2010年第6期590-595,共6页
-
基金
863计划(2007AA01Z132)
国家自然科学基金(60435010)
+1 种基金
973计划(2007CB311004)
国家科技支撑计划(No.2006BAC08B06)资助项目
-
文摘
针对新闻领域的专题组织进行了研究,提出了一种基于时序窗口的动态热点话题提取模型。该模型整合了热点话题的两个特点。一方面关注主题词在新闻文本中的广泛性,衡量标准为多频道播报特征项的频率综合,词频越高其广泛性越高;另一方面考虑新闻流主题词的突发性,表现为特定时间段内主题词出现频率显著异常于其它时间段。引入时序窗口进行上升和下降突发模式提取,并结合TF-DF作为主题词赋权值依据。实验结果表明,这种基于时序窗口的动态热点话题提取模型对新闻文本进行主题抽取具有很好的性能。
-
关键词
话题提取
时序窗口
广泛性
突发性
TF-PDF
-
Keywords
topic extraction, time window, pervasiveness, burst, TF-PDF
-
分类号
TP391.1
[自动化与计算机技术—计算机应用技术]
-