-
题名一种基于样本分层的双向过采样方法
被引量:5
- 1
-
-
作者
周晓敏
曹付元
余丽琴
-
机构
山西大学计算机与信息技术学院
山西大学计算智能与中文信息处理教育部重点实验室
-
出处
《计算机科学》
CSCD
北大核心
2019年第12期83-88,共6页
-
基金
国家自然科学基金项目(61573229)
山西省重点研发计划项目(201803D31022)
+1 种基金
山西省留学基金项目(2016-003)
山西省留学基金择优资助项目(2016-001)资助
-
文摘
重采样技术由于简单、直观,逐渐成为解决非平衡数据分类问题的一个重要方向。但是在数据集很小的情况下,重采样技术中的欠采样可能会丢失数据集的重要信息,因此过采样是非平衡数据分类问题的研究重点。现有的过采样方法虽然有效地解决了类间不平衡问题,但是有可能造成少数类的密集区域更加密集,甚至引起样本重叠。此外,由于少数类样本可能存在噪音,现有的过采样方法可能会在噪音周围生成新样本,从而造成少数类样本的分布更加混乱。针对这些问题,文中提出了一种基于样本分层的双向过采样方法,该方法首先基于最高密度点和类内平均距离将少数类样本划分成密集层和稀疏层,然后对密集层边界区样本和稀疏层的样本进行双向过采样。为了验证所提算法的有效性,在9个UCI数据集上将提出的算法和其他过采样算法进行了比较。实验结果和Friedman等检验结果显示,提出的算法在处理非平衡数据分类问题时具有一定优势。
-
关键词
非平衡数据
分类
双向过采样
密集层
稀疏层
-
Keywords
Imbalanced data
Classification
bi-directional oversampling
Dense area
Sparse area
-
分类号
TP311
[自动化与计算机技术—计算机软件与理论]
-