主页期刊介绍编委会编辑部服务介绍道德声明在线审稿编委办公编辑办公English
2018-2019年专刊出版计划 微信服务介绍 最新一期:2019年第6期
     
在线出版
各期目录
纸质出版
分辑系列
论文检索
论文排行
综述文章
专刊文章
美文分享
各期封面
E-mail Alerts
RSS
旧版入口
中国科学院软件研究所
  
投稿指南 问题解答 下载区 收费标准 在线投稿
赵强利,蒋艳凰,徐明.基于FP-Tree 的快速选择性集成算法.软件学报,2011,22(4):709-721
基于FP-Tree 的快速选择性集成算法
Fast Ensemble Pruning Algorithm Based on FP-Tree
投稿时间:2009-02-14  修订日期:2009-10-19
DOI:10.3724/SP.J.1001.2011.03752
中文关键词:  集成学习  选择性集成  频繁模式树  Bagging  误差反向传播神经网络
英文关键词:ensemble learning  ensemble pruning  frequent pattern tree (FP-tree)  bootstrap aggregation(Bagging)  back-propagation neural network (BPNN)
基金项目:国家自然科学基金(60773017, 60905032)
作者单位E-mail
赵强利 国防科学技术大学 计算机学院,湖南 长沙 410073  
蒋艳凰 国防科学技术大学 计算机学院,湖南 长沙 410073 yhjiang@nudt.edu.cn 
徐明 国防科学技术大学 计算机学院,湖南 长沙 410073  
摘要点击次数: 4657
全文下载次数: 4159
中文摘要:
      选择性集成通过选择部分基分类器参与集成,从而提高集成分类器的泛化能力,降低预测开销.但已有的选择性集成算法普遍耗时较长,将数据挖掘的技术应用于选择性集成,提出一种基于FP-Tree(frequent pattern tree)的快速选择性集成算法:CPM-EP(coverage based pattern mining for ensemble pruning).该算法将基分类器对校验样本集的分类结果组织成一个事务数据库,从而使选择性集成问题可转化为对事务数据集的处理问题.针对所有可能的集成分类器大小,CPM-EP 算法首先得到一个精简的事务数据库,并创建一棵FP-Tree 树保存其内容;然后,基于该FP-Tree 获得相应大小的集成分类器.在获得的所有集成分类器中,对校验样本集预测精度最高的集成分类器即为算法的输出.实验结果表明,CPM-EP 算法以很低的计算开销获得优越的泛化能力,其分类器选择时间约为GASEN 的1/19 以及Forward-Selection 的1/8,其泛化能力显著优于参与比较的其他方法,而且产生的集成分类器具有较少的基分类器.
英文摘要:
      By selecting parts of base classifiers to combine, ensemble pruning aims to achieve a better generalization and have less prediction time than the ensemble of all base classifiers. While, most of the ensemble pruning algorithms in literature consume much time for classifiers selection. This paper presents a fast ensemble pruning approach: CPM-EP (coverage based pattern mining for ensemble pruning). The algorithm converts an ensemble pruning task into a transaction database process, where the prediction results of all base classifiers for the validation set are organized as a transaction database. For each possible size k, CPM-EP obtains a refined transaction database and builds a FP-Tree to compact it. Next, CPM-EP selects an ensemble of size k. Among the obtained ensembles of all different sizes, the one with the best predictive accuracy for the validation set is output. Experimental results show that CPM-EP reduces computational overhead considerably. The selection time of CPM-EP is about 1/19 that of GASEN and 1/8 that of Forward Selection. Additionally, this approach achieves the best generalization, and the size of the pruned result is small.
HTML  下载PDF全文  查看/发表评论  下载PDF阅读器
 

京公网安备 11040202500064号

主办单位:中国科学院软件研究所 中国计算机学会
编辑部电话:+86-10-62562563 E-mail: jos@iscas.ac.cn
Copyright 中国科学院软件研究所《软件学报》版权所有 All Rights Reserved
本刊全文数据库版权所有,未经许可,不得转载,本刊保留追究法律责任的权利