《计算机应用杂志》发表论文赏析
作者:邱云飞, 刘世兴, 林明明, 邵良杉
单位:1. 辽宁工程技术大学 软件学院, 辽宁 葫芦岛 125105;2. 辽宁工程技术大学 系统工程研究所, 辽宁 葫芦岛 125105
摘要:传统机器学习面临一个难题,即当训练数据与测试数据不再服从相同分布时,由训练集得到的分类器无法对测试集文本准确分类。针对该问题,根据迁移学习原理,在源领域和目标领域的交集特征中,依据改进的特征分布相似度进行特征加权;在非交集特征中,引入语义近似度和新提出的逆文本类别指数(TF-ICF),对特征在源领域内进行加权计算,充分利用大量已标记的源领域数据和少量已标记的目标领域数据获得所需特征,以便快速构建分类器。在文本数据集20Newsgroups和非文本数据集UCI中的实验结果表明,基于分布和逆文本类别指数的特征迁移加权算法能够在保证精度的前提下对特征快速迁移并加权。
关键词:迁移学习,特征分布,逆文本类别指数,语义近似度,特征加权
基金资助:国家自然科学基金资助项目(70971059);辽宁省创新团队项目(2009T045);辽宁省高等学校杰出青年学者成长计划项目(LJQ2012027)。