帮助 本站公告
您现在所在的位置:网站首页 > 知识中心 > 文献详情
文献详细Journal detailed

基于全局性确定聚类中心的文本聚类
Text clustering based on global center-determination

作  者: ; ; ; ;

机构地区: 广东商学院数学与计算科学学院

出  处: 《计算机工程与应用》 2011年第10期147-150,共4页

摘  要: 文本聚类关键是有效解决特征词向量选择及特征词权重计算方法、文本相似度计算方法、聚类中心确定等三个问题。针对相关算法在三个关键环节上存在的问题,提出了适合自由文本特点的特征词权重计算方法和文本相似度计算方法;在此基础上提出了改进的CBC算法,从全局上自适应地确定文本集中的各个聚类中心。算法在实验中准确地确定了各个聚类中心,并在两个文本集上分别获得88.50%和94.00%的聚类准确率。 The three key points of text clustering are feature selection and weight calculation,texts similarity calculation and cluster center determination.This paper proposes two new methods based on the characteristic of free texts for feature-weight calculation and texts similarity calculation separately.Then an improved CBC algorithm is proposed to determine the cluster centers adaptively and globally.This algorithm produces all cluster center correctly,and obtains precision of 88.50% and 94.00% for two different text-set separately.

关 键 词: 文本聚类 全局性 聚类质心 特征词集

领  域: [自动化与计算机技术] [自动化与计算机技术]

相关作者

作者 严玉清
作者 黄家兴
作者 董兵团
作者 黄林军
作者 彭勇涛

相关机构对象

机构 中山大学资讯管理学院信息管理系
机构 华南师范大学经济与管理学院
机构 暨南大学管理学院
机构 中共深圳市委党校
机构 中山大学

相关领域作者

作者 李文姬
作者 邵慧君
作者 杜松华
作者 周国林
作者 邢弘昊