HI,欢迎来到学术之家,发表咨询:400-888-7501  订阅咨询:400-888-7502  股权代码  102064
0

基于主题语义扩展的混合类型数字资源分类研究

作者:巴志超; 李湘东; 马亚雪; 徐健主题模型语义扩展数字资源混合分类

摘要:为满足数字图书馆各种类型数字化资源统一分类组织的需要,文章着重对数字图书馆中多种类型文献混合分类的可行性进行探索与分析。引入语义主题模型构建方法,结合外部知识库Wikipedia进行语义扩展,构建一种基于主题语义扩展的混合类型文献自动分类方法。研究发现:在多类型文献混合分类中,网页与非学术性期刊文献、图书与学术性期刊文献之间具有较高的亲和力,可互相作为分类材料中的训练集并达到较高分类性能;不同分类算法针对多种类型文献混合分类具有不同的可学习能力和适应性,贝叶斯算法、最大熵模型比支持向量机更能适应多种类型文献的混合分类;引入主题语义扩展方法能够有效减弱不同类型文献之间的文本特征差异,增强不同类型文献混合分类时的亲和力,提高文献的混合分类性能。

注:因版权方要求,不能公开全文,如需全文,请咨询杂志社

情报理论与实践

《情报理论与实践》(CN:11-1762/G3)是一本有较高学术价值的大型月刊,自创刊以来,选题新奇而不失报道广度,服务大众而不失理论高度。颇受业界和广大读者的关注和好评。

杂志详情