一种结合TF-IDF和Simhash的科技项目文本相似性度量方法 | |
所属分类:技术论文 | |
上传者:zhoubin333 | |
文档大小:3591 K | |
标签: 科技项目文本 文本相似度 TF-IDF | |
所需积分:0分积分不够怎么办? | |
文档介绍:为了提高科技项目文本相似性度量的准确性和性能,将TF-IDF和Simhash相结合,提出了一种新的科技项目文本相似性度量方法。首先,该方法对科技项目文本进行预处理得到词项集合,再使用TF-IDF计算词项集合中每个词项的权重值,并选取具有较高权重值的重要词项;其次,使用Simhash把重要词项映射为固定长度的二进制串,并求和得到文本的Simhash签名;最后,使用汉明距离计算两个Simhash签名间的相似性。实验结果表明,所提方法在查准率、召回率和F度量值方面优于传统的Simhash算法和TF-IDF方法。 | |
现在下载 | |
VIP会员,AET专家下载不扣分;重复下载不扣分,本人上传资源不扣分。 |
Copyright © 2005-2020 kaiyun官方注册版权所有 京ICP备10017138号-2