NLP:文本相似度计算

前面我们已经实现了把长段的句子,利用HanLP拆分成足够精炼的分词,后面我们要实现“联想”功能,我这里初步只能想到通过文本相似度计算来实现。下面介绍一下文本相似度计算

(当然HanLP也有文本相似度计算的方法,这里我应该上一节也说过,但是使用之后效果并不理想,因此,我们要换其他的方法)

这里我们采取的是text2vec,事实上网上通用的是word2vec,但是他要求自己训练模型,而且github上的流程我没看得懂,所以我就在github上找了别人现成的模型来使用

  • 下载
pip install torch # conda install pytorch
pip install -U text2vec

这里下载第二个的时候建议用上镜像,并且请在网络较好的地方下载

  • 测试
import sys


sys.path.append('..')
from text2vec import Similarity

# Two lists of sentences
sentences1 = ['c++开发十年经验',
              '善于沟通,领导他人',
              '全栈开发',
              '你好']

sentences2 = ['擅长编程',
              '体贴',
              'web 开发',
              '有领导能力']

sim_model = Similarity()
for i in range(len(sentences1)):
    for j in range(len(sentences2)):
        score = sim_model.get_score(sentences1[i], sentences2[j])
        print("{} \t\t {} \t\t Score: {:.4f}".format(sentences1[i], sentences2[j], score))

放上运行结果

可以发现,联想的效果还是有的,至少在我当前的需求下,它是完全够用的。

  •  We couldn't connect to 'https://huggingface.co'

 这是一个很关键的报错,具体可以参考这位老哥的博客:解决办法

 (不过确实,因为围墙的存在,在一定程度上是阻碍了国内科研和学习的发展)

亲测可行的方法则是在代码前面补充上下面两行代码(即利用镜像)

import os
os.environ['HF_ENDPOINT']='https://hf-mirror.com'

之后如果有闲工夫的话,我还是想利用word2vec来训练一个自己的模型,毕竟数据摆在这里,不用而去调别人现成的模型,多少是不会满足特定场景的需求。

参考文献:

python实现文本相似度的计算

python利用word2vec计算文本相似度

 wiki. model下载

相关推荐

  1. NLP中几个简单的,字符串相似计算方法

    2024-03-11 16:46:06       33 阅读
  2. 自然语言处理NLP:姓名相似

    2024-03-11 16:46:06       16 阅读
  3. 数据的相似计算

    2024-03-11 16:46:06       35 阅读

最近更新

  1. TCP协议是安全的吗?

    2024-03-11 16:46:06       16 阅读
  2. 阿里云服务器执行yum,一直下载docker-ce-stable失败

    2024-03-11 16:46:06       16 阅读
  3. 【Python教程】压缩PDF文件大小

    2024-03-11 16:46:06       15 阅读
  4. 通过文章id递归查询所有评论(xml)

    2024-03-11 16:46:06       18 阅读

热门阅读

  1. 【前端开发】HTML1

    2024-03-11 16:46:06       17 阅读
  2. 2k_Day2:今天是springMVC和mybatisPlus的大白话

    2024-03-11 16:46:06       19 阅读
  3. Spring MVC ExpressionValueMethodArgumentResolver原理解析

    2024-03-11 16:46:06       20 阅读
  4. 接口测试常问问题

    2024-03-11 16:46:06       22 阅读
  5. [Flutter]使用Provider进行状态管理

    2024-03-11 16:46:06       21 阅读
  6. Spring MVC面试系列-02

    2024-03-11 16:46:06       18 阅读
  7. Android Jetpack Compose基础之State状态

    2024-03-11 16:46:06       23 阅读
  8. 009-组件的data为什么是个函数

    2024-03-11 16:46:06       20 阅读
  9. WatchBird: 新一代纯PHP防火墙

    2024-03-11 16:46:06       19 阅读
  10. 03 数据结构之栈

    2024-03-11 16:46:06       14 阅读
  11. SQL 分组查询

    2024-03-11 16:46:06       22 阅读
  12. nginx配置IPV6

    2024-03-11 16:46:06       15 阅读
  13. 服务中心选址问题

    2024-03-11 16:46:06       18 阅读