【大模型基础】4.1 数据挖掘(待)

一、什么是文本挖掘?

文本挖掘指的是从文本数据中获取有价值的信息和知识,它是数据挖掘中的一种方法。文本挖掘中最重要最基本的应用是实现文本的分类和聚类,前者是有监督的挖掘算法,后者是无监督的挖掘算法。

二、文本挖掘的作用是什么?

能够从文本数据中获取有价值的信息和知识

三、文本预处理
3.1 中文分词

使用jieba来对文本进行分词处理,它有3类分词模式,即全模式、精确模式、搜索引擎模式

精确模式:试图将句子最精确地切开,适合文本分析

全模式:把句子中所有的可以成词的词语都扫描出来, 速度非常快,但是不能解决歧义;

搜索引擎模式:在精确模式的基础上,对长词再次切分,提高召回率,适合用于搜索引擎分词。

举例:定位

相关推荐

  1. 模型基础】4.1 数据挖掘

    2024-07-21 04:48:01       21 阅读
  2. 数据挖掘模型融合

    2024-07-21 04:48:01       59 阅读
  3. 数据挖掘基础数据挖掘技术概述和基本算法

    2024-07-21 04:48:01       16 阅读
  4. 数据挖掘】银行信用卡风险数据分析与挖掘

    2024-07-21 04:48:01       22 阅读
  5. 数据挖掘数据的结合

    2024-07-21 04:48:01       36 阅读
  6. 数据挖掘 模糊聚类

    2024-07-21 04:48:01       58 阅读

最近更新

  1. docker php8.1+nginx base 镜像 dockerfile 配置

    2024-07-21 04:48:01       52 阅读
  2. Could not load dynamic library ‘cudart64_100.dll‘

    2024-07-21 04:48:01       54 阅读
  3. 在Django里面运行非项目文件

    2024-07-21 04:48:01       45 阅读
  4. Python语言-面向对象

    2024-07-21 04:48:01       55 阅读

热门阅读

  1. 【LeetCode 0231】【位运算】2的N次方

    2024-07-21 04:48:01       16 阅读
  2. 【Socket 编程】基于UDP协议建立多人聊天室

    2024-07-21 04:48:01       16 阅读
  3. 会Excel就会sql?

    2024-07-21 04:48:01       18 阅读
  4. Android笔试面试题AI答之布局Layout(1)

    2024-07-21 04:48:01       12 阅读