RNN与NLP

为这个教程的笔记:

RNN模型与NLP应用(1/9):数据处理基础_哔哩哔哩_bilibili

数据处理基础:

不能用标量表示类别特征。

可以用one-hot编码把一些类别特征变成数值向量。

处理文本信息(text -> sequence):

1. Tokenization(string->list):把文本变成列表,一个token是一个单词或者一个字符等。

2. 统计词频(建立一个dict):把每个单词映射到一个正整数(字典的key,value,key的个数叫词汇量)。把词频按从高到低排序,然后把词频换成index,从1开始数,然后保留常用词,去掉低频词(可能是人名或拼写错误),这样可以在ont-hot编码时向量的维度变小,减小计算量。

3. sequences:进行完第二步后,每个单词映射到一个正整数,这样一个文本用一个正整数的列表表示。

4. 如果有必要,进行one-hot编码:编码后向量的维度就是第二步字典中的词汇量。

5. 将列表对齐(alignment):每段文本信息的长度不一定一样,可以采取的一种措施是取一个固定值8,当长度小于8时,用0进行填充,当长度大于8时,只选取最后8个。

相关推荐

  1. RNNNLP

    2024-01-22 00:14:02       39 阅读
  2. NLP(9)--rnn实现中文分词

    2024-01-22 00:14:02       9 阅读
  3. NLP7-使用RNN模型构建人名分类器】

    2024-01-22 00:14:02       18 阅读
  4. NLP5-RNN模型、LSTM模型和GRU模型】

    2024-01-22 00:14:02       16 阅读
  5. NLP(8)--利用RNN实现多分类任务

    2024-01-22 00:14:02       12 阅读
  6. 循环神经网络(RNN)简介应用

    2024-01-22 00:14:02       30 阅读

最近更新

  1. TCP协议是安全的吗?

    2024-01-22 00:14:02       16 阅读
  2. 阿里云服务器执行yum,一直下载docker-ce-stable失败

    2024-01-22 00:14:02       16 阅读
  3. 【Python教程】压缩PDF文件大小

    2024-01-22 00:14:02       15 阅读
  4. 通过文章id递归查询所有评论(xml)

    2024-01-22 00:14:02       18 阅读

热门阅读

  1. Centos7 安装Jenkins2.440

    2024-01-22 00:14:02       32 阅读
  2. SpringBoot默认日志输出格式

    2024-01-22 00:14:02       35 阅读
  3. Elasticsearch 数组值的存储详细介绍

    2024-01-22 00:14:02       40 阅读
  4. PHP学习笔记1

    2024-01-22 00:14:02       26 阅读
  5. STL-deque

    2024-01-22 00:14:02       36 阅读
  6. 第二章 使用 SQL Search

    2024-01-22 00:14:02       32 阅读
  7. jwt和token区别是什么

    2024-01-22 00:14:02       38 阅读
  8. Python-利用resource限制资源使用

    2024-01-22 00:14:02       32 阅读
  9. gin使用Air实时加载

    2024-01-22 00:14:02       31 阅读