数据挖掘--数据预处理

数据挖掘--引论

数据挖掘--认识数据

数据挖掘--数据预处理

数据挖掘--数据仓库与联机分析处理

数据挖掘--挖掘频繁模式、关联和相关性:基本概念和方法

数据挖掘--分类

数据挖掘--聚类分析:基本概念和方法


数据清理

缺失值

  1. 如果数据集含有分类属性,一种简单的填补缺失值的方法为,将属于同一类的对象的该属性值的均值赋此缺失值;对于离散属性或定性属性,用众数代替均值。
  2. 更复杂的方法,可以将其转换为分类问题或数值预测问题

噪声数据

  1. 识别出噪音将其去除 -- 比如孤立点的识别
  2. 利用其它非噪音数据降低噪音的影响,起到平滑(smoothing)的作用 -- 分箱(binning)方法可以用于平滑噪音。例如,将年收入的缺失值填补之后,将其取值利用分箱法平滑噪音。

数据集成

冗余和相关分析

标称数据的x^2相关检验

数值数据的协方差

数据归约

  • 维归约:减少所考虑的随机变量或属性的个数
  • 数量归约:用替代的、较小的数据表示形式替换原数据
  • 数据压缩:使用变换,以便得到原数据的归约或“压缩”表示

相关推荐

  1. 数据挖掘概述+探索+预处理(期末)

    2024-06-08 17:02:01       60 阅读
  2. python pandas 数据预处理

    2024-06-08 17:02:01       56 阅读

最近更新

  1. docker php8.1+nginx base 镜像 dockerfile 配置

    2024-06-08 17:02:01       94 阅读
  2. Could not load dynamic library ‘cudart64_100.dll‘

    2024-06-08 17:02:01       100 阅读
  3. 在Django里面运行非项目文件

    2024-06-08 17:02:01       82 阅读
  4. Python语言-面向对象

    2024-06-08 17:02:01       91 阅读

热门阅读

  1. 开关电源中电感设计

    2024-06-08 17:02:01       34 阅读
  2. 自注意力机学习

    2024-06-08 17:02:01       29 阅读
  3. 本地文件传远程开发

    2024-06-08 17:02:01       22 阅读
  4. 2024年公路安全员考试题库

    2024-06-08 17:02:01       28 阅读
  5. 03-3.3.2_1 栈在表达式求值中的应用(上)

    2024-06-08 17:02:01       29 阅读
  6. 医疗实施-项目管理04-需求调研

    2024-06-08 17:02:01       31 阅读
  7. c#通过sqlsugar查询信息并日期排序

    2024-06-08 17:02:01       31 阅读
  8. 什么是Redis?|介绍与使用及特点浅记

    2024-06-08 17:02:01       25 阅读
  9. VFS:8.fd管理-fs/file.c源码阅读

    2024-06-08 17:02:01       23 阅读