【Preprocessing数据预处理】之Scaler

2024-03-13 07:54:03
开发
35

在机器学习中，特征缩放是训练模型前数据预处理阶段的一个关键步骤。不同的缩放器被用来规范化或标准化特征。这里简要概述了您提到的几种缩放器：

StandardScaler
`StandardScaler` 通过去除均值并缩放至单位方差来标准化特征。这种缩放器假设特征分布是正态的，并将它们缩放为均值为零和标准差为一。用于缩放特征 `X` 的公式是：

其中 `μ` 是特征值的平均值，`σ` 是标准差。

MinMaxScaler
`MinMaxScaler` 将特征缩放到给定范围，通常在零和一之间，或者使最小和最大值与某个特定范围对齐。转换公式为：

其中 `X_min` 和 `X_max` 分别是特征的最小值和最大值。这种缩放将所有内点压缩到 [0, 1] 范围内。

RobustScaler
`RobustScaler` 使用类似于 `StandardScaler` 的方法，但它使用中位数和四分位数范围而不是均值和方差。这使得 `RobustScaler` 对异常值的敏感度较低。公式是：

其中 `M` 是中位数，`IQR` 是特征值的四分位数范围。

何时使用每种缩放器：

- **StandardScaler**：当您的特征大致呈正态分布，并且您希望假设您的特征具有高斯分布时。

- **MinMaxScaler**：当您知道特征的边界并希望将特征转换为在这些边界之间缩放时。

- **RobustScaler**：当您的特征中有异常值并希望减少其影响时。

需要注意的是，特征缩放可能会影响您的机器学习模型的性能，特别是对于那些计算数据点之间距离的算法，比如 SVM 或 k-NN，或者那些对特征缩放敏感的基于梯度下降的算法。对于基于树的算法，特征缩放则不那么重要，因为它们是尺度不变的。

原文地址:https://blog.csdn.net/Hyman_Qiu/article/details/136664708 本文来自互联网用户投稿，该文观点仅代表作者本人，不代表本站立场。本站仅提供信息存储空间服务，不拥有所有权，不承担相关法律责任。如若转载，请注明出处：https://www.suanlizi.com/kf/1767700611245150208.html 如若内容造成侵权/违法违规/事实不符，请联系《酸梨子》网邮箱：1419361763@qq.com进行投诉反馈，一经查实，立即删除！

阅读全部

最近更新

题解 - 序列

2024-03-13 07:54:03 122 阅读
CST热仿真案例——电动车直流快充Cable热仿真

2024-03-13 07:54:03 109 阅读
docker php8.1+nginx base 镜像 dockerfile 配置

2024-03-13 07:54:03 98 阅读
Could not load dynamic library ‘cudart64_100.dll‘

2024-03-13 07:54:03 106 阅读
NoSQL之Redis非关系型数据库

2024-03-13 07:54:03 108 阅读
2024.7.22 作业

2024-03-13 07:54:03 106 阅读
GDB调试正在运行的程序

2024-03-13 07:54:03 87 阅读
昇思25天学习打卡营第18天| DCGAN生成漫画头像

2024-03-13 07:54:03 90 阅读
在Django里面运行非项目文件

2024-03-13 07:54:03 87 阅读
SSD基本架构与工作原理

2024-03-13 07:54:03 95 阅读
在誉天学习完HCIE就业吗？

2024-03-13 07:54:03 98 阅读
【合同专题】合同终止协议书、项目合作协议、交底纪要、管理台账

2024-03-13 07:54:03 90 阅读
驾驭云原生日志洪流：高效分析与管理的策略集

2024-03-13 07:54:03 92 阅读
go 协程池的实现

2024-03-13 07:54:03 93 阅读
Shell脚本循环语句与函数

2024-03-13 07:54:03 96 阅读
连锁店收银系统源码（收银称重pos+聚合支付+ERP进销存+营销+会员管理）

2024-03-13 07:54:03 98 阅读
TIA博途V19无法勾选来自远程对象的PUT/GET访问的解决办法

2024-03-13 07:54:03 90 阅读
四大引用——强软弱虚

2024-03-13 07:54:03 92 阅读
Python语言-面向对象

2024-03-13 07:54:03 96 阅读
如何分清楚常见的 Git 分支管理策略Git Flow、GitHub Flow 和 GitLab Flow

2024-03-13 07:54:03 91 阅读
网站安全-CDN篇

2024-03-13 07:54:03 94 阅读

热门阅读

LeetCode 每日一题 Day 95-101

2024-03-13 07:54:03 36 阅读
力扣热题100_矩阵_54_螺旋矩阵

2024-03-13 07:54:03 40 阅读
【python】自动化工具Selenium与playwright去除webdriver检测

2024-03-13 07:54:03 31 阅读
方法重写（Override）

2024-03-13 07:54:03 38 阅读
Zabbix分布式监控系统

2024-03-13 07:54:03 34 阅读
RISC-V Optimization Guide（笔记）

2024-03-13 07:54:03 44 阅读
Embed Web Content into Your Dashboards

2024-03-13 07:54:03 39 阅读
搭建Hadoop3.x完全分布式集群

2024-03-13 07:54:03 34 阅读
鸿蒙实战开发：【FaultLoggerd组件】讲解

2024-03-13 07:54:03 30 阅读
vscode使用remote-ssh免密连接服务器

2024-03-13 07:54:03 40 阅读
Redis中set，zset

2024-03-13 07:54:03 42 阅读
LeetCode383 —赎金信

2024-03-13 07:54:03 35 阅读
STM32的DMA搬运串口数据

2024-03-13 07:54:03 44 阅读
Linux命令学习（一）history

2024-03-13 07:54:03 38 阅读
2.DOM-事件基础(注册事件、tab栏切换)(案例：注册、轮播图)

2024-03-13 07:54:03 41 阅读
5.shell if判断语句

2024-03-13 07:54:03 32 阅读
【天池课堂】零基础入门数据挖掘-课程汇总

2024-03-13 07:54:03 45 阅读
鲜花销售小程序|基于微信小程序的鲜花销售系统设计与实现(源码+数据库+文档)

2024-03-13 07:54:03 42 阅读
webpack5高级--02_提升打包构建速度

2024-03-13 07:54:03 36 阅读
基于微信小程序的电子竞技信息交流小程序

2024-03-13 07:54:03 38 阅读
电影院订票选座小程序|基于微信小程序的电影院购票系统设计与实现(源码+数据库+文档)

2024-03-13 07:54:03 43 阅读
Qt/C++音视频开发69-保存监控pcm音频数据到mp4文件/监控录像/录像存储和回放/264/265/aac/pcm等

2024-03-13 07:54:03 37 阅读
小程序bindtap 和 catchtap 的区别以及如何使用

2024-03-13 07:54:03 38 阅读
peft模型微调--Prompt Tuning

2024-03-13 07:54:03 41 阅读
webpack-dev-server5.0+ 版本问题

2024-03-13 07:54:03 36 阅读
使用node.js 开发后端的优缺点

2024-03-13 07:54:03 45 阅读
使用 Github Actions 自动发布包到 NPM 官网上

2024-03-13 07:54:03 44 阅读
WebStrom报错

2024-03-13 07:54:03 46 阅读
简单的torch网络模型记录

2024-03-13 07:54:03 48 阅读
C++开发基础——类模板

2024-03-13 07:54:03 37 阅读