特征归一化

 我来答
华源网络
2022-07-17 · TA获得超过5598个赞
知道小有建树答主
回答量:2486
采纳率:100%
帮助的人:148万
展开全部

数据的标准化(normalization)是将数据按比例缩放,使之落入一个小的特定区间。在某些比较和评价的指标处理中经常会用到,去除数据的单位限制,将其转化为无量纲的纯数值,便于不同单位或量级的指标能够进行比较和加权
其中最典型的就是数据的归一化处理,即将数据统一映射到[0,1]区间上。

(1)对数值类型的特征做归一化可以将所有的特征都统一到一个大致相同的数值区间内。
(2)从经验上说,归一化是让不同维度之间的特征在数值上有一定比较性,可以大大提高分类器的准确性

tips : 适用于本来就分布在有限范围内的数据, 在不涉及距离度量、协方差计算、数据不符合正太分布的时候,可以使用第一种方法或其他归一化方法。比如图像处理中,将RGB图像转换为灰度图像后将其值限定在[0 255]的范围。 。
它对原始数据进行线性变换,使结果映射到[0,1]的范围,实现对原始数据的等比缩放
归一化公式如下:

tip : 在分类、聚类算法中,需要使用距离来度量相似性的时候、或者使用PCA技术进行降维的时候,(Z-score standardization)表现更好
它会将原始数据映射到 均值为0 、 标准差为1 的分布上(高斯分布/正态分布),假设原始特征的均值为μ、标准差为σ
那么归一化公式定义为:

对于 线性model 来说,数据归一化后,最优解的寻优过程明显会变得平缓,更容易正确的收敛到最优解。

归一化的另一好处是提高精度,这在 涉及到一些距离计算的算法 时效果显著,比如算法要计算欧氏距离,上图中x2的取值范围比较小,涉及到距离计算时其对结果的影响远比x1带来的小,所以这就会造成精度的损失。所以归一化很有必要,他可以让各个特征对结果做出的贡献相同。
在多指标评价体系中,由于各评价指标的性质不同,通常具有不同的量纲和数量级。当各指标间的水平相差很大时,如果直接用原始指标值进行分析,就会突出数值较高的指标在综合分析中的作用,相对削弱数值水平较低指标的作用。因此,为了保证结果的可靠性,需要对原始指标数据进行标准化处理。
在数据分析之前,我们通常需要先将数据标准化(normalization),利用标准化后的数据进行数据分析。数据标准化也就是统计数据的指数化。数据标准化处理主要包括数据同趋化处理和无量纲化处理两个方面。数据同趋化处理主要解决不同性质数据问题,对不同性质指标直接加总不能正确反映不同作用力的综合结果,须先考虑改变逆指标数据性质,使所有指标对测评方案的作用力同趋化,再加总才能得出正确结果。数据无量纲化处理主要解决数据的可比性。经过上述标准化处理,原始数据均转换为无量纲化指标测评值,即各指标值都处于同一个数量级别上,可以进行综合测评分析。

数据归一化不是万能的,在实际应用中,通过 梯度下降法 求解的模型通常是需要数据归一化的,包括 线性回归 、 逻辑回归 、 持向量机(SVM) 、 神经网络 等模型。
但是决策树模型并不适用归一化 ?????以后看到决策树再说

已赞过 已踩过<
你对这个回答的评价是?
评论 收起
北京理加联合科技有限公司
2023-06-13 广告
光谱分析是一种通过分析物质的光谱来确定其化学组成和相对含量的方法。光谱分析法基于光谱学的原理,利用光源发出的光经过物质反射、透射或吸收后,被光谱仪记录下来,然后经过处理和分析,得到物质的光谱信息,从而确定其组成和相对含量。光谱分析法有很多种... 点击进入详情页
本回答由北京理加联合科技有限公司提供
推荐律师服务: 若未解决您的问题,请您详细描述您的问题,通过百度律临进行免费专业咨询

为你推荐:

下载百度知道APP,抢鲜体验
使用百度知道APP,立即抢鲜体验。你的手机镜头里或许有别人想知道的答案。
扫描二维码下载
×

类别

我们会通过消息、邮箱等方式尽快将举报结果通知您。

说明

0/200

提交
取消

辅 助

模 式