定义#
两家工厂生产螺丝,标准长度 10mm,各抽 5 个样品:
- A 厂:10、10、10、10、10
均值是 10,所有数据完全贴平均值,标准差 = 0,零波动,完美 - B 厂:7、9、10、11、13
均值也是 10,但长短差别巨大,标准差很大,品质不稳定
标准差(standard deviation)就是衡量一组数据偏离平均值的平均波动幅度。 数字越大数据越乱、起伏大、不稳定;数字越小数据集中、波动小、一致性高。
符号:
- 总体标准差 $\sigma$
- 样本标准差 $s$
计算#
总体标准差 $\sigma$(全部产品,完整数据)
\[ \sigma = \sqrt{\frac{\sum_{i=1}^n (x_i-\mu)^2}{n}} \]$\mu$ 为真实总体均值
样本标准差 $s$(只抽一部分样品检测,工厂质检常用)
\[ s = \sqrt{\frac{\sum_{i=1}^n (x_i-\bar{x})^2}{n-1}} \]$\bar{x}$ 为样本均值
为什么分母用 $n-1$ 修正误差
总体标准差 $\sigma$ 分母使用 $n$,因为均值 $\mu$ 是真实总体均值,无误差。
样本标准差 $s$ 只抽一小部分样品,只能用样本均值 $\bar{x}$ 替代真实总体均值 $\mu$,
但样本均值 $\bar{x}$ 是由这 n 个样本自己算出来的,它会自动往样本中间靠,导致
即用样本均值 $\bar{x}$ 计算出来的标准差天生偏小。
我们计算样本均值 $\bar{x}$ 时,
\[ \bar{x} = \frac{x_1+x_2+...+x_n}{n} \]如果 $\bar{x}$ 和 $x_1+x_2+…+x_{n-1}$ 已经确定,那么 $x_n$ 也一定是被确定了的,也就是说,真正独立有效的信息只有 $n-1$ 份,因此计算偏差平方和时,分母要除以有效自由度 $n-1$,而不是全部样本数 $n$。
事实上,设样本偏差平方和:
\[ SS=\sum(x_i-\bar{x})^2 \]可以证明数学期望:
\[ E\left[\frac{SS}{n-1}\right]=\sigma^2 \]方差#
方差(variance)为偏差平方后的平均数,计算公式:
\[ \sigma^2 = \frac{\sum_{i=1}^n (x_i-\bar{x})^2}{n} \]方差 = 差(与平均值的差)的平方
单位是原数据的平方。
标准差为方差开根号,单位和原始数据一致,方便业务解读。
正态分布#
正态分布(Normal distribution,又称为常态分布或高斯分布)是最常见的分布,很多自然现象的统计都符合正态分布。
正态分布的概率密度函数显示为典型的钟形曲线,通常记作 $N(\mu,\sigma^2)$
正态分布对方差倍数的范围内覆盖的数据有一定的规律:
- ±1σ:覆盖约 68.26% 的数据
- ±2σ:覆盖约 95.45% 的数据
- ±3σ:覆盖约 99.73% 的数据
- ±6σ:覆盖约 99.9999999998745% 的数据
工业 6σ 会额外考虑 1.5σ 过程偏移,覆盖率为 99.99966%,不良率约 3.4 DPMO(Defects Per Million Opportunities,每百万次操作机会的缺陷数)。
应用#
监控时序数据的异常值:采用滚动窗口计算正常数据的基线(比如取过去 7 天数据计算 μ 和 σ),如果新数据超出了基准 μ 的 ±3σ(只有 0.27% 的低概率),则判断为异常值。
区别与常规的阈值判断,标准差 σ 的优势是自适应基线,以设备自身历史行为作为判断标准,只要波动偏离自身常态(例如超出 ±3σ),提前预警故障,而不是单纯看绝对值高低。
但长期放任异常,任由其滚动刷新基线,基线均值会被拉低、σ 会变大,异常数值被纳入新 “正常范围”,告警消失。
为了避免基线走偏,时序监控系统会避免使用故障数据更新基线。