标准差
原创 发布时间:2026-07-28 | 更新时间:2026-07-28

定义#

两家工厂生产螺丝,标准长度 10mm,各抽 5 个样品:

  • A 厂:10、10、10、10、10
    均值是 10,所有数据完全贴平均值,标准差 = 0,零波动,完美
  • B 厂:7、9、10、11、13
    均值也是 10,但长短差别巨大,标准差很大,品质不稳定

标准差(standard deviation)就是衡量一组数据偏离平均值的平均波动幅度。 数字越大数据越乱、起伏大、不稳定;数字越小数据集中、波动小、一致性高。

符号:

  • 总体标准差 $\sigma$
  • 样本标准差 $s$

计算#

总体标准差 $\sigma$(全部产品,完整数据)

\[ \sigma = \sqrt{\frac{\sum_{i=1}^n (x_i-\mu)^2}{n}} \]

$\mu$ 为真实总体均值

样本标准差 $s$(只抽一部分样品检测,工厂质检常用)

\[ s = \sqrt{\frac{\sum_{i=1}^n (x_i-\bar{x})^2}{n-1}} \]

$\bar{x}$ 为样本均值

为什么分母用 $n-1$ 修正误差

总体标准差 $\sigma$ 分母使用 $n$,因为均值 $\mu$ 是真实总体均值,无误差。

样本标准差 $s$ 只抽一小部分样品,只能用样本均值 $\bar{x}$ 替代真实总体均值 $\mu$,
但样本均值 $\bar{x}$ 是由这 n 个样本自己算出来的,它会自动往样本中间靠,导致

\[ \sum(x_i-\bar{x})^2 \le \sum(x_i-\mu)^2 \]

即用样本均值 $\bar{x}$ 计算出来的标准差天生偏小。

我们计算样本均值 $\bar{x}$ 时,

\[ \bar{x} = \frac{x_1+x_2+...+x_n}{n} \]

如果 $\bar{x}$ 和 $x_1+x_2+…+x_{n-1}$ 已经确定,那么 $x_n$ 也一定是被确定了的,也就是说,真正独立有效的信息只有 $n-1$ 份,因此计算偏差平方和时,分母要除以有效自由度 $n-1$,而不是全部样本数 $n$。

事实上,设样本偏差平方和:

\[ SS=\sum(x_i-\bar{x})^2 \]

可以证明数学期望:

\[ E\left[\frac{SS}{n-1}\right]=\sigma^2 \]

方差#

方差(variance)为偏差平方后的平均数,计算公式:

\[ \sigma^2 = \frac{\sum_{i=1}^n (x_i-\bar{x})^2}{n} \]

方差 = 差(与平均值的差)的平方

单位是原数据的平方。

标准差为方差开根号,单位和原始数据一致,方便业务解读。

正态分布#

正态分布(Normal distribution,又称为常态分布高斯分布)是最常见的分布,很多自然现象的统计都符合正态分布。

正态分布的概率密度函数显示为典型的钟形曲线,通常记作 $N(\mu,\sigma^2)$

正态分布对方差倍数的范围内覆盖的数据有一定的规律:

  • ±1σ:覆盖约 68.26% 的数据
  • ±2σ:覆盖约 95.45% 的数据
  • ±3σ:覆盖约 99.73% 的数据
  • ±6σ:覆盖约 99.9999999998745% 的数据

工业 6σ 会额外考虑 1.5σ 过程偏移,覆盖率为 99.99966%,不良率约 3.4 DPMO(Defects Per Million Opportunities,每百万次操作机会的缺陷数)。

应用#

监控时序数据的异常值:采用滚动窗口计算正常数据的基线(比如取过去 7 天数据计算 μ 和 σ),如果新数据超出了基准 μ 的 ±3σ(只有 0.27% 的低概率),则判断为异常值。

区别与常规的阈值判断,标准差 σ 的优势是自适应基线,以设备自身历史行为作为判断标准,只要波动偏离自身常态(例如超出 ±3σ),提前预警故障,而不是单纯看绝对值高低。

但长期放任异常,任由其滚动刷新基线,基线均值会被拉低、σ 会变大,异常数值被纳入新 “正常范围”,告警消失。

为了避免基线走偏,时序监控系统会避免使用故障数据更新基线。


techunder_official 关注「Techunder技术人文」微信公众号,获取最新文章通知

版权所有 © 2026 Techunder (Guanhua Liu) | Copyright All Rights Reserved | 电子邮箱 Email:techunder@163.com

粤公网安备44060502004200号   粤ICP备2026007783号