---
url: /Metrology/lesson-2/index.md
---
随机误差指的是对同一被测量进行多次重复测量，误差的大小和方向随机变化，单次无确切规律，但总体服从某种**统计规律**。

## Part 1 统计分布

### · 正态分布

绝大多数随机误差服从正态分布
$$
f(\delta) = \frac{1}{\sigma\sqrt{2\pi}}e^{-\frac{\delta^2}{2\sigma^2}}
$$
从误差来源来看，任何一个宏观测量或自然现象的随机误差（或波动），往往都是**由大量互不相关、微小的独立随机因素共同叠加**造成的。根据中心极限定理，只要这些微小因素的数量足够多，其总和的概率分布必然趋近于高斯分布。

其中包含两个决定其形态的核心参数：

> **数学期望 $\mu$（均值）**：决定了分布曲线的**中心位置**（对称轴）。
>
> **标准差 $\sigma$（或方差 $\sigma^2$）**：决定了分布曲线的**分散程度（陡峭或扁平）**。$\sigma$ 越小，曲线越瘦高，表示数据越集中、精密度越高；$\sigma$ 越大，曲线越矮胖，表示数据越分散。
>
> 当 $\mu = 0, \sigma = 1$ 时，称为**标准正态分布**。

在误差分析与数据处理中，服从正态分布的随机误差具有四个极其重要的物理与数学特征：

> 1. **对称性**：绝对值相等的正误差与负误差出现的概率相等（$f(+\delta) = f(-\delta)$）。
>
> 2. **单峰性**：绝对值小的误差比绝对值大的误差出现的概率高，在零误差处概率密度达到最大值。
>
> 3. **有界性**：虽然数学上定义区间为 $(-\infty, +\infty)$，但在实际物理测量中，误差只可能出现在一个有限的区间 $\[-k\sigma, +k\sigma]$ 内。
>
> 4. **抵偿性（补偿性）**：当测量次数趋于无穷大时，随机误差的算术平均值趋向于零
>    $$
>    \lim\_{n\to\infty} \frac{\sum \delta\_i}{n} = 0
>    $$

高斯分布曲线下的总面积为 1。通过对概率密度函数积分，可以得到误差落在特定标准差区间的概率：

> 落在区间 $(-\sigma, +\sigma)$ 内的概率为 **$68.26%$**。
>
> 落在区间 $(-2\sigma, +2\sigma)$ 内的概率为 **$95.44%$**。
>
> 落在区间 $(-3\sigma, +3\sigma)$ 内的概率高达 **$99.73%$**。

在工程和实验中，由于超出 $\pm 3\sigma$ 的概率极小（仅 $0.27%$），通常将 **$\delta\_{lim} = \pm 3\sigma$** 作为单次测量的**极限误差**（即著名的 **$3\sigma$ 准则**）。如果在测量中发现绝对值大于 $3\sigma$ 的误差，通常认为其中混入了粗大误差（或异常值），需要予以剔除。

### · 非正态分布

**均匀分布**：

> 误差有一个确定的范围（$-a$ 到 $+a$），在此范围内，误差出现的概率各处相等。
>
> 数学期望：$E = 0$ ；方差：$\sigma^2 = \dfrac{a^2}{3}$ ；标准差：$\sigma = \dfrac{a}{\sqrt{3}}$

**反正弦分布**：

> 一种特殊的随机误差函数分布规律，其特点是该随机误差与某一角度成正弦关系， $\sigma = \dfrac{a}{\sqrt{2}}$；$E = 0$

**三角形分布**：

> 当两个误差限相同且服从均匀分布的随机误差求和时，其和的分布规律就会服从三角形分布，又称辛普森（Simpson）分布。若整个测量过程必须进行两次才能完成，而每次测量的随机误差服从相同的均匀分布，则总的测量误差表现为三角形分布。
>
> 如果对两个误差限**不相等**的均匀分布随机误差求和，其分布规律则会变成**梯形分布**。
>
> $\sigma = \dfrac{a}{\sqrt{6}}$；$E=0$.

### · 采样与统计推断分布

$\chi^2$ 分布（卡方）

> \[!note]
>
> **定义**：
>
> > 设 $\xi\_1, \xi\_2, \dots, \xi\_\nu$ 是 $\nu$ 个相互独立的标准正态随机变量（均值为0，方差为1），则这 $\nu$ 个变量的平方和：
> > $$
> > \chi^2 = \xi\_1^2 + \xi\_2^2 + \dots + \xi\_\nu^2
> > $$
> > 服从自由度为 $\nu$ 的卡方分布。这里的 $\nu$ 表示自由度（即独立变量的个数）。
>
> **数学期望与方差**：卡方分布的数学期望为 $E(\chi^2) = \nu$，方差为 $\sigma^2 = 2\nu$。
>
> **形态特征**：
>
> > 卡方分布的取值域为 $(0, +\infty)$，它是一条向右拖着长尾巴的偏态分布曲线。随着自由度 $\nu$ 的增大，卡方分布会逐渐变得对称，当 $\nu$ 足够大时，它会逼近正态分布。
>
> Question：为什么引入它？
>
> > 它的本质是**标准正态变量平方和的分布**。在误差处理中，残差平方和（例如贝塞尔公式中的 $\sum v\_i^2$）经过适当变换后就服从卡方分布。因此，**$\chi^2$ 分布是用来对总体方差 $\sigma^2$ 进行区间估计和假设检验的核心工具**。

$t$ 分布（小样本推断）

> \[!note]
>
> 化学家兼统计学家威廉·戈塞特（William Sealy Gosset）在爱尔兰的吉尼斯酿酒厂工作时，需要处理**小样本数据**（因为酿酒厂的实验成本高，无法做成百上千次测量）。由于当时数学界只知道大样本的正态分布，小样本下用样本标准差 $s$ 代替 $\sigma$ 会导致严重的误差。他以笔名 **"Student"（学生）** 发表了这一分布，因此被称为“学生氏 $t$ 分布”。
>
> **定义**：
>
> > 设 $\eta$ 是服从标准正态分布的随机变量，$\xi$ 是服从自由度为 $\nu$ 的卡方分布随机变量，且 $\eta$ 与 $\xi$ 相互独立，则定义一个新的统计量：
> > $$
> > t = \frac{\eta}{\sqrt{\xi/\nu}}
> > $$
> > 该变量服从自由度为 $\nu$ 的 $t$ 分布。
>
> **形态特征**：$t$ 分布的形状与标准正态分布非常相似，都是关于纵轴对称的单峰钟形曲线。但它的**尾部比正态分布更厚（胖）**。
>
> **核心规律**：
>
> > $t$ 分布有一个参数——自由度 $\nu = n-1$（$n$ 为测量次数）。当样本量 $n$ 越来越大（$\nu \to \infty$）时，$t$ 分布的尾部收缩，**完全退化为标准的正态分布**。
>
> Question：为什么引入它？
>
> > **解决“小样本且总体标准差未知”的难题**，在常规测量中，如果测量次数较少（如 $n < 30$），如果我们强行使用正态分布来计算极限误差或置信区间，会导致置信水平不准确（风险被低估）。
> >
> > 此时，必须引入 $t$ 分布，用样本标准差 $s$ 配合 $t$ 统计量来构建更严谨的置信区间。

$F$ 分布（方差比分析）

> \[!note]
>
> **用于方差齐性检验与方差分析（ANOVA）**。
>
> 在工程和科学测量中，我们经常需要比较：**两台不同的仪器测出来的精度（方差）有没有本质区别？** 或者**不同的工艺条件对测量结果的波动有没有显著影响？**
>
> 单纯看两个方差的绝对大小无法判定，而 $F$ 分布提供了一种数学标准，通过计算方差比并查 $F$ 表，我们就能科学地判断两组数据的波动性是否存在显著差异。
>
> **定义**：
>
> > 设 $\xi\_1$ 和 $\xi\_2$ 是两个独立的卡方分布随机变量，它们的自由度分别为 $\nu\_1$ 和 $\nu\_2$，则定义随机变量 $F$ 为：
> > $$
> > F = \frac{\xi\_1 / \nu\_1}{\xi\_2 / \nu\_2}
> > $$
> > 这个比值就服从自由度分别为 $(\nu\_1, \nu\_2)$ 的 $F$ 分布。
>
> **形态特征**：$F$ 分布是一个非对称的右偏分布，取值范围为 $(0, +\infty)$。它由两个自由度参数 $(\nu\_1, \nu\_2)$ 共同决定。
>
> **物理意义**：它本质上是**两个独立的样本方差（或卡方变量）的比值**。

## Part 2 等精度测量的评估方法

### · Bessel Method

在误差理论中，贝塞尔方法是精度最高、最严谨的随机误差数据处理方法之一。不过由于它需要做平方和开方，计算相对繁琐.

对于 $n$ 次等精度测量（在完全相同的测量条件下，对同一个物理量进行的多次测量）列 $l\_1, l\_2, \dots, l\_n$：

(1). **算术平均值（最佳估计值）**：

$$
\bar{x} = \frac{1}{n}\sum\_{i=1}^{n}l\_i
$$
当对某个物理量进行 $n$ 次等精度测量时，由于随机误差具有“对称性”和“抵偿性（补偿性）”（即正负误差相互抵消），多次测量的算术平均值会随着测量次数的增加而无限趋近于真值 $L\_0$. 在最小二乘法原理下，算术平均值是真值在所有线性无偏估计中的**最佳估计值**，它能使所有测量值的残差平方和达到最小。

(2). **残余误差（残差 $v\_i$）**：

$$
v\_i = l\_i - \bar{x} \quad (\text{verify：} \sum v\_i = 0)
$$
我们已知**真误差** $\delta\_i = l\_i - L\_0$：因为真值 $L\_0$ 未知，所以 $\delta\_i$ 在实际中是算不出来的。**残差 $v\_i = l\_i - \bar{x}$**：用算术平均值 $\bar{x}$ 代替真值后计算出来的差值。它代表了单次测得值偏离平均值的程度。根据算术平均值的性质，所有残差的代数和理论上应该等于零（$\sum v\_i = 0$）。在实际手算或编程时，它可用于**检验计算结果是否正确**.

(3). **单次测量标准差 $\sigma$（贝塞尔 Bessel 公式）**：

$$
\sigma = \sqrt{\frac{\displaystyle\sum\_{i=1}^{n}v\_i^2}{n-1}}
$$
是用来评定**单次测量结果精密度**高低的核心指标。$\sigma$ 越小，说明这套仪器的单次测量越稳定、越集中。

如果真值已知，我们计算标准差时分母确实是 $n$（$\sum\dfrac{\delta\_i^2}{n}$）。但现在真值未知，我们是用算术平均值 $\bar{x}$ 来代替真值的。

由于 $\bar{x}$ 是从这组数据本身算出来的，它会“顺便”吸收掉一部分数据的自由度。因此，计算残差平方和时，自由度由 $n$ 减少了 1，变成了 $n-1$。在统计学中，这被称为**贝塞尔无偏估计**。

(4). **算术平均值的标准差 $\sigma\_{\bar{x}}$**：

$$
\sigma\_{\bar{x}} = \frac{\sigma}{\sqrt{n}} = \sqrt{\frac{\displaystyle\sum\_{i=1}^{n}v\_i^2}{n(n-1)}}
$$
$\sigma\_{\bar{x}}$ 衡量的是**由多次测量算出来的“平均值”本身**有多不可靠（即不同测量列的平均值之间的分散性）。平均值显然比单次测量更稳定，所以它除以了 $\sqrt{n}$。

> \[!important]
>
> 结论：测量次数 $n$ 增加能提高精度，但精度仅与 $\sqrt{n}$ 成正比。由于过高增加 $n$ 易引入新的环境误差，实际中一般取 **$n = 8 \sim 10$** 次最为适宜。

### · Peters Method

**别捷尔斯法（Peters）**：用残差绝对值之和计算
$$
\sigma \approx 1.2533 \frac{\sum \vert{}v\_i\vert{}}{\sqrt{n(n-1)}}
$$
最早被用于俄罗斯普尔科夫天文台的大规模天文数据处理。虽然它的精度比贝塞尔公式略低（计算误差约为贝塞尔的 1.07 倍），但它省去了乘方运算，显著提高了计算速度

### · Range Method

**极差法**：（小样本 $n<10$ 适用）利用极差
$$
\omega\_n = x\_{\max} - x\_{\min},\quad \sigma = \frac{\omega\_n}{d\_n}
$$
无论是贝塞尔法还是别捷尔斯法，都必须先辛辛苦苦算出算术平均值 $\bar{x}$，然后才能算出每一个残差 $v\_i$。

极差法彻底简化了流程——它直接利用测量列中的最大值与最小值之差（极差 $\omega\_n = x\_{\max} - x\_{\min}$）来评估标准差。

在小样本（$n < 10$）的情况下，极差法计算标准差的精度甚至可以高于贝塞尔公式，非常适合作为现场快速校对或估算的工具

### · Maximum Error Method

**最大误差法**：
$$
\sigma = \frac{\vert{}v\_i\vert{}\_{\max}}{K\_n'}
$$
当测量次数极少（$n$ 很小），或者遇到了破坏性实验（例如测试某种材料的极限抗拉强度，试样测一次就破坏了，根本无法重复测量，$n = 1$）时，算术平均值、残差、贝塞尔公式全部失效。

最大误差法允许我们直接利用已知的最大绝对误差（或最大残差 $\vert{}v\_i\vert{}\_{\max}$）乘以对应样本量的系数来直接估算标准差。

### · 极限误差与置信区间

**极限误差定义**：在给定置信概率（置信度）下，随机误差不超出的最大边界 $\delta\_{lim} = \pm t \cdot \sigma$。

**三大典型区间（正态分布）**：

> $\pm 1\sigma$：置信概率约为 $68.26%$。
>
> $\pm 2\sigma$：置信概率约为 $95.44%$。
>
> $\pm 3\sigma$：置信概率高达 $99.73%$（通常将 $3\sigma$ 作为单次测量的**极限误差**，即“3$\sigma$ 准则”）。

**小样本处理（$n<30$ 且 $\sigma$ 未知）**：

> 应使用 **$t$ 分布** 替代正态分布计算极限误差：
> $$
> \delta\_{lim} = \pm t\_{\alpha,\nu} \cdot \sigma\_{\bar{x}}
> $$
> （其中自由度 $\nu = n-1$）。

## Part 3 不等精度测量

当我们在不同条件下、或使用不同精度仪器对同一个物理量进行了多组独立测量时，由于各组数据的可靠程度不同，不能直接简单地取算术平均值，必须引入“权”的概念进行加权处理。

**权（Weight $p$）的概念**：衡量某组测量结果相对可靠程度的数值。

**权的确定法则**：

> **按测量次数确定**：若各组测量的单次精度相同（即单次测量的标准差一样），但重复测量的次数 $n\_i$ 不同，则**重复次数越多，可靠性越高，权与次数成正比**，即 $p\_i = n\_i$。
>
> **按标准差（方差）确定**：若测量条件完全不同，各组自身的标准差 $\sigma\_i$（或平均值标准差 $\sigma\_{\bar{x}i}$）已知，则**权与标准差的平方（即方差）成反比**：
> $$
> p\_1 : p\_2 : \dots : p\_m = \frac{1}{\sigma\_1^2} : \frac{1}{\sigma\_2^2} : \dots : \frac{1}{\sigma\_m^2}
> $$
> 标准差 $\sigma$ 越大，说明该组数据越分散、越不可靠；根据反比关系，它的权 $p$ 就会越小，这完全符合逻辑。

**加权算术平均值**：
$$
\bar{x} = \frac{\sum\_{i=1}^{m} p\_i \bar{x}*i}{\sum*{i=1}^{m} p\_i}
$$
在实际计算中，为了防止数字太大不好算，通常会先选定一个接近所有测量值的参考零点 $x\_0$，利用差值进行简化计算。

**加权平均值的标准差**：
$$
\sigma\_{\bar{x}} = \sqrt{\frac{\displaystyle\sum\_{i=1}^{m} p\_i v\_{\bar{x}*i}^2}{(m-1) \sum*{i=1}^{m} p\_i}}
$$
用来评定最终算出来的**加权算术平均值 $\bar{x}$ 的可靠程度（精度）**，这里的 $m$ 代表的是**测量组数**（而不是总测量次数）。因为我们通过 $m$ 组数据计算加权平均值时消耗了一个自由度，所以分母是 $m-1$（类似于贝塞尔公式的无偏估计思想）
