外观
Lesson 2 随机误差
约 3694 字大约 12 分钟
2026-10-07
随机误差指的是对同一被测量进行多次重复测量,误差的大小和方向随机变化,单次无确切规律,但总体服从某种统计规律。
Part 1 统计分布
· 正态分布
绝大多数随机误差服从正态分布
f(δ)=σ2π1e−2σ2δ2
从误差来源来看,任何一个宏观测量或自然现象的随机误差(或波动),往往都是由大量互不相关、微小的独立随机因素共同叠加造成的。根据中心极限定理,只要这些微小因素的数量足够多,其总和的概率分布必然趋近于高斯分布。
其中包含两个决定其形态的核心参数:
数学期望 μ(均值):决定了分布曲线的中心位置(对称轴)。
标准差 σ(或方差 σ2):决定了分布曲线的分散程度(陡峭或扁平)。σ 越小,曲线越瘦高,表示数据越集中、精密度越高;σ 越大,曲线越矮胖,表示数据越分散。
当 μ=0,σ=1 时,称为标准正态分布。
在误差分析与数据处理中,服从正态分布的随机误差具有四个极其重要的物理与数学特征:
对称性:绝对值相等的正误差与负误差出现的概率相等(f(+δ)=f(−δ))。
单峰性:绝对值小的误差比绝对值大的误差出现的概率高,在零误差处概率密度达到最大值。
有界性:虽然数学上定义区间为 (−∞,+∞),但在实际物理测量中,误差只可能出现在一个有限的区间 [−kσ,+kσ] 内。
抵偿性(补偿性):当测量次数趋于无穷大时,随机误差的算术平均值趋向于零
n→∞limn∑δi=0
高斯分布曲线下的总面积为 1。通过对概率密度函数积分,可以得到误差落在特定标准差区间的概率:
落在区间 (−σ,+σ) 内的概率为 68.26%。
落在区间 (−2σ,+2σ) 内的概率为 95.44%。
落在区间 (−3σ,+3σ) 内的概率高达 99.73%。
在工程和实验中,由于超出 ±3σ 的概率极小(仅 0.27%),通常将 δlim=±3σ 作为单次测量的极限误差(即著名的 3σ 准则)。如果在测量中发现绝对值大于 3σ 的误差,通常认为其中混入了粗大误差(或异常值),需要予以剔除。
· 非正态分布
均匀分布:
误差有一个确定的范围(−a 到 +a),在此范围内,误差出现的概率各处相等。
数学期望:E=0 ;方差:σ2=3a2 ;标准差:σ=3a
反正弦分布:
一种特殊的随机误差函数分布规律,其特点是该随机误差与某一角度成正弦关系, σ=2a;E=0
三角形分布:
当两个误差限相同且服从均匀分布的随机误差求和时,其和的分布规律就会服从三角形分布,又称辛普森(Simpson)分布。若整个测量过程必须进行两次才能完成,而每次测量的随机误差服从相同的均匀分布,则总的测量误差表现为三角形分布。
如果对两个误差限不相等的均匀分布随机误差求和,其分布规律则会变成梯形分布。
σ=6a;E=0.
· 采样与统计推断分布
χ2 分布(卡方)
笔记
定义:
设 ξ1,ξ2,…,ξν 是 ν 个相互独立的标准正态随机变量(均值为0,方差为1),则这 ν 个变量的平方和:
χ2=ξ12+ξ22+⋯+ξν2
服从自由度为 ν 的卡方分布。这里的 ν 表示自由度(即独立变量的个数)。
数学期望与方差:卡方分布的数学期望为 E(χ2)=ν,方差为 σ2=2ν。
形态特征:
卡方分布的取值域为 (0,+∞),它是一条向右拖着长尾巴的偏态分布曲线。随着自由度 ν 的增大,卡方分布会逐渐变得对称,当 ν 足够大时,它会逼近正态分布。
Question:为什么引入它?
它的本质是标准正态变量平方和的分布。在误差处理中,残差平方和(例如贝塞尔公式中的 ∑vi2)经过适当变换后就服从卡方分布。因此,χ2 分布是用来对总体方差 σ2 进行区间估计和假设检验的核心工具。
t 分布(小样本推断)
笔记
化学家兼统计学家威廉·戈塞特(William Sealy Gosset)在爱尔兰的吉尼斯酿酒厂工作时,需要处理小样本数据(因为酿酒厂的实验成本高,无法做成百上千次测量)。由于当时数学界只知道大样本的正态分布,小样本下用样本标准差 s 代替 σ 会导致严重的误差。他以笔名 "Student"(学生) 发表了这一分布,因此被称为“学生氏 t 分布”。
定义:
设 η 是服从标准正态分布的随机变量,ξ 是服从自由度为 ν 的卡方分布随机变量,且 η 与 ξ 相互独立,则定义一个新的统计量:
t=ξ/νη
该变量服从自由度为 ν 的 t 分布。
形态特征:t 分布的形状与标准正态分布非常相似,都是关于纵轴对称的单峰钟形曲线。但它的尾部比正态分布更厚(胖)。
核心规律:
t 分布有一个参数——自由度 ν=n−1(n 为测量次数)。当样本量 n 越来越大(ν→∞)时,t 分布的尾部收缩,完全退化为标准的正态分布。
Question:为什么引入它?
解决“小样本且总体标准差未知”的难题,在常规测量中,如果测量次数较少(如 n<30),如果我们强行使用正态分布来计算极限误差或置信区间,会导致置信水平不准确(风险被低估)。
此时,必须引入 t 分布,用样本标准差 s 配合 t 统计量来构建更严谨的置信区间。
F 分布(方差比分析)
笔记
用于方差齐性检验与方差分析(ANOVA)。
在工程和科学测量中,我们经常需要比较:两台不同的仪器测出来的精度(方差)有没有本质区别? 或者不同的工艺条件对测量结果的波动有没有显著影响?
单纯看两个方差的绝对大小无法判定,而 F 分布提供了一种数学标准,通过计算方差比并查 F 表,我们就能科学地判断两组数据的波动性是否存在显著差异。
定义:
设 ξ1 和 ξ2 是两个独立的卡方分布随机变量,它们的自由度分别为 ν1 和 ν2,则定义随机变量 F 为:
F=ξ2/ν2ξ1/ν1
这个比值就服从自由度分别为 (ν1,ν2) 的 F 分布。
形态特征:F 分布是一个非对称的右偏分布,取值范围为 (0,+∞)。它由两个自由度参数 (ν1,ν2) 共同决定。
物理意义:它本质上是两个独立的样本方差(或卡方变量)的比值。
Part 2 等精度测量的评估方法
· Bessel Method
在误差理论中,贝塞尔方法是精度最高、最严谨的随机误差数据处理方法之一。不过由于它需要做平方和开方,计算相对繁琐.
对于 n 次等精度测量(在完全相同的测量条件下,对同一个物理量进行的多次测量)列 l1,l2,…,ln:
(1). 算术平均值(最佳估计值):
xˉ=n1i=1∑nli
当对某个物理量进行 n 次等精度测量时,由于随机误差具有“对称性”和“抵偿性(补偿性)”(即正负误差相互抵消),多次测量的算术平均值会随着测量次数的增加而无限趋近于真值 L0. 在最小二乘法原理下,算术平均值是真值在所有线性无偏估计中的最佳估计值,它能使所有测量值的残差平方和达到最小。
(2). 残余误差(残差 vi):
vi=li−xˉ(verify:∑vi=0)
我们已知真误差 δi=li−L0:因为真值 L0 未知,所以 δi 在实际中是算不出来的。残差 vi=li−xˉ:用算术平均值 xˉ 代替真值后计算出来的差值。它代表了单次测得值偏离平均值的程度。根据算术平均值的性质,所有残差的代数和理论上应该等于零(∑vi=0)。在实际手算或编程时,它可用于检验计算结果是否正确.
(3). 单次测量标准差 σ(贝塞尔 Bessel 公式):
σ=n−1i=1∑nvi2
是用来评定单次测量结果精密度高低的核心指标。σ 越小,说明这套仪器的单次测量越稳定、越集中。
如果真值已知,我们计算标准差时分母确实是 n(∑nδi2)。但现在真值未知,我们是用算术平均值 xˉ 来代替真值的。
由于 xˉ 是从这组数据本身算出来的,它会“顺便”吸收掉一部分数据的自由度。因此,计算残差平方和时,自由度由 n 减少了 1,变成了 n−1。在统计学中,这被称为贝塞尔无偏估计。
(4). 算术平均值的标准差 σxˉ:
σxˉ=nσ=n(n−1)i=1∑nvi2
σxˉ 衡量的是由多次测量算出来的“平均值”本身有多不可靠(即不同测量列的平均值之间的分散性)。平均值显然比单次测量更稳定,所以它除以了 n。
重要
结论:测量次数 n 增加能提高精度,但精度仅与 n 成正比。由于过高增加 n 易引入新的环境误差,实际中一般取 n=8∼10 次最为适宜。
· Peters Method
别捷尔斯法(Peters):用残差绝对值之和计算
σ≈1.2533n(n−1)∑∣vi∣
最早被用于俄罗斯普尔科夫天文台的大规模天文数据处理。虽然它的精度比贝塞尔公式略低(计算误差约为贝塞尔的 1.07 倍),但它省去了乘方运算,显著提高了计算速度
· Range Method
极差法:(小样本 n<10 适用)利用极差
ωn=xmax−xmin,σ=dnωn
无论是贝塞尔法还是别捷尔斯法,都必须先辛辛苦苦算出算术平均值 xˉ,然后才能算出每一个残差 vi。
极差法彻底简化了流程——它直接利用测量列中的最大值与最小值之差(极差 ωn=xmax−xmin)来评估标准差。
在小样本(n<10)的情况下,极差法计算标准差的精度甚至可以高于贝塞尔公式,非常适合作为现场快速校对或估算的工具
· Maximum Error Method
最大误差法:
σ=Kn′∣vi∣max
当测量次数极少(n 很小),或者遇到了破坏性实验(例如测试某种材料的极限抗拉强度,试样测一次就破坏了,根本无法重复测量,n=1)时,算术平均值、残差、贝塞尔公式全部失效。
最大误差法允许我们直接利用已知的最大绝对误差(或最大残差 ∣vi∣max)乘以对应样本量的系数来直接估算标准差。
· 极限误差与置信区间
极限误差定义:在给定置信概率(置信度)下,随机误差不超出的最大边界 δlim=±t⋅σ。
三大典型区间(正态分布):
±1σ:置信概率约为 68.26%。
±2σ:置信概率约为 95.44%。
±3σ:置信概率高达 99.73%(通常将 3σ 作为单次测量的极限误差,即“3$\sigma$ 准则”)。
小样本处理(n<30 且 σ 未知):
应使用 t 分布 替代正态分布计算极限误差:
δlim=±tα,ν⋅σxˉ
(其中自由度 ν=n−1)。
Part 3 不等精度测量
当我们在不同条件下、或使用不同精度仪器对同一个物理量进行了多组独立测量时,由于各组数据的可靠程度不同,不能直接简单地取算术平均值,必须引入“权”的概念进行加权处理。
权(Weight p)的概念:衡量某组测量结果相对可靠程度的数值。
权的确定法则:
按测量次数确定:若各组测量的单次精度相同(即单次测量的标准差一样),但重复测量的次数 ni 不同,则重复次数越多,可靠性越高,权与次数成正比,即 pi=ni。
按标准差(方差)确定:若测量条件完全不同,各组自身的标准差 σi(或平均值标准差 σxˉi)已知,则权与标准差的平方(即方差)成反比:
p1:p2:⋯:pm=σ121:σ221:⋯:σm21
标准差 σ 越大,说明该组数据越分散、越不可靠;根据反比关系,它的权 p 就会越小,这完全符合逻辑。
加权算术平均值:
xˉ=∑i=1mpi∑i=1mpixˉi
在实际计算中,为了防止数字太大不好算,通常会先选定一个接近所有测量值的参考零点 x0,利用差值进行简化计算。
加权平均值的标准差:
σxˉ=(m−1)∑i=1mpii=1∑mpivxˉi2
用来评定最终算出来的加权算术平均值 xˉ 的可靠程度(精度),这里的 m 代表的是测量组数(而不是总测量次数)。因为我们通过 m 组数据计算加权平均值时消耗了一个自由度,所以分母是 m−1(类似于贝塞尔公式的无偏估计思想)
更新日志
2026/10/10 08:15
查看所有更新日志
ab9b1-index.ts于64a1f-metrology-2于