自由度 Degrees of Freedom
统计里能自由取值的数据个数,样本标准差取n-1。
自由度指的是在一组数据中,能够自由变动、不受约束的数值个数。它听起来抽象,其实就是「有多少个数是真正独立的」。每当你根据数据算出一个统计量(比如平均值)并把它当成已知条件,就会「用掉」一个自由度。
最常见的场景是算样本标准差和样本方差时分母用 n-1 而不是 n。原因是:你已经先用这批数据算出了平均值,一旦平均值固定,n 个数里只要确定了前 n-1 个,最后一个就被平均值反推出来了,没法自由取值。所以真正独立的信息只有 n-1 份,分母就取 n-1。这个做法叫贝塞尔校正,能让样本方差更接近总体的真实波动。
要注意,自由度不是一个固定数字,而是随分析方法变化的:单样本一般是 n-1,两组比较、回归分析里会有各自的算法。普通人只要记住一点——用样本估计总体、且过程中先算了平均值,分母就该减一。
关于自由度的常见问答
为什么样本标准差要除以 n-1 而不是 n?因为算标准差前你已经先用数据算出了平均值,平均值一旦定死,n 个数里只有 n-1 个能自由变。除以 n-1 是对样本低估波动的修正,结果更接近总体真实情况。
什么时候用 n,什么时候用 n-1?手里的数据就是全部对象(总体),分母用 n;数据只是从更大群体里抽的一部分(样本)、要拿它去估计整体,就用 n-1。
自由度一定是 n-1 吗?不一定。n-1 只是最常见的单样本情形,两样本比较、回归、卡方检验等各有各的自由度算法,本质都是「独立信息的个数」。