统计里最爱考的两件事:一是「两个分类变量到底有没有关系」——用一个数 K² 来判(独立性检验);二是「一堆散点最贴合的那条直线是什么」——用最小二乘求回归方程 ŷ=b̂x+â。前者靠公式代入 + 查临界值下结论;后者靠算 x̄、ȳ、b̂、â 四步走。全是套路,套路吃透就是白送分。
研究两个「分类变量」(每个只有两类,如 患病/健康、吸烟/不吸烟)是否有关,先把频数填成 2×2 表:
| 类别 y₁ | 类别 y₂ | 合计 | |
|---|---|---|---|
| 类别 x₁ | a | b | a+b |
| 类别 x₂ | c | d | c+d |
| 合计 | a+c | b+d | n=a+b+c+d |
直觉判断法: 比较两个比例 a/(a+b) 与 c/(c+d)。差得越多,两变量越可能有关;几乎相等 → 可能独立。但直觉不够严谨,要用 K² 定量。
⚠ a、b、c、d 是频数(人数、个数),不是比例、不是百分数!四个格子加起来 = 总样本 n。摆表时行、列的对应关系别放错。
分子是 n·(ad−bc)²(对角线乘积之差,平方后必非负);分母是四个「边缘合计」的乘积((a+b)(c+d) 是两行合计,(a+c)(b+d) 是两列合计)。K² ≥ 0,K² 越大 → 两变量关联越强。若 ad=bc,则 K²=0,完全独立。
| 把握程度 | 显著性水平 α | 临界值 k₀ |
|---|---|---|
| 90% | 0.10 | 2.706 |
| 95% | 0.05 | 3.841 |
| 99% | 0.01 | 6.635 |
| 99.5% | 0.005 | 7.879 |
| 99.9% | 0.001 | 10.828 |
⚠ K² 是拿来否定「独立」的。K² 大 = 有关;K² 小 ≠ 「一定独立」,只能说「证据不足,不能认为有关」。表述要小心。
改四个格子的频数,K² 立刻重算。绿=没把握认为有关(K²≤3.841)、橙=95%有关、红=99%有关。试试把 a、d 调大、b、c 调小 → 对角越悬殊 K² 越大。
总数固定 n=100,滑块把 a=d 拉大、b=c 拉小(对角越悬殊)。指针在临界值刻度尺上移动:越过 3.841 变橙、越过 6.635 变红。K² 越大 = 关联越强。
ŷ(读作 y-hat)是预测值/估计值,不是真实观测值。b̂ 是斜率(x 每增 1,ŷ 平均变化 b̂),â 是截距。求它俩靠最小二乘法——让所有点到直线的竖直偏差平方和最小。
等价常用式:b̂ = (Σxiyi − n·x̄·ȳ) / (Σxi² − n·x̄²)。算的时候先求 x̄、ȳ,再算分子分母,得 b̂,最后 â=ȳ−b̂x̄。
⚠ â=ȳ−b̂x̄,不是 ȳ−b̂!分母是 Σ(xᵢ−x̄)²(只含 x),别把 y 也放进分母。ŷ 是估计值,写作带帽子的 ŷ。
红点可拖动。蓝线=最小二乘回归直线,黄虚线=每个点到直线的竖直偏差(残差)。拖动任一点,直线立刻重算,而且永远穿过绿色的样本中心 (x̄, ȳ)。
保持斜率不变,上下平移这条直线。绿点 = 样本中心 (x̄, ȳ)。只有当直线正好压在绿点上时,残差平方和才达到最小 → 这就是「回归直线必过 (x̄, ȳ)」的几何解释。
r 衡量线性相关的强弱和方向,取值范围 −1 ≤ r ≤ 1。
| r 的值 | 含义 |
|---|---|
| r > 0 | 正相关(x 增 y 也增,直线上升) |
| r < 0 | 负相关(x 增 y 减,直线下降) |
| |r| 接近 1 | 线性相关很强(点几乎在一条直线上) |
| |r| 接近 0 | 线性相关很弱(点很散乱) |
| r = ±1 | 所有点严格在一条直线上(完全相关) |
经验:通常 |r| > 0.75 认为线性相关较强。r 的正负号与斜率 b̂ 的正负号一致(分子相同)。
⚠ r 接近 0 只说明「线性」关系弱,可能仍有非线性关系(如抛物线)。相关 ≠ 因果!r 大只表示统计上相关,不代表一个导致另一个。
点云越「细长贴一条线」→ |r| 越接近 1;越「圆滚滚散开」→ |r| 越接近 0。上升为正、下降为负。红线为该组的趋势方向。
很多真实数据不是直线,而是指数型 y=c·e^(bx) 或幂/对数型。直接最小二乘拟合曲线很难,套路是取对数,把曲线掰直,转成线性再用最小二乘。
| 原模型 | 变换 | 变成的线性关系 |
|---|---|---|
| 指数 y = c·e^(bx) | 令 z = ln y | z = bx + ln c(z 对 x 线性) |
| 幂 y = c·xⁿ | 令 z=ln y, w=ln x | z = n·w + ln c |
| 对数 y = a + b·ln x | 令 w = ln x | y = b·w + a |
⚠ 取对数后是对 (x, ln y) 做回归,别忘了最后要 e 的幂换回来。截距 â 是 ln c,c=e^â,不是 â 本身!
同一批数据:左视图 y 随 x 指数式弯曲上翘;点「取对数」后,右视图里 z=ln y 变成一条笔直的线 → 可以用最小二乘拟合了。这就是「非线性化线性」的魔法。
触发信号:给一张 2×2 列联表(或让你先填表),问「是否有关」「有多大把握认为有关」。
标准动作:读出 a、b、c、d 和 n → 代 K²=n(ad−bc)²/[(a+b)(c+d)(a+c)(b+d)] → 与临界值比较下结论。
示例(带解):a=40,b=10,c=15,d=35,n=100。ad−bc=40×35−10×15=1400−150=1250。K²=100×1250²/(50×50×55×45)=100×1562500/6187500≈25.25。25.25>6.635 → 有 99% 把握认为两变量有关。
陷阱:格子填反;分母漏乘一项;把频数当成百分数代入。
触发信号:已算出 K²(或题目直接给),问「能否在某把握下认为有关」。
标准动作:把 K² 和临界值比:>3.841(95%)、>6.635(99%)、>10.828(99.9%)。找出「刚好超过」的那一档就是最高把握。
示例(带解):K²=7.2。7.2>6.635 但 <7.879,故有 99% 把握认为有关(还达不到 99.5%)。若 K²=3.5<3.841 → 没有充分证据认为有关。
陷阱:表述写成「有关的概率是95%」(错,是「有95%的把握」);K²小时说成「一定独立/无关」(应说「证据不足」)。
触发信号:给一组 (xᵢ,yᵢ) 数据,求「回归直线方程 ŷ=b̂x+â」。
标准动作:算 x̄、ȳ → 算 Σ(xᵢ−x̄)(yᵢ−ȳ) 和 Σ(xᵢ−x̄)² → b̂=前者/后者 → â=ȳ−b̂x̄ → 写方程。
示例(带解):x:1,2,3,4,5;y:2,4,5,4,5。x̄=3,ȳ=4。Σ(xᵢ−x̄)(yᵢ−ȳ)=(−2)(−2)+(−1)(0)+0+(1)(0)+(2)(1)=4+0+0+0+2=6。Σ(xᵢ−x̄)²=4+1+0+1+4=10。b̂=6/10=0.6,â=4−0.6×3=2.2。故 ŷ=0.6x+2.2。
陷阱:x̄、ȳ 算错;分母混入 y;â 公式记错;忘了最后写成 ŷ 形式。
触发信号:已有回归方程,问「当 x=某值时,y 的估计/预测值」。
标准动作:把 x 代入 ŷ=b̂x+â 直接算 ŷ。答的是「估计值/预测值」而非精确值。
示例(带解):ŷ=0.6x+2.2,预测 x=6 时 ŷ=0.6×6+2.2=5.8。即估计 y 约为 5.8(是趋势估计,不是准确数)。
陷阱:把 ŷ 当精确值;外推太远(x 远超样本范围时预测不可靠);算术代入错。
触发信号:散点明显弯曲,题目给「y=c·e^(bx)」这类模型,或提示「令 z=ln y」。
标准动作:取对数令 z=ln y → 对 (x,z) 做线性回归得 ẑ=b̂x+â → b=b̂、c=e^â → 回代 ŷ=e^â·e^(b̂x)。
示例(带解):设 y=c·e^(bx),取 z=ln y 得 z=bx+ln c。若线性回归得 ẑ=0.25x+0.5,则 b=0.25,ln c=0.5 → c=e^0.5≈1.65。故 ŷ=1.65·e^(0.25x)。
陷阱:忘了把 â 换算成 c=e^â;对 x 也取对数(指数模型只对 y 取对数);最后不回代还留在 z。
触发信号:给数据或给 r 值,问「相关性强不强、正负、能否用线性回归」。
标准动作:算(或读)r → 看正负定方向 → 看 |r| 接近 1 与否定强弱。|r|>0.75 一般认为线性相关较强,可用线性回归。
示例(带解):r=0.98 → 强正相关,点几乎在上升直线上,适合线性回归。r=−0.2 → 弱负相关,线性关系不明显,直接线性拟合意义不大。
陷阱:把 |r| 大当因果;r≈0 就断言「无任何关系」(可能是非线性);符号看错。
① K² 公式代入:分子 n(ad−bc)²,分母是四个边缘合计相乘 (a+b)(c+d)(a+c)(b+d),一项都不能漏或错位。a,b,c,d 是频数不是比例。
② 回归直线必过样本中心 (x̄, ȳ)。选择题里「回归直线一定经过某点」→ 就是 (x̄,ȳ);求截距用 â=ȳ−b̂x̄ 也是这个道理。
③ 表述:是「有 95% 的把握认为有关」,不是「有关的概率是 95%」,也不是「95% 的样本有关」。
④ ŷ 是估计值/预测值,不是精确值。预测只是趋势估计,x 外推太远不可靠。
⑤ 相关系数 |r| 接近 ±1 才是强相关;接近 0 是弱(线性)相关。r 的符号与斜率 b̂ 同号。
⑥ b̂ 的分母只含 x:Σ(xᵢ−x̄)²,别混进 y。â=ȳ−b̂·x̄,不是 ȳ−b̂。
⑦ K² 大 → 有关;K² 小 → 只能说「证据不足,不能认为有关」,不能说「一定独立/无关」。
⑧ 非线性(指数)只对 y 取对数令 z=ln y;做完回归 c=e^â 要换回来,别留在 z。
⑨ 相关 ≠ 因果:r 大或 K² 大只表示统计相关,不代表一个导致另一个。
① K² 度量的是「偏离独立」的程度: 如果两变量独立,期望频数应满足「行比例=列比例」,即 ad≈bc。K² 本质是把「实际频数」与「独立假设下的期望频数」的差异平方后加权求和。ad−bc 越远离 0,K² 越大,越该否定独立。理解这一层,你就知道为什么 ad=bc 时 K²=0。
② 最小二乘 = 让残差平方和 Q(â,b̂)=Σ(yᵢ−b̂xᵢ−â)² 最小: 对 â、b̂ 分别求偏导置零,就解出那两个公式。由 ∂Q/∂â=0 直接得到「回归直线过 (x̄,ȳ)」;由 ∂Q/∂b̂=0 得到 b̂ 的表达式。所以「过中心」不是巧合,是最优化的必然结果。
③ b̂ 与 r 同源: b̂=Σ(xᵢ−x̄)(yᵢ−ȳ)/Σ(xᵢ−x̄)²,r=同样的分子除以 √[Σ(xᵢ−x̄)²·Σ(yᵢ−ȳ)²]。它们分子相同 → 符号必然一致。还有 b̂=r·(sᵧ/sₓ)(标准差之比)。看懂这个关系,r 与 b̂ 的题就一通百通。
④ 取对数是「把乘法变加法、把指数变线性」: ln(c·e^(bx))=ln c + bx。任何「成倍增长/幂律」的模型,取对数后都塌成直线。选模型时先画散点:直线用线性回归,上翘弯曲用指数(对 y 取 ln),整体缓增用对数(对 x 取 ln)。
⑤ 统计推断的谦逊: 独立性检验给的是「把握程度」而非「真相」;回归给的是「趋势估计」而非「精确预言」。尖子生答题时用词精准——「有 99% 把握认为有关」「预测值约为」——这些措辞本身就是得分点,阅卷老师专挑这里扣分。
thebest2dan · 数学攻坚包 · 独立性检验(判有没有关系)+ 线性回归(找最贴合的直线)