← 回攻坚包
数学 · 攻坚包

独立性检验与线性回归

统计里最爱考的两件事:一是「两个分类变量到底有没有关系」——用一个数 来判(独立性检验);二是「一堆散点最贴合的那条直线是什么」——用最小二乘求回归方程 ŷ=b̂x+â。前者靠公式代入 + 查临界值下结论;后者靠算 x̄、ȳ、b̂、â 四步走。全是套路,套路吃透就是白送分。

🗣️ 说人话总览: 独立性检验 = 用一个数 K² 衡量两个分类变量(比如「性别」和「是否近视」)到底有没有关系。K² 越大 → 越有关系;K² 小 → 没关系(相互独立)。把它跟临界值(3.841、6.635)一比,超过了就说「有把握认为有关」。线性回归 = 给一堆散点找一条最贴合的直线,让所有点到直线的竖直距离平方之和最小(这就是「最小二乘」),这条直线一定穿过样本中心 (x̄, ȳ)
两把核心公式: ① 卡方 K² = n(ad−bc)² / [(a+b)(c+d)(a+c)(b+d)],n=a+b+c+d 为总数;K² > 临界值 → 有关(否定独立)。② 回归 ŷ = b̂x + â,其中 b̂ = Σ(xi−x̄)(yi−ȳ) / Σ(xi−x̄)²,â = ȳ − b̂·x̄。回归直线必过样本中心点 (x̄, ȳ)

① 2×2 列联表:把「有没有关系」摆成一张表

研究两个「分类变量」(每个只有两类,如 患病/健康、吸烟/不吸烟)是否有关,先把频数填成 2×2 表:

类别 y₁类别 y₂合计
类别 x₁aba+b
类别 x₂cdc+d
合计a+cb+dn=a+b+c+d

直觉判断法: 比较两个比例 a/(a+b) 与 c/(c+d)。差得越多,两变量越可能有关;几乎相等 → 可能独立。但直觉不够严谨,要用 K² 定量。

⚠ a、b、c、d 是频数(人数、个数),不是比例、不是百分数!四个格子加起来 = 总样本 n。摆表时行、列的对应关系别放错。

② 卡方 K² 公式与临界值:一个数说了算

K² = n(ad − bc)² / [(a+b)(c+d)(a+c)(b+d)]

分子是 n·(ad−bc)²(对角线乘积之差,平方后必非负);分母是四个「边缘合计」的乘积((a+b)(c+d) 是两行合计,(a+c)(b+d) 是两列合计)。K² ≥ 0,K² 越大 → 两变量关联越强。若 ad=bc,则 K²=0,完全独立。

临界值表(务必记住这两行)

把握程度显著性水平 α临界值 k₀
90%0.102.706
95%0.053.841
99%0.016.635
99.5%0.0057.879
99.9%0.00110.828

下结论的逻辑

若 K² > 3.841 → 有 95% 的把握认为两变量有关(否定「独立」假设)。
若 K² > 6.635 → 有 99% 的把握认为两变量有关。
若 K² ≤ 3.841 → 没有充分证据,不能认为两变量有关。

⚠ K² 是拿来否定「独立」的。K² 大 = 有关;K² 小 ≠ 「一定独立」,只能说「证据不足,不能认为有关」。表述要小心。

🧮 互动 1 — 2×2 列联表填数,实时算 K² 并与临界值比较(变色显示是否相关)
总数 n0
ad−bc0
0
结论

改四个格子的频数,K² 立刻重算。绿=没把握认为有关(K²≤3.841)、橙=95%有关、红=99%有关。试试把 a、d 调大、b、c 调小 → 对角越悬殊 K² 越大。

📊 互动 2 — K² 大小与关联强度:同一张表,把对角差异放大,看 K² 与结论怎么跳
a=d0
b=c0
0
结论

总数固定 n=100,滑块把 a=d 拉大、b=c 拉小(对角越悬殊)。指针在临界值刻度尺上移动:越过 3.841 变橙、越过 6.635 变红。K² 越大 = 关联越强。

③ 线性回归方程:给散点找最贴合的直线

回归方程:ŷ = b̂x + â

ŷ(读作 y-hat)是预测值/估计值,不是真实观测值。b̂ 是斜率(x 每增 1,ŷ 平均变化 b̂),â 是截距。求它俩靠最小二乘法——让所有点到直线的竖直偏差平方和最小

最小二乘公式(背熟)

b̂ = Σ(xi−x̄)(yi−ȳ) / Σ(xi−x̄)²
â = ȳ − b̂·x̄

等价常用式:b̂ = (Σxiyi − n·x̄·ȳ) / (Σxi² − n·x̄²)。算的时候先求 x̄、ȳ,再算分子分母,得 b̂,最后 â=ȳ−b̂x̄。

解题四步走

第1步:算平均 x̄=(Σxᵢ)/n,ȳ=(Σyᵢ)/n。
第2步:算分子 Σ(xᵢ−x̄)(yᵢ−ȳ) 与分母 Σ(xᵢ−x̄)²(列表算最稳)。
第3步:b̂ = 分子/分母,â = ȳ − b̂·x̄。
第4步:写出 ŷ = b̂x + â,并可代入 x 做预测。

⚠ â=ȳ−b̂x̄,不是 ȳ−b̂!分母是 Σ(xᵢ−x̄)²(只含 x),别把 y 也放进分母。ŷ 是估计值,写作带帽子的 ŷ。

📈 互动 3 — 散点 + 回归直线:拖动任意一个点,看最小二乘直线随之移动(始终过中心)
斜率 b̂0
截距 â0
中心 (x̄, ȳ)0
残差平方和0

红点可拖动。蓝线=最小二乘回归直线,黄虚线=每个点到直线的竖直偏差(残差)。拖动任一点,直线立刻重算,而且永远穿过绿色的样本中心 (x̄, ȳ)

🎯 互动 4 — 回归直线必过样本中心 (x̄, ȳ):平移直线试试,只有过中心时残差和才最小
直线是否过中心
当前残差平方和0
最小残差平方和0
偏离0

保持斜率不变,上下平移这条直线。绿点 = 样本中心 (x̄, ȳ)。只有当直线正好压在绿点上时,残差平方和才达到最小 → 这就是「回归直线必过 (x̄, ȳ)」的几何解释。

④ 相关系数 r:线性关系强不强

r = Σ(xi−x̄)(yi−ȳ) / √[Σ(xi−x̄)²·Σ(yi−ȳ)²]

r 衡量线性相关的强弱和方向,取值范围 −1 ≤ r ≤ 1

r 的值含义
r > 0正相关(x 增 y 也增,直线上升)
r < 0负相关(x 增 y 减,直线下降)
|r| 接近 1线性相关很强(点几乎在一条直线上)
|r| 接近 0线性相关很弱(点很散乱)
r = ±1所有点严格在一条直线上(完全相关)

经验:通常 |r| > 0.75 认为线性相关较强。r 的正负号与斜率 b̂ 的正负号一致(分子相同)。

⚠ r 接近 0 只说明「线性」关系弱,可能仍有非线性关系(如抛物线)。相关 ≠ 因果!r 大只表示统计上相关,不代表一个导致另一个。

🔀 互动 5 — 相关系数 r 的不同取值:对比六组散点,直观感受 r 从 −1 到 +1

点云越「细长贴一条线」→ |r| 越接近 1;越「圆滚滚散开」→ |r| 越接近 0。上升为正、下降为负。红线为该组的趋势方向。

⑤ 非线性回归:取对数变直线

很多真实数据不是直线,而是指数型 y=c·e^(bx)幂/对数型。直接最小二乘拟合曲线很难,套路是取对数,把曲线掰直,转成线性再用最小二乘。

原模型变换变成的线性关系
指数 y = c·e^(bx)令 z = ln yz = bx + ln c(z 对 x 线性)
幂 y = c·xⁿ令 z=ln y, w=ln xz = n·w + ln c
对数 y = a + b·ln x令 w = ln xy = b·w + a

指数模型的完整套路

① 令 z=ln y,对 (x, z) 做线性回归 ẑ = b̂x + â。
② 对照 z=bx+ln c:斜率 b̂ 就是 b,截距 â=ln c → c=e^â。
③ 回代:ŷ = e^â · e^(b̂x)。

⚠ 取对数后是对 (x, ln y) 做回归,别忘了最后要 e 的幂换回来。截距 â 是 ln c,c=e^â,不是 â 本身!

🪄 互动 6 — 非线性取对数变直线:左边弯曲的 y-x,右边取 ln y 后变成一条直线

同一批数据:左视图 y 随 x 指数式弯曲上翘;点「取对数」后,右视图里 z=ln y 变成一条笔直的线 → 可以用最小二乘拟合了。这就是「非线性化线性」的魔法。

⑥ 全题型地图

题型A — 列联表求 K² 判断相关

触发信号:给一张 2×2 列联表(或让你先填表),问「是否有关」「有多大把握认为有关」。

标准动作:读出 a、b、c、d 和 n → 代 K²=n(ad−bc)²/[(a+b)(c+d)(a+c)(b+d)] → 与临界值比较下结论。

示例(带解):a=40,b=10,c=15,d=35,n=100。ad−bc=40×35−10×15=1400−150=1250。K²=100×1250²/(50×50×55×45)=100×1562500/6187500≈25.25。25.25>6.635 → 有 99% 把握认为两变量有关。

陷阱:格子填反;分母漏乘一项;把频数当成百分数代入。

题型B — 查临界值下结论

触发信号:已算出 K²(或题目直接给),问「能否在某把握下认为有关」。

标准动作:把 K² 和临界值比:>3.841(95%)、>6.635(99%)、>10.828(99.9%)。找出「刚好超过」的那一档就是最高把握。

示例(带解):K²=7.2。7.2>6.635 但 <7.879,故有 99% 把握认为有关(还达不到 99.5%)。若 K²=3.5<3.841 → 没有充分证据认为有关。

陷阱:表述写成「有关的概率是95%」(错,是「有95%的把握」);K²小时说成「一定独立/无关」(应说「证据不足」)。

题型C — 求线性回归方程

触发信号:给一组 (xᵢ,yᵢ) 数据,求「回归直线方程 ŷ=b̂x+â」。

标准动作:算 x̄、ȳ → 算 Σ(xᵢ−x̄)(yᵢ−ȳ) 和 Σ(xᵢ−x̄)² → b̂=前者/后者 → â=ȳ−b̂x̄ → 写方程。

示例(带解):x:1,2,3,4,5;y:2,4,5,4,5。x̄=3,ȳ=4。Σ(xᵢ−x̄)(yᵢ−ȳ)=(−2)(−2)+(−1)(0)+0+(1)(0)+(2)(1)=4+0+0+0+2=6。Σ(xᵢ−x̄)²=4+1+0+1+4=10。b̂=6/10=0.6,â=4−0.6×3=2.2。故 ŷ=0.6x+2.2。

陷阱:x̄、ȳ 算错;分母混入 y;â 公式记错;忘了最后写成 ŷ 形式。

题型D — 用回归方程预测

触发信号:已有回归方程,问「当 x=某值时,y 的估计/预测值」。

标准动作:把 x 代入 ŷ=b̂x+â 直接算 ŷ。答的是「估计值/预测值」而非精确值。

示例(带解):ŷ=0.6x+2.2,预测 x=6 时 ŷ=0.6×6+2.2=5.8。即估计 y 约为 5.8(是趋势估计,不是准确数)。

陷阱:把 ŷ 当精确值;外推太远(x 远超样本范围时预测不可靠);算术代入错。

题型E — 非线性回归转化

触发信号:散点明显弯曲,题目给「y=c·e^(bx)」这类模型,或提示「令 z=ln y」。

标准动作:取对数令 z=ln y → 对 (x,z) 做线性回归得 ẑ=b̂x+â → b=b̂、c=e^â → 回代 ŷ=e^â·e^(b̂x)。

示例(带解):设 y=c·e^(bx),取 z=ln y 得 z=bx+ln c。若线性回归得 ẑ=0.25x+0.5,则 b=0.25,ln c=0.5 → c=e^0.5≈1.65。故 ŷ=1.65·e^(0.25x)。

陷阱:忘了把 â 换算成 c=e^â;对 x 也取对数(指数模型只对 y 取对数);最后不回代还留在 z。

题型F — 相关系数判断相关强弱

触发信号:给数据或给 r 值,问「相关性强不强、正负、能否用线性回归」。

标准动作:算(或读)r → 看正负定方向 → 看 |r| 接近 1 与否定强弱。|r|>0.75 一般认为线性相关较强,可用线性回归。

示例(带解):r=0.98 → 强正相关,点几乎在上升直线上,适合线性回归。r=−0.2 → 弱负相关,线性关系不明显,直接线性拟合意义不大。

陷阱:把 |r| 大当因果;r≈0 就断言「无任何关系」(可能是非线性);符号看错。

⑦ 易错集

① K² 公式代入:分子 n(ad−bc)²,分母是四个边缘合计相乘 (a+b)(c+d)(a+c)(b+d),一项都不能漏或错位。a,b,c,d 是频数不是比例。

② 回归直线必过样本中心 (x̄, ȳ)。选择题里「回归直线一定经过某点」→ 就是 (x̄,ȳ);求截距用 â=ȳ−b̂x̄ 也是这个道理。

③ 表述:是「有 95% 的把握认为有关」,不是「有关的概率是 95%」,也不是「95% 的样本有关」。

④ ŷ 是估计值/预测值,不是精确值。预测只是趋势估计,x 外推太远不可靠。

⑤ 相关系数 |r| 接近 ±1 才是强相关;接近 0 是弱(线性)相关。r 的符号与斜率 b̂ 同号。

⑥ b̂ 的分母只含 x:Σ(xᵢ−x̄)²,别混进 y。â=ȳ−b̂·x̄,不是 ȳ−b̂。

⑦ K² 大 → 有关;K² 小 → 只能说「证据不足,不能认为有关」,不能说「一定独立/无关」。

⑧ 非线性(指数)只对 y 取对数令 z=ln y;做完回归 c=e^â 要换回来,别留在 z。

⑨ 相关 ≠ 因果:r 大或 K² 大只表示统计相关,不代表一个导致另一个。

⑧ 尖子生拔高视角

① K² 度量的是「偏离独立」的程度: 如果两变量独立,期望频数应满足「行比例=列比例」,即 ad≈bc。K² 本质是把「实际频数」与「独立假设下的期望频数」的差异平方后加权求和。ad−bc 越远离 0,K² 越大,越该否定独立。理解这一层,你就知道为什么 ad=bc 时 K²=0。

② 最小二乘 = 让残差平方和 Q(â,b̂)=Σ(yᵢ−b̂xᵢ−â)² 最小: 对 â、b̂ 分别求偏导置零,就解出那两个公式。由 ∂Q/∂â=0 直接得到「回归直线过 (x̄,ȳ)」;由 ∂Q/∂b̂=0 得到 b̂ 的表达式。所以「过中心」不是巧合,是最优化的必然结果。

③ b̂ 与 r 同源: b̂=Σ(xᵢ−x̄)(yᵢ−ȳ)/Σ(xᵢ−x̄)²,r=同样的分子除以 √[Σ(xᵢ−x̄)²·Σ(yᵢ−ȳ)²]。它们分子相同 → 符号必然一致。还有 b̂=r·(sᵧ/sₓ)(标准差之比)。看懂这个关系,r 与 b̂ 的题就一通百通。

④ 取对数是「把乘法变加法、把指数变线性」: ln(c·e^(bx))=ln c + bx。任何「成倍增长/幂律」的模型,取对数后都塌成直线。选模型时先画散点:直线用线性回归,上翘弯曲用指数(对 y 取 ln),整体缓增用对数(对 x 取 ln)。

⑤ 统计推断的谦逊: 独立性检验给的是「把握程度」而非「真相」;回归给的是「趋势估计」而非「精确预言」。尖子生答题时用词精准——「有 99% 把握认为有关」「预测值约为」——这些措辞本身就是得分点,阅卷老师专挑这里扣分。

⑨ 自测(先想,再点开)

thebest2dan · 数学攻坚包 · 独立性检验(判有没有关系)+ 线性回归(找最贴合的直线)