高考里最「稳」的送分板块:公式固定、套路清晰、几乎不需要巧思,却每年必考一道大题。这一页把抽样、频率分布直方图、样本数字特征、线性回归、独立性检验讲成人话,再用动画让你「看见」方差怎么衡量离散、回归直线怎么过样本中心、χ² 怎么判断关联。把公式记牢、步骤走全,这道题就是白送的分。
抽样的目标是「有代表性」。三种方法各有适用场景,考点集中在分层抽样按比例。切换方法,看它们从总体里抽样本的方式有何不同。
| 方法 | 怎么抽 | 适用场景 | 关键点 |
|---|---|---|---|
| 简单随机抽样 | 抽签 / 随机数表,逐个等可能抽取 | 总体数量少、个体差异不大 | 每个个体被抽概率相等 |
| 系统抽样 | 先分段(间隔 k=N/n),每段固定位置抽一个 | 总体数量大、排列有序 | 间隔 k = 总体N / 样本n(取整) |
| 分层抽样 | 先按特征分层,各层按比例抽取 | 总体由差异明显的几层组成 | 各层抽样比 = 样本n / 总体N(全体统一) |
分层抽样只有一个道理:大层多抽、小层少抽,按人头比例分配。拖动样本总量 n,看每一层各该抽几个,以及那条「所有层共用」的抽样比。
总体:高一 300 人、高二 200 人、高三 100 人,共 N=600。各层柱高 ∝ 人数,数字 = 该层应抽人数 = 层人数 × (n / N)。
直方图是统计大题的第一号常客。它把数据分成若干组,纵轴是「频率 / 组距」而不是频率本身——这是最高频的坑。每个矩形的面积 = 频率,所有矩形面积之和 = 1。
组距均为 10。拖动滑块改变第 3 组的高度,系统自动调整第 4 组使「所有频率之和 = 1」,并实时估计平均数、中位数、众数。
数字特征分两类:反映「集中位置」的(平均数、中位数、众数),和反映「离散/稳定程度」的(方差、标准差)。方差越小,数据越集中、越稳定。
| 量 | 公式 / 定义 | 反映什么 | 抗极端值? |
|---|---|---|---|
| 平均数 x̄ | x̄ = (1/n)∑xᵢ = (x₁+x₂+…+xₙ)/n | 数据的平均水平 | 不抗(易被极端值拉动) |
| 中位数 | 排序后正中间的数(偶数个取中间两数平均) | 数据的中间位置 | 抗(极端值不影响) |
| 众数 | 出现次数最多的数 | 最常见的取值 | 抗 |
| 方差 s² | s² = (1/n)∑(xᵢ − x̄)² | 离散程度 / 波动大小 | 不抗 |
| 标准差 s | s = √(s²)(方差开平方,与数据同单位) | 离散程度(同量纲) | 不抗 |
方差是「离散程度」的度量。两组数据平均数可能相同,但一组集中、一组分散——方差小的更稳定。这在「选谁参赛」「哪台机器更可靠」的应用题里几乎必考。拖动「离散程度」,看方差怎么随数据散开而变大。
两组数据平均数都是 60(黑色虚线)。乙组固定较分散;拖动滑块改变甲组的散开程度。方差 = (1/n)∑(xᵢ−x̄)²,点离均值线越远、贡献越大。
当两个变量看起来「大致成直线关系」,就用最小二乘法拟合一条回归直线 ŷ = b̂x + â,用来预测。这条直线有一条铁律:必过样本中心点 (x̄, ȳ)。
在图上点击可加点。绿线 = 回归直线 ŷ=b̂x+â,橙点 = 样本中心 (x̄,ȳ)——回归线永远穿过它。加点后 b̂、â、r 实时重算。
「全班分数每人加 5 分」「单位从米换成厘米」——这些都是 xᵢ → axᵢ + b。用动画直观感受:平移 b 只挪动位置(方差不变),缩放 a 才拉伸离散(方差 ×a²)。
灰点 = 原始数据(均值 x̄₀,方差 s₀²)。蓝点 = 变换后 axᵢ+b。观察:改 b 时蓝点整体平移、方差读数不变;改 a 时数据被拉伸、方差按 a² 变化。
想判断「两个分类变量(如『吸烟』与『患病』)是否有关系」,用独立性检验。做一张 2×2 列联表,算出统计量 χ²(教材记作 K²),再和临界值比较:χ² 越大,越有理由认为两者有关联。
χ² = n(ad−bc)² / [(a+b)(c+d)(a+c)(b+d)],其中 n=a+b+c+d。拖动四个格子的人数,系统实时算 χ² 并与常用临界值(3.841 / 6.635 / 10.828)比较给出结论。
| 2×2 列联表 | 喜欢 | 不喜欢 | 合计 |
|---|---|---|---|
| 男 | a | b | a+b |
| 女 | c | d | c+d |
| 合计 | a+c | b+d | n=a+b+c+d |
χ² = n(ad − bc)² / [(a+b)(c+d)(a+c)(b+d)]
| 临界值表(常用) | α=0.05 | α=0.01 | α=0.001 |
|---|---|---|---|
| χ² 临界值 xα | 3.841 | 6.635 | 10.828 |
| 结论(若 χ² > 临界值) | 有 95% 把握有关 | 有 99% 把握有关 | 有 99.9% 把握有关 |
统计的终极目的是「用样本估计总体」:样本的平均数、方差、频率,分别是总体对应量的估计值。当数据近似「中间多、两边少」的钟形对称分布时,就是正态分布 N(μ, σ²)。
| 题型 | 触发信号 | 标准动作 |
|---|---|---|
| 分层抽样 | 「按比例」「各层抽多少」「分层」 | 算抽样比 n/N → 各层人数 × (n/N) |
| 直方图求特征 | 给出直方图,求频率/频数/平均/中位 | 面积=频率、频率之和=1 补缺项 → 组中值加权算特征 |
| 方差比较 | 「谁更稳定/整齐」「选谁参赛」 | 先算 x̄,再算 s²=(1/n)∑(xᵢ−x̄)²,方差小者更稳 |
| 回归方程与预测 | 「求回归直线」「预测 x=… 时的 y」 | 算 x̄,ȳ → b̂,â → 代 x 预测 |
| 独立性检验 | 「是否有关」「有多大把握」「列联表」 | 补全表格 → χ² 公式 → 比临界值下结论 |
⚠ ① 分层抽样按比例:所有层共用同一个抽样比 n/N,某层抽 = 层人数 × (n/N),不是每层各定一个比。
⚠ ② 直方图纵轴是「频率/组距」,不是频率!频率 = 高 × 组距,频数 = 频率 × 样本容量。所有矩形面积之和 = 1(不是高之和)。
⚠ ③ 方差衡量稳定性/波动,不是衡量水平高低。比稳定先看平均数是否相同,再用方差;方差小 = 更稳定/整齐。
⚠ ④ 回归直线必过样本中心点 (x̄, ȳ)。截距用 â = ȳ − b̂x̄ 求;算错 x̄ 或 ȳ 会连累整条直线。
⚠ ⑤ χ² 越大,关联越强(把握越大)。χ² 与临界值比较:大于才能下「有关」结论;χ² 小不代表「无关」,只是「证据不足」。
⚠ ⑥ 数据变换:xᵢ→axᵢ+b,均值 → ax̄+b,方差 → a²s²(加常数 b 不改方差!)。这是最爱考的细节。
⚠ ⑦ 相关系数 r 的符号 = 斜率 b̂ 的符号;|r| 大只说明线性强,不代表因果。r 接近 0 只是「线性不强」,可能有非线性关系。
① 平均数被极端值「绑架」,中位数不会: 收入、房价这类右偏数据,平均数远高于中位数。看到「有极端值/长尾」优先想到用中位数描述「一般水平」——这也是新高考情境题爱设的辨析点。
② 方差的两个等价算法: s² = (1/n)∑(xᵢ−x̄)² = (1/n)∑xᵢ² − x̄²(「平方的均值 − 均值的平方」)。数据多时后者更快;还可先减去一个公共常数(平移不改方差)简化计算。
③ 回归的本质是「最小化残差平方和」: b̂、â 让 ∑(yᵢ−ŷᵢ)² 最小。相关系数 r² 表示 y 的变异中被 x「解释」的比例;r 只说线性强弱,相关 ≠ 因果,别被情境题带偏。
④ 独立性检验是「反证法」的统计版: 先假设「无关」(H₀),若在此假设下出现当前数据的概率极小(χ² 超临界值),就推翻假设。所谓「有 99% 把握」= 犯错概率(显著性水平 α)只有 1%。
⑤ 正态分布的对称性 + 3σ 是选填秒杀器: 已知 μ 和某段概率,用对称 P(X<μ)=0.5 与「区间对称相减」两步即可求任意区间概率,不必查表硬算。σ 越大曲线越「矮胖」(数据越分散)。
thebest2dan · 数学统计攻坚包 · 下一块:概率与随机变量 / 立体几何向量法