← 回攻坚包
数学 · 统计攻坚包

统计(抽样 · 数字特征 · 回归与独立性检验)

高考里最「稳」的送分板块:公式固定、套路清晰、几乎不需要巧思,却每年必考一道大题。这一页把抽样、频率分布直方图、样本数字特征、线性回归、独立性检验讲成人话,再用动画让你「看见」方差怎么衡量离散、回归直线怎么过样本中心、χ² 怎么判断关联。把公式记牢、步骤走全,这道题就是白送的分。

🗣️ 一句话总览: 统计做的事只有一件——用一小撮样本去猜整个总体。① 先想办法把样本抽得「有代表性」(抽样方法);② 把样本的分布画出来、算出来(直方图、平均数 x̄、方差 s²);③ 再用样本去估计总体、找变量间的关系(回归、独立性检验)。
🗣️ 大题的套路只有一句: 照公式一步步代数字,过程分给全,答案对不对反而是次要——步骤全 = 分全

一、三种抽样方法:简单随机 · 系统 · 分层

抽样的目标是「有代表性」。三种方法各有适用场景,考点集中在分层抽样按比例。切换方法,看它们从总体里抽样本的方式有何不同。

方法怎么抽适用场景关键点
简单随机抽样抽签 / 随机数表,逐个等可能抽取总体数量少、个体差异不大每个个体被抽概率相等
系统抽样先分段(间隔 k=N/n),每段固定位置抽一个总体数量大、排列有序间隔 k = 总体N / 样本n(取整)
分层抽样先按特征分层,各层按比例抽取总体由差异明显的几层组成各层抽样比 = 样本n / 总体N(全体统一)
分层抽样核心公式(必考): 抽样比 = 样本容量 n / 总体容量 N(所有层共用同一个比)。
某层应抽人数 = 该层总人数 × (n / N)。
👉 换句话说:某层抽的人数 / 该层总人数 = n / N,对每一层都成立。

二、分层抽样:比例计算器

分层抽样只有一个道理:大层多抽、小层少抽,按人头比例分配。拖动样本总量 n,看每一层各该抽几个,以及那条「所有层共用」的抽样比。

总体:高一 300 人、高二 200 人、高三 100 人,共 N=600。各层柱高 ∝ 人数,数字 = 该层应抽人数 = 层人数 × (n / N)。

三、频率分布直方图:把样本「画」出来

直方图是统计大题的第一号常客。它把数据分成若干组,纵轴是「频率 / 组距」而不是频率本身——这是最高频的坑。每个矩形的面积 = 频率,所有矩形面积之和 = 1。

平均数 x̄(估计)
中位数(估计)
众数(估计)

组距均为 10。拖动滑块改变第 3 组的高度,系统自动调整第 4 组使「所有频率之和 = 1」,并实时估计平均数、中位数、众数。

直方图三件套(务必背):
纵轴 = 频率 / 组距,所以每个矩形面积 = (频率/组距) × 组距 = 频率;所有面积之和 = 1
频数 = 频率 × 样本容量;某组频率 = (频率/组距) × 组距。
众数 = 最高矩形的组中值;平均数 ≈ ∑(组中值 × 频率);中位数 = 面积累加到 0.5 处对应的横坐标(用比例插值算)。

四、样本数字特征:x̄ · 中位数 · 众数 · 方差 s²

数字特征分两类:反映「集中位置」的(平均数、中位数、众数),和反映「离散/稳定程度」的(方差、标准差)。方差越小,数据越集中、越稳定。

公式 / 定义反映什么抗极端值?
平均数 x̄x̄ = (1/n)∑xᵢ = (x₁+x₂+…+xₙ)/n数据的平均水平不抗(易被极端值拉动)
中位数排序后正中间的数(偶数个取中间两数平均)数据的中间位置抗(极端值不影响)
众数出现次数最多的数最常见的取值
方差 s²s² = (1/n)∑(xᵢ − x̄)²离散程度 / 波动大小不抗
标准差 ss = √(s²)(方差开平方,与数据同单位)离散程度(同量纲)不抗
数据变换公式(高频考点): 若每个数据都做变换 xᵢ → axᵢ + b,则:
• 新平均数 = a·x̄ + b(平移 + 缩放都影响均值);
• 新方差 = a²·s²(只有缩放 a 影响方差,平移 b 不改变方差!);
• 新标准差 = |a|·s
👉 一句话:加常数不改变方差,乘常数方差乘平方

五、方差 / 标准差:两组数据谁更稳?

方差是「离散程度」的度量。两组数据平均数可能相同,但一组集中、一组分散——方差小的更稳定。这在「选谁参赛」「哪台机器更可靠」的应用题里几乎必考。拖动「离散程度」,看方差怎么随数据散开而变大。

两组数据平均数都是 60(黑色虚线)。乙组固定较分散;拖动滑块改变甲组的散开程度。方差 = (1/n)∑(xᵢ−x̄)²,点离均值线越远、贡献越大。

六、线性回归:散点 · 相关系数 r · 最小二乘直线

当两个变量看起来「大致成直线关系」,就用最小二乘法拟合一条回归直线 ŷ = b̂x + â,用来预测。这条直线有一条铁律:必过样本中心点 (x̄, ȳ)

斜率 b̂
截距 â
相关系数 r

在图上点击可加点。绿线 = 回归直线 ŷ=b̂x+â,橙点 = 样本中心 (x̄,ȳ)——回归线永远穿过它。加点后 b̂、â、r 实时重算。

回归直线公式(会代入即可):
• 斜率 b̂ = ∑(xᵢ−x̄)(yᵢ−ȳ) / ∑(xᵢ−x̄)²;截距 â = ȳ − b̂·x̄(由「过中心点」直接推出)。
• 相关系数 r = ∑(xᵢ−x̄)(yᵢ−ȳ) / √(∑(xᵢ−x̄)²·∑(yᵢ−ȳ)²),r∈[−1,1]。|r| 越接近 1 线性越强,r>0 正相关、r<0 负相关。
• 预测:把 x 值代入 ŷ=b̂x+â 得预测值(注意是「估计」而非精确值)。

七、数据变换对均值/方差的影响

「全班分数每人加 5 分」「单位从米换成厘米」——这些都是 xᵢ → axᵢ + b。用动画直观感受:平移 b 只挪动位置(方差不变),缩放 a 才拉伸离散(方差 ×a²)

灰点 = 原始数据(均值 x̄₀,方差 s₀²)。蓝点 = 变换后 axᵢ+b。观察:改 b 时蓝点整体平移、方差读数不变;改 a 时数据被拉伸、方差按 a² 变化。

八、独立性检验:2×2 列联表与 χ²

想判断「两个分类变量(如『吸烟』与『患病』)是否有关系」,用独立性检验。做一张 2×2 列联表,算出统计量 χ²(教材记作 K²),再和临界值比较:χ² 越大,越有理由认为两者有关联

χ² = n(ad−bc)² / [(a+b)(c+d)(a+c)(b+d)],其中 n=a+b+c+d。拖动四个格子的人数,系统实时算 χ² 并与常用临界值(3.841 / 6.635 / 10.828)比较给出结论。

2×2 列联表喜欢不喜欢合计
aba+b
cdc+d
合计a+cb+dn=a+b+c+d

χ² = n(ad − bc)² / [(a+b)(c+d)(a+c)(b+d)]

临界值表(常用)α=0.05α=0.01α=0.001
χ² 临界值 xα3.8416.63510.828
结论(若 χ² > 临界值)有 95% 把握有关有 99% 把握有关有 99.9% 把握有关
独立性检验四步走: ① 列出 2×2 列联表(算好各行列合计);② 提出假设 H₀:两变量无关;③ 代公式算 χ²;④ 与临界值比:χ² > 临界值 → 推翻 H₀,认为有关(把握 = 1−α);χ² ≤ 临界值 → 没有充分证据说有关。

九、用样本估计总体 · 正态分布简介(3σ)

统计的终极目的是「用样本估计总体」:样本的平均数、方差、频率,分别是总体对应量的估计值。当数据近似「中间多、两边少」的钟形对称分布时,就是正态分布 N(μ, σ²)

正态分布 3σ 原则(记结论即可): 若 X ~ N(μ, σ²),则:
• P(μ−σ < X ≤ μ+σ) ≈ 0.6827;
• P(μ−2σ < X ≤ μ+2σ) ≈ 0.9545;
• P(μ−3σ < X ≤ μ+3σ) ≈ 0.9973
曲线关于 x=μ 对称,μ 决定位置、σ 决定「胖瘦」(σ 越大越矮胖、越分散)。对称性 P(X<μ)=P(X>μ)=0.5 是选填题的秒杀武器。

十、全题型地图(触发信号 → 标准动作 → 陷阱)

题型触发信号标准动作
分层抽样「按比例」「各层抽多少」「分层」算抽样比 n/N → 各层人数 × (n/N)
直方图求特征给出直方图,求频率/频数/平均/中位面积=频率、频率之和=1 补缺项 → 组中值加权算特征
方差比较「谁更稳定/整齐」「选谁参赛」先算 x̄,再算 s²=(1/n)∑(xᵢ−x̄)²,方差小者更稳
回归方程与预测「求回归直线」「预测 x=… 时的 y」算 x̄,ȳ → b̂,â → 代 x 预测
独立性检验「是否有关」「有多大把握」「列联表」补全表格 → χ² 公式 → 比临界值下结论

题型精讲(带解例题 + 陷阱)

① 分层抽样: 某校高一 400、高二 300、高三 300 人,共 1000 人,用分层抽样抽 50 人,各年级抽几人?
抽样比 = 50/1000 = 1/20。高一 400×1/20=20,高二 300×1/20=15,高三 300×1/20=15(合计 50 ✓)。⚠ 陷阱:抽样比对所有层是同一个 n/N,不要每层重算不同的比。
② 直方图求特征: 五组频率/组距为 0.010, 0.020, 0.030, 0.028, 0.012,组距均 10,求缺项与平均数。
先验:(0.010+0.020+0.030+0.028+0.012)×10 = 1.00 ✓(若缺一项则用「和为1」补)。组中值 5,15,25,35,45。
x̄ ≈ 5×0.1+15×0.2+25×0.3+35×0.28+45×0.12 = 0.5+3+7.5+9.8+5.4 = 26.2⚠ 纵轴是频率/组距,频率 = 高 × 组距,别把高直接当频率。
③ 方差比较: 甲射击环数 7,8,8,9,8;乙 5,8,9,10,8。谁更稳定?
x̄甲 = 40/5 = 8,x̄乙 = 40/5 = 8(平均相同)。
s²甲 = (1+0+0+1+0)/5 = 0.4;s²乙 = (9+0+1+4+0)/5 = 2.8。
s²甲 < s²乙 → 甲更稳定⚠ 先比平均数,平均相同时才用方差比稳定性;方差衡量的是波动,不是水平高低。
④ 回归方程与预测: 数据 (x,y):(1,2),(2,3),(3,5),(4,6),(5,9)。求回归直线并预测 x=6。
x̄=3,ȳ=5。∑(xᵢ−x̄)(yᵢ−ȳ)=(−2)(−3)+(−1)(−2)+0+(1)(1)+(2)(4)=6+2+0+1+8=17。∑(xᵢ−x̄)²=4+1+0+1+4=10。
b̂=17/10=1.7,â=ȳ−b̂x̄=5−1.7×3=−0.1。ŷ=1.7x−0.1。x=6 时 ŷ=1.7×6−0.1=10.1⚠ â 用「过中心点」推:â=ȳ−b̂x̄,别死记另一个繁公式;预测值是估计,不是确定值。
⑤ 独立性检验: 列联表 a=40,b=10,c=20,d=30,n=100,判断「性别」与「喜欢」是否有关。
χ² = 100×(40×30−10×20)² / (50×50×60×40) = 100×(1200−200)² / 6000000 = 100×1000000/6000000 = 16.67
16.67 > 10.828 → 有 99.9% 的把握认为两者有关⚠ 分母是四个「边缘合计」相乘 (a+b)(c+d)(a+c)(b+d),别漏项或用错行列合计。

十一、易错集

⚠ ① 分层抽样按比例:所有层共用同一个抽样比 n/N,某层抽 = 层人数 × (n/N),不是每层各定一个比。

⚠ ② 直方图纵轴是「频率/组距」,不是频率!频率 = 高 × 组距,频数 = 频率 × 样本容量。所有矩形面积之和 = 1(不是高之和)。

⚠ ③ 方差衡量稳定性/波动,不是衡量水平高低。比稳定先看平均数是否相同,再用方差;方差小 = 更稳定/整齐。

⚠ ④ 回归直线必过样本中心点 (x̄, ȳ)。截距用 â = ȳ − b̂x̄ 求;算错 x̄ 或 ȳ 会连累整条直线。

⚠ ⑤ χ² 越大,关联越强(把握越大)。χ² 与临界值比较:大于才能下「有关」结论;χ² 小不代表「无关」,只是「证据不足」。

⚠ ⑥ 数据变换:xᵢ→axᵢ+b,均值 → ax̄+b,方差 → a²s²(加常数 b 不改方差!)。这是最爱考的细节。

⚠ ⑦ 相关系数 r 的符号 = 斜率 b̂ 的符号;|r| 大只说明线性强,不代表因果。r 接近 0 只是「线性不强」,可能有非线性关系。

十二、尖子生拔高视角

① 平均数被极端值「绑架」,中位数不会: 收入、房价这类右偏数据,平均数远高于中位数。看到「有极端值/长尾」优先想到用中位数描述「一般水平」——这也是新高考情境题爱设的辨析点。

② 方差的两个等价算法: s² = (1/n)∑(xᵢ−x̄)² = (1/n)∑xᵢ² − x̄²(「平方的均值 − 均值的平方」)。数据多时后者更快;还可先减去一个公共常数(平移不改方差)简化计算。

③ 回归的本质是「最小化残差平方和」: b̂、â 让 ∑(yᵢ−ŷᵢ)² 最小。相关系数 r² 表示 y 的变异中被 x「解释」的比例;r 只说线性强弱,相关 ≠ 因果,别被情境题带偏。

④ 独立性检验是「反证法」的统计版: 先假设「无关」(H₀),若在此假设下出现当前数据的概率极小(χ² 超临界值),就推翻假设。所谓「有 99% 把握」= 犯错概率(显著性水平 α)只有 1%。

⑤ 正态分布的对称性 + 3σ 是选填秒杀器: 已知 μ 和某段概率,用对称 P(X<μ)=0.5 与「区间对称相减」两步即可求任意区间概率,不必查表硬算。σ 越大曲线越「矮胖」(数据越分散)。

十三、自测(先想,再点开)

thebest2dan · 数学统计攻坚包 · 下一块:概率与随机变量 / 立体几何向量法