第2章 集中趋势:中间道路
按O'Reilly权威目录重建,覆盖算术均值、加权均值、中位数、众数、离群点影响。
先做预测
先预测样本量翻倍、极端值出现或随机机制改变时,图形、估计与结论会怎样变化。均值、中位数和众数回答不同的“典型值”问题。均值使用全部数值但受离群点影响,中位数只依赖顺序而稳健,众数适用于分类数据。选择中心指标必须结合分布形状和决策损失。 本章以、、、、建立从数据到证据的链条。
原书章节定位
本页一一对应O'Reilly原书“第2章 集中趋势:中间道路”。均值、中位数和众数回答不同的“典型值”问题。均值使用全部数值但受离群点影响,中位数只依赖顺序而稳健,众数适用于分类数据。选择中心指标必须结合分布形状和决策损失。 原书的故事负责建立直觉;本页进一步要求写出总体、样本、参数和统计量,并用公式、代码与反例验收直觉。
核心单元
- 算术均值:所有观测总和除以数量,也是平方误差损失下的最佳常数预测。
- 加权均值:频数或重要度作为权重时,用加权总和除以权重总和。
- 中位数:排序后位于中间的值,最小化绝对误差并对极端值更稳健。
- 众数:出现频数最高的取值,可有多个或不存在,适合分类变量。
- 离群点影响:极端值能显著拉动均值,却通常不改变大多数样本的次序位置。
从问题开始
先写五个可反驳问题:算术均值描述谁,加权均值如何改变表示,中位数依赖什么随机机制,众数在哪些边界失效,离群点影响留下什么验收证据。统计计算只有在总体、观察单位、时间窗和缺失规则明确后才有意义。所有观测总和除以数量,也是平方误差损失下的最佳常数预测。 频数或重要度作为权重时,用加权总和除以权重总和。 两者若来自不同总体,任何后续公式都失去解释。
数据契约D把样本的来源固定下来。接着用中位数表达结构,并由众数标记前提。离群点影响必须能由另一位读者在同一数据版本上重算。不能先看结果再改变分组、尾部方向或排除条件。
反例与敏感性
正常样例应覆盖原书中心场景,边界样例至少包括空组、单样本、极端值、概率接近零或一、强相关与分布偏斜。再以“把“平均”默认写成算术均值,没有说明离群点、偏态和业务损失。”构造反例,记录第一个失效的假设。薪资报告若只给均值,少量高薪会掩盖典型员工处境。应并列中位数、分位数和样本构成;若决策关心总成本,均值仍有意义。指标不是互相替代,而是回答不同问题。
误差可能来自抽样波动、选择偏差、测量误差、模型偏差和浮点实现。增加样本通常只降低抽样波动,不能修复抽样框缺失或错误模型。敏感性分析要分别改变分组、异常值规则和模型假设,观察结论方向与区间是否稳定。
验收证书
证书包括原始计数、算术均值定义、加权均值变换、中位数计算、众数边界和离群点影响结论。每个百分比都能回到分子分母,每个图都标明尺度和样本量,每个检验都给效应与区间,每个随机过程都记录种子。
预算在看数据前定义。未通过时要区分数据不足、模型不适用、效果不足和实现错误;“未显著”不能笼统翻译为“没有差异”。
可核查推导
把每个数据都增加常数c,总和增加nc,所以均值也增加c;把每个数据乘a,均值乘a。中位数在单调变换下保持次序。两种中心对变换都可预测,但对极端污染的敏感度不同。 每一步都要注明使用定义、独立性、分布假设还是渐近近似;若只在大样本下成立,就不能把小样本结果包装成精确结论。
def centers(values):
ordered = sorted(values)
n = len(ordered)
middle = n // 2
median = ordered[middle] if n % 2 else (ordered[middle-1] + ordered[middle]) / 2
return sum(values) / n, median
assert centers([1, 2, 100]) == (103/3, 2)程序只检查有限实例。解析公式、模拟频率和独立实现应三路对照;若三者不一致,先检查参数化、端点、自由度和随机种子。
机制与数据流
算术均值:所有观测总和除以数量,也是平方误差损失下的最佳常数预测。
加权均值:频数或重要度作为权重时,用加权总和除以权重总和。
中位数:排序后位于中间的值,最小化绝对误差并对极端值更稳健。
数据流写成“总体 → 抽样或观察 → 统计量 → 抽样分布 → 决策”。任何聚合都保留分母、缺失数和分组规则,避免统计量脱离生成过程。
边界与失败模式
众数:出现频数最高的取值,可有多个或不存在,适合分类变量。
离群点影响:极端值能显著拉动均值,却通常不改变大多数样本的次序位置。
边界测试包括零样本、单样本、不平衡类别、概率极端、离群点、强偏态、相关观测和数值退化。失败应返回明确状态,不能用NaN或一张空图悄悄结束。
experiment={"claim":"算术均值到离群点影响","normal":"假设满足","boundary":"退化或偏斜输入","counterexample":"把“平均”默认写成算术均值,没有说明离群点、偏态和业务损失。"}
assert len(experiment)==4工程案例
薪资报告若只给均值,少量高薪会掩盖典型员工处境。应并列中位数、分位数和样本构成;若决策关心总成本,均值仍有意义。指标不是互相替代,而是回答不同问题。 报告必须同时给原始计数、效应、误差或区间、模型诊断和未覆盖范围。图表与结论都绑定数据版本,才能在新数据到来后判断变化来自现实还是代码。
evidence=[("算术均值","definition"),("中位数","derivation"),("离群点影响","reproduction")]
assert len({name for name,_ in evidence})==3- 保存最小手算样例和原始分子分母。
- 加入空组、极端值、偏态和相关输入,解释哪条假设失效。
- 用固定种子模拟并与解析结果比较误差。
- 重建环境重跑,保存数据摘要、参数、代码版本和结论。
常见误区
本章回顾
本章覆盖算术均值、加权均值、中位数、众数、离群点影响。掌握标准是能从原始计数重建公式,说明抽样或分布假设,用代码复查并在假设破坏时给出可解释失败。