《深入浅出统计学》全书导览
按O'Reilly权威目录重建,覆盖描述数据、概率规则、分布模型、统计推断、关系建模。
先做预测
先预测样本量翻倍、极端值出现或随机机制改变时,图形、估计与结论会怎样变化。本书按15章从看懂数据、计算概率推进到抽样推断与回归。学习路径保持原书故事驱动顺序,同时为每章补上公式推导、可重放代码和反例证书。 本章以、、、、建立从数据到证据的链条。
原书章节定位
本页一一对应O'Reilly原书“《深入浅出统计学》全书导览”。本书按15章从看懂数据、计算概率推进到抽样推断与回归。学习路径保持原书故事驱动顺序,同时为每章补上公式推导、可重放代码和反例证书。 原书的故事负责建立直觉;本页进一步要求写出总体、样本、参数和统计量,并用公式、代码与反例验收直觉。
核心单元
- 描述数据:先用图形、中心和离散程度认识样本。
- 概率规则:用事件、条件和计数建立随机机制。
- 分布模型:用离散与连续分布描述结果和参数。
- 统计推断:从样本估计总体并控制决策错误。
- 关系建模:用卡方、相关与回归分析变量关系。
从问题开始
先写五个可反驳问题:描述数据描述谁,概率规则如何改变表示,分布模型依赖什么随机机制,统计推断在哪些边界失效,关系建模留下什么验收证据。统计计算只有在总体、观察单位、时间窗和缺失规则明确后才有意义。先用图形、中心和离散程度认识样本。 用事件、条件和计数建立随机机制。 两者若来自不同总体,任何后续公式都失去解释。
数据契约D把样本的来源固定下来。接着用分布模型表达结构,并由统计推断标记前提。关系建模必须能由另一位读者在同一数据版本上重算。不能先看结果再改变分组、尾部方向或排除条件。
反例与敏感性
正常样例应覆盖原书中心场景,边界样例至少包括空组、单样本、极端值、概率接近零或一、强相关与分布偏斜。再以“跳过可视化直接做检验,可能被离群点、分群和录入错误误导。”构造反例,记录第一个失效的假设。贯穿项目使用一份真实但匿名的服务质量数据:先画分布,再拟合到达与延迟模型,设计用户抽样,构造区间与检验,最后分析版本和设备关系。每一步保存假设与缺失机制。
误差可能来自抽样波动、选择偏差、测量误差、模型偏差和浮点实现。增加样本通常只降低抽样波动,不能修复抽样框缺失或错误模型。敏感性分析要分别改变分组、异常值规则和模型假设,观察结论方向与区间是否稳定。
验收证书
证书包括原始计数、描述数据定义、概率规则变换、分布模型计算、统计推断边界和关系建模结论。每个百分比都能回到分子分母,每个图都标明尺度和样本量,每个检验都给效应与区间,每个随机过程都记录种子。
预算在看数据前定义。未通过时要区分数据不足、模型不适用、效果不足和实现错误;“未显著”不能笼统翻译为“没有差异”。
可核查推导
原书前3章建立描述语言,4到9章建立概率与分布,10到14章从抽样进入置信区间与检验,15章处理双变量关系。每段都以前段定义为前提,不能从p值或回归线倒着猜数据生成过程。 每一步都要注明使用定义、独立性、分布假设还是渐近近似;若只在大样本下成立,就不能把小样本结果包装成精确结论。
chapters={"描述统计":3,"概率与分布":6,"抽样与推断":5,"相关与回归":1}
assert sum(chapters.values())==15程序只检查有限实例。解析公式、模拟频率和独立实现应三路对照;若三者不一致,先检查参数化、端点、自由度和随机种子。
机制与数据流
描述数据:先用图形、中心和离散程度认识样本。
概率规则:用事件、条件和计数建立随机机制。
分布模型:用离散与连续分布描述结果和参数。
数据流写成“总体 → 抽样或观察 → 统计量 → 抽样分布 → 决策”。任何聚合都保留分母、缺失数和分组规则,避免统计量脱离生成过程。
边界与失败模式
统计推断:从样本估计总体并控制决策错误。
关系建模:用卡方、相关与回归分析变量关系。
边界测试包括零样本、单样本、不平衡类别、概率极端、离群点、强偏态、相关观测和数值退化。失败应返回明确状态,不能用NaN或一张空图悄悄结束。
experiment={"claim":"描述数据到关系建模","normal":"假设满足","boundary":"退化或偏斜输入","counterexample":"跳过可视化直接做检验,可能被离群点、分群和录入错误误导。"}
assert len(experiment)==4工程案例
贯穿项目使用一份真实但匿名的服务质量数据:先画分布,再拟合到达与延迟模型,设计用户抽样,构造区间与检验,最后分析版本和设备关系。每一步保存假设与缺失机制。 报告必须同时给原始计数、效应、误差或区间、模型诊断和未覆盖范围。图表与结论都绑定数据版本,才能在新数据到来后判断变化来自现实还是代码。
evidence=[("描述数据","definition"),("分布模型","derivation"),("关系建模","reproduction")]
assert len({name for name,_ in evidence})==3- 保存最小手算样例和原始分子分母。
- 加入空组、极端值、偏态和相关输入,解释哪条假设失效。
- 用固定种子模拟并与解析结果比较误差。
- 重建环境重跑,保存数据摘要、参数、代码版本和结论。
常见误区
本章回顾
本章覆盖描述数据、概率规则、分布模型、统计推断、关系建模。掌握标准是能从原始计数重建公式,说明抽样或分布假设,用代码复查并在假设破坏时给出可解释失败。