LESSON 01概率统计

概率统计(一)

从状态转移到概率综合建模

把陌生情境翻译成状态、转移、边界、期望与阈值,再调用数列、函数和不等式完成求解。

状态
已整理
核心模型
6
总结卡片
5

1. 本课定位

本次课既是整个暑期10次课的开场,也是概率统计专题的第一讲。课堂没有从常规的分布列、数学期望等基础题切入,而是直接选择学生较陌生、综合性较强的模型:

  1. 马尔可夫链与递推数列;
  2. 公平随机游走与“赌徒破产”;
  3. 分枝过程与种群灭绝概率;
  4. 概率、函数、均值和最值的综合;
  5. 漏诊率、误诊率与临界值。

本课的主线不是记住某一道题的答案,而是学习如何把复杂的概率情境翻译成数学关系,再利用数列、函数、不等式等已有工具求解。

2. 课程整体规划

2.1 暑期课程的重点

老师计划优先处理高考中相对困难、方法性较强的大题专题,初步顺序为:

  1. 概率统计;
  2. 导数;
  3. 圆锥曲线;
  4. 数列;
  5. 立体几何、解三角形等专题根据学生需要决定。

概率统计板块计划精选约10—12道有代表性的大题,目标不是大量刷题,而是覆盖绝大多数常见模型与高频变化。

2.2 大题与小题的不同训练策略

老师强调:

  • 大题的类型相对有限,适合按模型系统总结;
  • 小题变化范围广,难以准确预测第11题、第14题会考什么;
  • 小题训练的核心是扩大知识储备、保持手感、提升速度和准确率,并通过综合训练暴露知识漏洞;
  • 完成一套小题时应记录用时和正确率,例如尝试将整套小题控制在约48—55分钟内,同时观察准确率是否稳定;
  • 暑期更适合集中突破长期没有彻底掌握的专题。

2.3 推荐的学习闭环

课堂采用以下模式:

限时独立做题 → 对照答案定位问题 → 老师拆解思路 → 总结模型与方法 → 完成同类题 → 确认掌握后进入下一模型

老师特别强调“题目之间的联系”比单纯做题数量更重要。真正有效的总结,应说明:

  • 题目是什么模型;
  • 为什么要这样设量;
  • 递推关系从哪里来;
  • 为什么要消元或构造数列;
  • 本题与函数、数列、不等式等知识怎样结合;
  • 题目换一种问法后,方法是否仍然成立。

2.4 资料使用建议

课堂资料主要包括题册、配套答案、解题模型资料和草稿本。

  • 题册:按专题训练;
  • 配套答案:用于限时结束后的即时核对,而不是一开始照抄;
  • 解题模型资料:更适合作为“方法词典”,遇到陌生概念时查阅;
  • 草稿本:建议一页一道题,完整保留试错过程,便于课后复盘。

线上学习最好使用电脑、平板或电视等大屏设备,不建议只用手机;暂时没有纸质资料时,应准备A4纸书写完整过程。

3. 核心知识一:马尔可夫链与递推关系

3.1 模型本质

马尔可夫链类题目通常描述一个对象在若干“状态”之间不断转移。例如球在A、B、C三人手中传递,或物体在上、下两个位置之间变化。

解题时最重要的不是名称,而是两件事:

  1. 明确有哪些状态;
  2. 找出“第 nn 次处于某状态”的概率与“第 n1n-1 次各状态概率”的关系。

也就是说,马尔可夫链问题的核心是:

用上一步的状态分布,表示下一步的状态分布。

3.2 三状态传递模型

课堂第一道主要例题涉及A、B、C三个状态。设第 nn 轮后处于三个状态的概率分别为

P(An),P(Bn),P(Cn).P(A_n),\quad P(B_n),\quad P(C_n).

根据状态转移规则,分别写出 P(Bn)P(B_n)P(Cn)P(C_n) 与上一轮概率的关系。课堂中得到的结构为:

P(Bn)=12P(An1)+14P(Cn1),P(B_n)=\frac12P(A_{n-1})+\frac14P(C_{n-1}),

P(Cn)=12P(An1)+14P(Bn1).P(C_n)=\frac12P(A_{n-1})+\frac14P(B_{n-1}).

两式相减:

P(Bn)P(Cn)=14[P(Bn1)P(Cn1)].P(B_n)-P(C_n) =-\frac14\bigl[P(B_{n-1})-P(C_{n-1})\bigr].

初始时 P(B1)=P(C1)P(B_1)=P(C_1),所以差数列从第一项起为0,由此得到

P(Bn)=P(Cn).P(B_n)=P(C_n).

这一步的关键是“作差”:当两个状态具有对称性时,比较它们的差,往往能迅速证明二者始终相等。

3.3 利用概率和为1消元

任意一轮必处于A、B、C三个状态之一,因此

P(An)+P(Bn)+P(Cn)=1.P(A_n)+P(B_n)+P(C_n)=1.

又因为 P(Bn)=P(Cn)P(B_n)=P(C_n),所以

P(Bn)=P(Cn)=1P(An)2.P(B_n)=P(C_n)=\frac{1-P(A_n)}2.

将其代回状态转移式,就能把原来的三变量问题化成只含 P(An)P(A_n) 的一元递推问题。

课堂最后将递推式整理为等比结构:

P(An)37=34(P(An1)37).P(A_n)-\frac37 =-\frac34\left(P(A_{n-1})-\frac37\right).

于是数列

{P(An)37}\left\{P(A_n)-\frac37\right\}

是等比数列,再结合初值即可求通项或指定项。

3.4 这一模型的标准步骤

  1. 定义每个状态在第 nn 轮出现的概率;
  2. 根据“当前状态从哪里来”列递推式;
  3. 观察是否存在对称状态;
  4. 通过作差证明对称概率相等;
  5. 使用所有状态概率和为1进行消元;
  6. 将递推式配成等比数列或等差数列;
  7. 利用初值求通项或指定项。

3.5 易错点

  • 没有区分“第 nn 轮”和“第 n1n-1 轮”;
  • 只盯着从某状态“出去”的概率,没有从目标状态“由哪里进入”来列式;
  • 忘记三个状态的概率和恒为1;
  • 看出 B,CB,C 对称,却没有用作差把对称性写成严格证明;
  • 得到一阶递推后不会“配常数”构造等比数列。

4. 核心知识二:公平随机游走与赌徒破产

4.1 情境

一个人手中有 nn 元,每局以相同概率赢1元或输1元。当资金变为0时退出;当资金达到目标 bb 元时也结束。

pn=从 n 元出发最终输光的概率.p_n=\text{从 }n\text{ 元出发最终输光的概率}.

边界条件为

p0=1,pb=0.p_0=1,\qquad p_b=0.

4.2 建立递推

nn 元出发,下一局后:

  • 12\frac12 的概率变成 n1n-1 元;
  • 12\frac12 的概率变成 n+1n+1 元。

所以

pn=12pn1+12pn+1.p_n=\frac12p_{n-1}+\frac12p_{n+1}.

整理得

pn+1pn=pnpn1.p_{n+1}-p_n=p_n-p_{n-1}.

因此 {pn}\{p_n\} 是等差数列。结合边界条件:

pn=1nb.p_n=1-\frac nb.

4.3 结论解释

  • 有100元、目标200元时,最终输光概率为

p100=1100200=12.p_{100}=1-\frac{100}{200}=\frac12.

  • 有100元、目标1000元时,最终输光概率为

p100=11001000=0.9.p_{100}=1-\frac{100}{1000}=0.9.

即使每一局是公平的,只要个人本金有限、目标很高,最终输光的概率仍会很大。赌场一方若近似拥有无限资金,就天然具有“可以长期等待”的优势。

4.4 方法总结

这类一维随机游走题的通法是:

  1. 先定义到达某个吸收状态的概率;
  2. 写出两个边界值;
  3. 按下一步的可能位置列递推;
  4. 将递推式整理为一阶差分恒定;
  5. 判断原数列为等差数列;
  6. 代入边界条件求解。

5. 核心知识三:两状态转移

课堂还安排了一道只有“上、下”两个状态的题。其结构比三状态模型简单:

  • 处于“上”状态时,下一轮可能留在上方或转移到下方;
  • 处于“下”状态时,下一轮可能留在下方或转移到上方;
  • 只需选取其中一个状态的概率作为主变量,另一个状态的概率可用 1pn1-p_n 表示。

老师指出,这类模型在高考中可能以第14题等综合小题形式出现。课堂没有完整展开第二问,将其作为马尔可夫链的巩固练习。

6. 核心知识四:分枝过程与灭绝概率

6.1 情境与方程

设一个微生物产生0、1、2、3个后代的概率分别为

p0,p1,p2,p3,p_0,p_1,p_2,p_3,

p0+p1+p2+p3=1.p_0+p_1+p_2+p_3=1.

经过多代繁殖后,种群最终灭绝的概率 pp 是方程

p0+p1x+p2x2+p3x3=xp_0+p_1x+p_2x^2+p_3x^3=x

的最小正实根。

由于四个概率的和为1,x=1x=1 一定是方程的根。

6.2 因式分解

将方程移项并利用 p0+p1+p2+p3=1p_0+p_1+p_2+p_3=1,可整理为

(x1)[p3x2+(p2+p3)xp0]=0.(x-1)\left[p_3x^2+(p_2+p_3)x-p_0\right]=0.

f(x)=p3x2+(p2+p3)xp0.f(x)=p_3x^2+(p_2+p_3)x-p_0.

问题转化为研究二次函数 f(x)f(x) 在区间 (0,1)(0,1) 内是否有根。

6.3 期望控制根的位置

单个微生物产生后代数量的数学期望为

E(X)=p1+2p2+3p3.E(X)=p_1+2p_2+3p_3.

计算可得

f(1)=E(X)1.f(1)=E(X)-1.

又有

f(0)=p00.f(0)=-p_0\le 0.

因此:

  • E(X)1E(X)\le1 时,(0,1)(0,1) 内没有更小的正根,最小正实根为1,最终灭绝概率为1;
  • E(X)>1E(X)>1 时,(0,1)(0,1) 内存在一个正根,最小正实根小于1,最终灭绝概率小于1。

6.4 实际意义

  • 平均每个个体产生的后代数不超过1时,种群规模总体缺乏增长能力,长期看必然灭绝;
  • 平均后代数大于1时,种群具有扩张可能,灭绝仍可能发生,但其概率不再是1。

6.5 本题的综合性

题目表面上是概率问题,实际调用了:

  • 概率和为1;
  • 数学期望;
  • 多项式方程;
  • 已知根后的因式分解;
  • 二次函数图像;
  • 函数零点分布;
  • 数学结论的实际解释。

这体现了概率统计大题的重要特点:情境来自概率,真正求解时常需要数列、函数或不等式工具。

7. 核心知识五:比赛训练、期望与最值

课堂另一道题把两名参与者的成功概率与训练轮数联系起来。逐字稿中的原始题干和部分公式识别不完整,但可可靠提炼出以下解题框架。

7.1 先算“一轮成功”的概率

根据一轮中可能出现的成功、失败组合,分情况求出一轮通过的概率 PP。列式时要注意:

  • 两局中只指定一局成功时,通常有先后两种顺序;
  • 需要使用互斥事件概率相加;
  • 同一轮中独立环节的概率相乘;
  • 列完式后再合并同类项。

7.2 用条件降元

题目给出

p1+p2=43.p_1+p_2=\frac43.

因此可把一轮成功概率整理成关于乘积 p1p2p_1p_2 的函数。

由基本不等式:

p1p2(p1+p22)2=49,p_1p_2\le\left(\frac{p_1+p_2}{2}\right)^2=\frac49,

且当 p1=p2=23p_1=p_2=\frac23 时取等号。

课堂算得单轮成功概率最大值为

Pmax=1627.P_{\max}=\frac{16}{27}.

7.3 用期望估计所需轮数

若每轮成功概率均为 1627\frac{16}{27},进行 NN 轮,则成功次数的期望为

E=N1627.E=N\cdot\frac{16}{27}.

若要求期望成功次数至少为16,则

N162716,N\cdot\frac{16}{27}\ge16,

所以

N27.N\ge27.

7.4 可迁移方法

  1. 将文字情境翻译为一次试验;
  2. 枚举一次试验中所有合格结果;
  3. 求单次成功概率;
  4. 利用和为定值,把问题化为乘积或单变量函数;
  5. 用基本不等式或函数求最值;
  6. 再用二项分布期望 E=npE=np 连接总轮数。

8. 核心知识六:漏诊率、误诊率与临界值

8.1 四种判断结果

医学检测可分为四种情况:

实际情况 检测判断 结果
有病 有病 正确检出
有病 没病 漏诊
没病 没病 正确排除
没病 有病 误诊

8.2 临界值的含义

设某项检测指标以数值 cc 为判断临界值:

  • 指标小于 cc,判断为无病;
  • 指标大于 cc,判断为有病。

由于患病人群和健康人群的指标分布会重叠,所以任何临界值都可能同时造成:

  • 一部分患病者落在阈值下方,被漏诊;
  • 一部分健康者落在阈值上方,被误诊。

8.3 面积即概率

若题目给出两类人群的概率密度图像或分段函数,则:

  • 漏诊率对应“患病人群曲线在临界值错误一侧的面积”;
  • 误诊率对应“健康人群曲线在临界值错误一侧的面积”。

因此解题流程是:

  1. 先根据已知漏诊率确定临界值;
  2. 再利用另一人群的分布计算误诊区域面积;
  3. 将面积换算为误诊率。

课堂强调,这道题的难点主要不是计算,而是读懂漏诊、误诊和临界值的实际含义。理解情境后,后续通常只是一次函数、分段函数及面积计算。

9. 本课最重要的通用方法

9.1 从“来源”列概率递推

要求第 nn 次处于某状态的概率,不是只看该状态下一步会去哪里,而要问:

nn 次处于这个状态,可能由第 n1n-1 次的哪些状态转移而来?

将每一种来源的“原状态概率 × 转移概率”相加,即可得到递推式。

9.2 主动寻找守恒关系

常见守恒关系包括:

  • 所有互斥状态的概率和为1;
  • 固定总概率或固定概率和;
  • 初始状态和边界状态已知;
  • 对称状态的概率相等。

这些关系是消元的关键。

9.3 看到递推就考虑数列

  • 若出现

pn=12(pn1+pn+1),p_n=\frac12(p_{n-1}+p_{n+1}),

则考虑等差数列;

  • 若出现

pn=apn1+b,p_n=ap_{n-1}+b,

则通过配常数构造

pnc=a(pn1c)p_n-c=a(p_{n-1}-c)

的等比数列;

  • 若多个状态相互转移,先通过对称、作差、概率和为1进行降维。

9.4 概率题经常“借用”其他模块

本课多次体现:

  • 马尔可夫链 + 数列递推;
  • 灭绝概率 + 方程与二次函数;
  • 单轮成功率 + 基本不等式;
  • 多轮成功次数 + 二项分布期望;
  • 诊断问题 + 分段函数与面积。

复习时不能把概率统计孤立为只会“套概率公式”的板块。

10. 本课易错点总表

  1. 分布列中的概率计算错误,课堂中有学生把应为 14\frac1434\frac34 的结果误写成 116\frac1{16}
  2. 状态转移式下标错位,把第 nn 轮和第 n1n-1 轮混在一起;
  3. 忽略对称性,没有通过作差证明两个状态概率相同;
  4. 忘记所有状态概率和为1,导致变量过多、无法消元;
  5. 一阶非齐次递推不会配常数;
  6. 随机游走问题把边界 p0=1p_0=1pb=0p_b=0 写反;
  7. 只看“每局公平”,误以为有限本金下最终输光概率不会很高;
  8. 知道 x=1x=1 是根,却不会提取 x1x-1 因式;
  9. 不会把 f(1)f(1) 化成 E(X)1E(X)-1,因而看不出期望对灭绝概率的控制作用;
  10. 求概率最值时没有利用“和为定值”转化为乘积的范围;
  11. 混淆漏诊与误诊,没有先判断“实际是否患病”;
  12. 直接计算图形面积,却没有先理解临界值两侧分别代表什么。

11. 课后任务

课堂给出的作业具有选择性,可根据个人情况完成:

  1. 选择一套综合小题进行限时训练,记录用时、正确率和暴露出的漏洞;
  2. 若马尔可夫链仍不熟练,完成课堂提到的同类练习题,尤其是两状态转移题和第14题;
  3. 趁热完成概率统计题册中对应的小题或大题;
  4. 复盘课堂例题时,不只抄答案,应重新写出“状态定义—递推来源—消元—数列构造”的完整链条;
  5. 第二天上课携带题册、答案和解题模型资料,便于核对与查阅。

12. 建议形成的个人笔记页

建议将本课压缩为以下五张“模型卡”:

模型卡1:有限状态马尔可夫链

  • 关键词:状态转移、前一步、递推、对称;
  • 核心公式:下一状态概率 = 各来源状态概率 × 对应转移概率之和;
  • 核心技巧:作差、概率和为1、消元、配常数。

模型卡2:公平随机游走

  • 关键词:向左/向右等概率、两个吸收边界;
  • 核心递推:

pn=12pn1+12pn+1;p_n=\frac12p_{n-1}+\frac12p_{n+1};

  • 结论:pnp_n 为等差数列。

模型卡3:分枝过程灭绝

  • 关键词:后代数、概率生成方程、最小正根;
  • 核心判断:E(X)1E(X)\le1 时灭绝概率为1,E(X)>1E(X)>1 时灭绝概率小于1;
  • 工具:因式分解、二次函数零点。

模型卡4:单轮概率—最值—总轮数

  • 关键词:枚举结果、和为定值、积的最值、二项分布;
  • 核心链条:

单轮成功概率maxPE=np最少轮数.\text{单轮成功概率}\rightarrow \max P\rightarrow E=np\rightarrow \text{最少轮数}.

模型卡5:医学检测阈值

  • 关键词:临界值、漏诊、误诊、分布重叠;
  • 核心方法:先读懂两类错误,再用曲线下的面积表示概率。

13. 本课一句话总结

本课真正训练的是:面对陌生概率情境,先把它翻译成“状态、转移、边界、期望或阈值”,再调用数列、函数与不等式工具完成求解;与其大量刷题,不如把每一种模型的建模逻辑总结透彻。