lec 2 probability theory
quiz: 回顾两种三段论
Laplace
统计是什么
通常统计被解读为: “不可靠” , 充满偏差, 数据处理的各种技巧, 各种随意的测试和规则, 没有统一的工具
希望的统计:
- 一个唯一的, 透明的, 符合逻辑的框架, 将假设和数据变成一个诚实的结论
- 唯一的, 一致的规则, 带有常规性
- 能用在极端的情况下
- 能大量用在真实世界的问题上
从常识出发搭建理论
正式的逻辑语言: 表示真与假的代数
Bool 代数
二元值: true , false
逻辑操作: 与 ⋅ , 或 + , 非
真值表 & Venn 图
Bool 代数相关恒等式
分析: A⟹B 的 bool 代数等式 A=AB , 从真值表上:
- 一个真命题 implies 所有其他真命题
- 一个假命题 implies 所有命题
- 当 A 真或 B 假时: 强 syllogism
- 当 A 假或 B 真时: nothing
此时仅仅使用 bool 代数已经不能满足需求了, 需要一种能够表达合情合理的推断的语言
这种语言需要满足:
- 可能性需要用实数表示 (连续, 全序, 满足一些 bool 代数)
- 定性地与常识相符
- 自洽(一致性)
- 不同的推理给出相同的结果
- 能够使用所有已知的信息
- 对相同的了解的东西应该有相同的可能性
记号:
条件性的合情合理的程度: 在知道 B 为真时, A 为真的合情程度为
P(A∣B)
在知道 C 和 D 都为真时, A 或 B 为真的合情程度为
P(A+B∣CD)
一些考虑
- 不尝试去定义
P(A∣BC)
若 B,C 之间是矛盾的
- 单调性, 已知 I 时, 若 A 比 B 更合情
P(A∣I)>P(B∣I)
- 连续性: 若 P(A∣I) 变化了一点点
逻辑积
表达 P(AB∣I) , 需要下面的项
P(A∣I)P(B∣I)P(A∣BI)P(B∣AI)
为什么不出现 P(A∣I) 之类的项?
这和一致性矛盾, 这项忽略了 I 的信息
只有一种做法不违背前面的要求
P(AB∣I)=F[P(A∣I),P(B∣AI)]=F[P(B∣I),P(A∣BI)]
为什么不出现
G[P(A∣I),P(B∣I)]
这忽略了 A 和 B 的关系
为什么不出现
G[P(B∣AI),P(A∣BI)]
这不能给出任何信息, A 和 B 都是未知的
为什么不加入更多项?
带来的信息是冗余的
更多记号
x=P(A∣I)y=P(B∣AI)z=P(C∣ABI)
而
P(AB∣I)=F(x,y)
有两种方式
P(ABC∣I)=F[P(AB∣I),P(C∣ABI)]=F[F(x,y),z]
和
P(ABC∣I)=F[P(A∣I),P(BC∣AI)]=F[x,F(y,z)]
即
F[F(x,y),z]=F[x,F(y,z)]
若加入单调性的要求, 可以证明只有一种解(jayne’s book)
w[F(x,y)]=w(x)w(y)
定义
q(A∣I)=w[P(A∣I)]
从而有
q(AB∣I)=q(B∣AI)q(A∣I)=q(A∣BI)q(B∣I)
对确定的情况:
-
若 A 是确定的 (I⟹A) , 有
q(AB∣I)=q(B∣I)q(A∣BI)=q(A∣I)
从而有 q(B∣I)=q(A∣I)q(B∣I)即⟹q(A∣I)=1
对不可能的情况
- 若 A 是假的 (I⟹A) 可以得到
q(A∣I)=0
Negation mapping
考虑补
q(A∣I)=S[q(A∣I)]
有边界条件
S(0)=1S(1)=0
对任意命题 A,B 有
q(AB∣I)=q(A∣I)q(B∣AI)q(AB∣I)=q(A∣I)q(B∣AI)
可以得到
q(AB∣I)=q(A∣I)S[q(B∣AI)]=q(A∣I)S[q(A∣I)q(AB∣I)]
利用交换律可以得到
q(A∣I)S[q(A∣I)q(AB∣I)]=q(B∣I)S[q(B∣I)q(BA∣I)]
考虑一些情况
- B⟹A , 有
AB=BBA=A
xS[xS(y)]=yS[yS(x)]
- 在 y=1 时, S[S(x)]=x , 此时有唯一解
S(x)=(1−xm)1/m
容易验证上面的解对任意 A,B 也成立, 则是充分必要的
从而有加法规则
qm(A∣I)
从而可以定义概率
P(x)=qm(x)∈[0,1]
满足连续单调增
并且有积规则和加法规则
P(AB∣I)=P(A∣I)P(B∣AI)=P(B∣I)P(A∣BI)
和
P(A∣I)+P(A∣I)=1
再看特例:
若 I=(A⟹B) , 则
P(AB∣I)=P(A∣I)P(AB∣I)=0
加入乘法规则
P(B∣AI)=P(A∣I)P(AB∣I)=1P(A∣BI)=P(B∣I)P(AB∣I)=0
此即强 syllogism
同样, 有 P(B∣I)≤1 , 代回乘法规则
P(A∣BI)≥P(A∣I)⟹P(B∣AI)≤P(B∣I)⟹P(A∣BI)≤P(A∣I)
此即弱 syllogism
若 P(B∣AI)>P(B∣I) , 有 P(A∣BI)>P(A∣I) , 可以解读为新的 syllogism (更弱版本):
若 A 是真的, 则 B 更有可能
B 是真的
⟹ A 更有可能
定量的应用:
推广加法规则:
P(A+B∣I)=1−P(A⋅B∣I)=1−P(A∣I)P(B∣AI)=1−=⋯=P(A∣I)+P(B∣I)−P(AB∣I)
可以继续对多个命题继续推广
假设各个命题是互斥的, 则加法规则会变简单
若这些命题是完备的, 则有
给概率赋值
…
无差别原理
考虑完备的, 无交的事件 {Ai} , 有
i=1∑nP(Ai∣I)=1
前提 I 为无法区别任意一个命题, 则可以交换任意命题的指标, 这给出
P(Ai∣I)=n1
统计推断:
- 目标: 给定背景信息 I , 在样本集 D 中 , 更新假说 H , P(H∣DI)
- Bayes’ theorem
P(H∣ID)=P(D∣I)P(D∣HI)P(H∣I)
* $P(H\mid DI)$ : 后验概率, 在样本 $D$ 中 $H$
* $P(D\mid HI)$ : 似然, 在假说 $H$ 下和 $D$ 的相容性
* $P(H\mid I)$ : 先验概率: 在获得样本 $D$ 前, $H$ 的可能性
* $P(D\mid I)$ : 证据
Normalization
对任意命题 B :
推广: 对互斥和完备的所有假说模型 {Hi}i=1N , 有
P(D∣I)=i=1∑NP(D∣HiI)P(Hi∣I)
例子: Monty Hall Game
…
边缘化 marginalization