新信息来了,信心该改多少?
贝叶斯:用新证据一点点更新判断。两个实验 + 一个拆开算的公式。
实验 1:阳性悖论
一群人做同一种检测。填上人数和测出的阳性人数,看看阳性的人里,真生病的有几个。
先验
%
似然
%
观察
人
观察
人
后验
你填的阳性数和预计差得多:要么患病率估错了,要么检测没那么准。
先验、似然、观察、后验分别是什么?
- 先验先验:检测之前就知道的事——这群人里本来有多少人生病。
- 似然似然:检测本身准不准——有病的人测成阳性、没病的人测成阴性的概率。
- 观察你的观察:实际做了多少人、测出多少阳性。
- 后验后验:拿到结果之后更新的判断——阳性的人里真有病的比例。
按 1000 人比例示意。检测再准,病本来就罕见时,阳性里大多是误报。先问基础比例(先验)。
实验 2:这是真突破吗?
填上你统计的历史成功率,再勾上这次真正看到的证据,看这一次是真突破的概率。
先验
%
似然观察每条证据在真 / 假突破里出现几成(可改),勾上这次看到的
| 看到了 | 证据 | 真突破里 | 假突破里 | 力度 |
|---|
后验
先验、似然、观察、后验分别是什么?怎么算的?
- 先验先验:历史上像这样的突破,有几成最后是真的。
- 似然似然:每条证据在真突破里出现几成、在假突破里出现几成。两者一除就是这条证据的「力度」:大于 1 往上推,小于 1 往下拉,等于 1 等于没说。
- 观察观察:这一次你入场时,真正看到了哪几条。
- 后验后验:看到这些证据之后,这一次是真突破的概率。
- 怎么算:把概率换成「几率」= p ÷ (1 − p),每看到一条证据,就把几率乘上它的力度,最后再换回概率。只有证据之间互不相关时,才能这样连乘。
为什么实盘成功率比历史统计低?
- 统计带了后见之明:回头翻图时认出来的「突破」,很多是已经走出来的那些;当时失败、后来看着不像突破的,没被算进去。先验被高估了。
- 入场时看到的证据和统计样本不一样:追消息、在大盘走弱时进场,每一条都在把概率往下拉。点上面的「实盘常见情形」试试。
- 证据看起来多,其实是同一件事:放量和消息暴涨常常一起出现,不能各加一次分。
- 有些信号在假突破里也一样常见:真假两边出现的比例差不多,力度接近 1,看到它几乎不该改变判断。
办法:把历史统计按「入场那一刻能看到的信息」重新分组,每组单独算成功率,用它当先验。
表里的比例是演示用的假设,不是统计结果。换成你自己的统计,这一页就是你的真突破计算器。
拆开贝叶斯公式
问题:街上看到一个穿格子衫的人,他是程序员的概率有多大?
P(程序员 | 格子衫)
=
P(格子衫 | 程序员) × P(程序员)
P(格子衫)
后验
后验
P(程序员 | 格子衫)
看到格子衫之后,这个人是程序员的概率。我们要算的答案。
似然
P(格子衫 | 程序员)
如果他真是程序员,穿格子衫的概率。证据在「是程序员」时有多常见。
先验
P(程序员)
还没看衣服之前,随便一个人是程序员的概率,也就是基础比例。
证据总概率
P(格子衫)
不管是不是程序员,街上随便一个人穿格子衫的概率。等于两种人各自穿格子衫的部分加起来。
就算程序员爱穿格子衫,穿格子衫的人里程序员也未必占多数:因为程序员本来就少(先验小)。
再看一眼:他木讷,还是活泼?
似然%
似然%
后验
证据一条一条加,每次都用上一步的结果当先验:5% → 格子衫 → 性格,判断一步步更新。
所以
- 先问基础比例,别只看信号准不准。
- 一条证据只挪一点,别一个信号就从 0 跳到 100。
- 判断随新信息不断更新,不是一次定终身。