08
第二部分 · 理解不确定性

两误相较,如何取其轻?

两种错误不可能同时归零——怎么选,不是科学问题

第 8 章 · 约 55 分钟 · 《第三个千年思维》读书会
你是陪审员

证据看完了

你心里的判断是:这个人有罪的概率,大概 82%。

法官在等你的结论。只有两个选项:有罪 / 无罪

  • 你投哪个?
  • 换成 90% 呢?95% 呢?
  • 你心里那条线,到底画在几?
第8章 · 两误相较,如何取其轻?

任何这样的判断,都落在这张表里

真相:信号**存在**真相:信号**不存在**
你判「存在」
阳性
真阳性 抓对了 假阳性 虚惊一场 · 冤枉好人
你判「不存在」
阴性
假阴性 漏掉了 · 放走罪犯 真阴性 放对了

书里还给了一个更老派的说法:假阳性是作为之罪,假阴性是不作为之罪

008-014
第8章 · 两误相较,如何取其轻?

所以「这个判断准不准」是个坏问题

准,有两种

灵敏度 —— 信号真的在的时候,你判出「在」的比例。

特异度 —— 信号真的不在的时候,你判出「不在」的比例。

一个好的测试,两个都要高。

想让灵敏度拉满?很容易

永远说「有」。

所有肿瘤一律判恶性——一个癌症都不会漏掉,灵敏度 100%。

但特异度归零,这个筛查也就毫无意义了。

008-015
第8章 · 两误相较,如何取其轻?

你每天都在设这条线

去机场

提早到,确保不误机,代价是在候机厅浪费生命;掐点到,省时间,代价是可能误机。

管孩子

管得松,给信任、养自主性,代价是她可能受伤害;管得严,降低风险,代价是别的。

房租管控

管控,确保困难群体有房可居;不管控,激励开发商多建楼盘。

接收难民

接收,保障安全和福利;禁止入境——万一有人潜藏其中呢?

008-007
第8章 · 两误相较,如何取其轻?

二、那条线画在哪

本章的核心主张就在这一节

宁可让十个有罪之人逍遥法外,也好过将一个无辜之人定罪。

— 威廉·布莱克斯通爵士,英国法学家

008-019
报一个数

换成你,是几比一?

「宁可放走 ____ 个有罪的人,也不能冤枉一个无辜的人。」

填一个数。可以是 1,可以是 10,可以是 100。

写下来——下一页会把它换算成你自己的证明标准。

第8章 · 两误相较,如何取其轻?

p = 10/11 = 0.91*

书在脚注里给了一个公式:

p* = 对假阳性的厌恶 ÷(对假阳性的厌恶 + 对假阴性的厌恶)

布莱克斯通的 10 : 1 代进去,得到 0.91——也就是说,有罪概率要超过 91%,才该定罪。

你刚才写的那个数,代进去就是你自己的证明标准

008-060

那「排除合理怀疑」到底是百分之几

一项针对美国联邦法官的调查

  • 1/3 的法官说:相当于有 95% 的把握
  • 1/3 的法官说:应该是 99%
  • 剩下 1/3:给出了各种其他数字

而本书作者之一罗伯特尝试估算过陪审员实际采用的阈值——

这个数似乎远低于 95%。

008-021
第8章 · 两误相较,如何取其轻?

一个实验,两组学生,同样的证据

伯克利,一桩虚构的袭击案

一半的学生拿到的描述是:被告是伯克利一名 21 岁的学生

另一半被告知:被告是伯克利一名 21 岁的失业者

证据完全相同。

结果:「失业者」组更倾向于判定被告有罪

而且——当被问到「把无辜的人定罪」和「把有罪的人放掉」哪种错误更严重时,

「失业者」组的学生认为:把自己的同学误判为有罪,后果比误判一个失业者更严重。

008-022
第8章 · 两误相较,如何取其轻?

三、录取分数线

把 2×2 画成一张图

同一批申请者,三种画法

分数线画得高
几乎不会招进读不下去的人。
代价:一大片本来能行的人被拒在门外
分数线画得低
被误拒的人少了很多。
代价:招进来一批读不下去的
换一把更准的尺
点云收窄了。
两类错误同时变少
008-029
第8章 · 两误相较,如何取其轻?

那么,那条竖线该画在哪

设定分数线并非科学或数学计算,而是一项政策层面的决定,是人类价值观的缩影,即哪种类型的错误是可接受的。

而且书补了一句更关键的:

并没有特别的理由认为科学家更擅长做这类权衡。

008-034

四、还有一个因素:基础率

它能让一个很好的检查看起来很糟

81%–93%

《纽约时报》报道:在几种罕见病的检查中(如迪格奥尔格综合征、4p 部分单体综合征),

检查结果呈阳性的人里,实际上是阴性的比例,高达 81% 到 93%。

那这些检查是不是废物?

008-040

不是检查太烂,是真阳性本来就不多

绝大多数接受检查的人并没有这些罕见病。

所以就算检查本身挺不错,你观察到的假阳性数量,也会超过真阳性——

因为不存在那么多可供发现的真阳性。

这个东西叫基础率:信号实际存在的百分比。算它的工具叫贝叶斯法则

008-040

所以分层筛查才是正确答案

第一层 · 便宜、灵敏、粗

故意容忍高假阳性率——宁可虚惊,不要漏掉。 它的任务不是确诊,是把人群缩小

第二层 · 昂贵、精确、窄

只对初筛阳性的人做。成本高,但误诊率低。

合起来

对初筛阳性的人进行费用高昂的二次检查,能极大地纠正初次误诊的错误。
所以假阳性率高的初筛,不但不是废物,还是整套体系里不可替代的一环。

008-041
第8章 · 两误相较,如何取其轻?

五、看不见的那两格

2×2 表格常常只有一半能看见

伯克利和斯坦福,对学生说的那句话

「你们非常棒,是精英中的精英。」

这是实话。 但招生委员会心知肚明:名单往下再拉长一截,还能再录一大批优秀学子。

那些没被录取的人,到底是不是一个错误?

永远不会知道。 我们看不到那个「录取了他们」的平行世界。

008-043

1973 年,一次意外的实验

关于「精神科医生和假释委员会能不能判断谁危险」的争论,吵了很久

然后发生了一件事:严重的预算不足,部分看守机构不得不释放所有人。

即使精神科医生判定某些人「过于危险,不应释放」,州政府的回答是:

「好吧,我们不在乎你的意见,总之我们要释放他们。」

于是那一格被打开了。结果是:

大多数被判定为「危险」的人,在接下来的 3 年里没有再犯任何暴力罪行。

008-044
第8章 · 两误相较,如何取其轻?

六、p 值 0.05

学过统计的人,这一节会很解气

0.049 欢庆,0.051 绝望

p 值的意思是:在事实上不存在任何关联的情况下,检测到你所观察到的这种强度的关联的概率。

两个数相差 0.002。一个能发论文,一个不能。

我们凭什么认为这两个数据,一个很重要,另一个不重要?

008-051

而 0.05 这个数,是相当武断地选出来的

老一辈统计学家定了它。按照惯例,这个决定是为了避免假阳性,而不是假阴性。

也就是说——统计学的默认设置里,已经装了一个价值判断。

原则上,你完全可以主张用更高或更低的临界值。

008-052

代价落在公共政策上

社会干预的效果测量:样本小、噪声大,再加一道防假阳性的严苛阈值——

真实但微弱的效果,永远达不到 p < 0.05,于是被弃如敝屣。

而要不要改这个默认值,书说:是一个价值判断的问题。

008-053

那能不能少受点这个罪

权宜之计

先试,再看结果,再回头优化。 立法者的版本叫「日落条款」——到期重新评估才续拨款。
副作用:日落条款会刺激各党派歪曲证据,来支持或反对某个项目续命。

暂缓决策

再等等,多收点证据。经济不明朗时推迟买房或跳槽;医生等检测结果更明确再决定要不要做侵入性治疗。

但有些事不能等

市长收到洪水预警,要不要疏散。军官发现闯入限航区的飞机,要不要开火。
陪审员不能说「法官大人,我们有 82% 的把握」。

008-056
第8章 · 两误相较,如何取其轻?

本章最容易被记岔的一处

✗ 「科学证据支持,所以就该这么做」

这句话悄悄跳过了一步。

✓ 书的分解

书明确说:有令人信服的科学证据证明封控可以减少病毒传播。 这一句是事实。

但还要把这个风险和封控造成的危害(经济、教育、心理)放在一起权衡。

这并不意味着政府采取封控措施是科学所授意的

证据说两边各有多重。哪边更值得避免,科学不回答。

第8章 · 两误相较,如何取其轻?

这一章,回顾

  • 任何二元判断都落在 2×2:真阳 / 假阳 / 假阴 / 真阴。「准不准」是个坏问题
  • 两种错误不可能同时归零。 拉低一个就抬高另一个
  • 那条线画在哪,是价值判断。布莱克斯通的 10:1,换算过来就是 p* = 0.91
  • 阈值越模糊,偏差钻的空子越大——同样的证据,「失业者」比「同学」更容易被判有罪
  • 长期看科学能帮上忙:换一把更准的尺,两类错误一起减少
  • 基础率能让好检查看起来很糟。解药是分层筛查,第一道故意做松
  • 2×2 常常只看得见一半。你拒掉的那些人后来怎样,通常没有数据
  • p < 0.05 是武断选的,而且它偏向防假阳性。 代价是真实但微弱的效果被扔掉
第8章 · 两误相较,如何取其轻?

下周就能用的四件事

  1. 遇到一个「要不要放行」的判断,先把 2×2 画出来,问:这两种错误,我更怕哪个
  2. 把那个「更怕」量化成一个比例,再换算成阈值:p* = 厌恶假阳性 ÷(厌恶假阳性 + 厌恶假阴性)
  3. 有人抱怨某个规则「误报太多」,先问:它后面有没有第二道复核
  4. 看到「我们通过的人表现都很好」这类数据,问一句:被拒的那些人呢
第8章 · 两误相较,如何取其轻?

第二部分快讲完了

我们学会了报概率、学会了校准、学会了分辨信号和噪声、也学会了在两种错误之间明码标价。

但还有一类误差,上面这些统统对付不了。

你量一扇门,量十次取平均,随机波动就抵消了。

可要是你手里那把卷尺,洗过水之后缩了 3 毫米呢?

量一万次,那 3 毫米还在。

第 9 章:统计不确定性和系统不确定性

快捷键

→ ↓ 空格下一页
← ↑上一页
Home / End首页 / 末页
N讲稿面板
O缩略图总览
F全屏
P讲义模式(可打印)
Esc关闭浮层
?本帮助