两种错误不可能同时归零——怎么选,不是科学问题
你心里的判断是:这个人有罪的概率,大概 82%。
法官在等你的结论。只有两个选项:有罪 / 无罪。
| 真相:信号**存在** | 真相:信号**不存在** | |
|---|---|---|
| 你判「存在」 阳性 |
真阳性 抓对了 | 假阳性 虚惊一场 · 冤枉好人 |
| 你判「不存在」 阴性 |
假阴性 漏掉了 · 放走罪犯 | 真阴性 放对了 |
书里还给了一个更老派的说法:假阳性是作为之罪,假阴性是不作为之罪。
灵敏度 —— 信号真的在的时候,你判出「在」的比例。
特异度 —— 信号真的不在的时候,你判出「不在」的比例。
一个好的测试,两个都要高。
永远说「有」。
所有肿瘤一律判恶性——一个癌症都不会漏掉,灵敏度 100%。
但特异度归零,这个筛查也就毫无意义了。
提早到,确保不误机,代价是在候机厅浪费生命;掐点到,省时间,代价是可能误机。
管得松,给信任、养自主性,代价是她可能受伤害;管得严,降低风险,代价是别的。
管控,确保困难群体有房可居;不管控,激励开发商多建楼盘。
接收,保障安全和福利;禁止入境——万一有人潜藏其中呢?
本章的核心主张就在这一节
宁可让十个有罪之人逍遥法外,也好过将一个无辜之人定罪。
— 威廉·布莱克斯通爵士,英国法学家
「宁可放走 ____ 个有罪的人,也不能冤枉一个无辜的人。」
填一个数。可以是 1,可以是 10,可以是 100。
写下来——下一页会把它换算成你自己的证明标准。
书在脚注里给了一个公式:
p* = 对假阳性的厌恶 ÷(对假阳性的厌恶 + 对假阴性的厌恶)
布莱克斯通的 10 : 1 代进去,得到 0.91——也就是说,有罪概率要超过 91%,才该定罪。
你刚才写的那个数,代进去就是你自己的证明标准。
一项针对美国联邦法官的调查
而本书作者之一罗伯特尝试估算过陪审员实际采用的阈值——
这个数似乎远低于 95%。
伯克利,一桩虚构的袭击案
一半的学生拿到的描述是:被告是伯克利一名 21 岁的学生。
另一半被告知:被告是伯克利一名 21 岁的失业者。
证据完全相同。
结果:「失业者」组更倾向于判定被告有罪。
而且——当被问到「把无辜的人定罪」和「把有罪的人放掉」哪种错误更严重时,
「失业者」组的学生认为:把自己的同学误判为有罪,后果比误判一个失业者更严重。
把 2×2 画成一张图
设定分数线并非科学或数学计算,而是一项政策层面的决定,是人类价值观的缩影,即哪种类型的错误是可接受的。
而且书补了一句更关键的:
并没有特别的理由认为科学家更擅长做这类权衡。
它能让一个很好的检查看起来很糟
《纽约时报》报道:在几种罕见病的检查中(如迪格奥尔格综合征、4p 部分单体综合征),
检查结果呈阳性的人里,实际上是阴性的比例,高达 81% 到 93%。
那这些检查是不是废物?
绝大多数接受检查的人并没有这些罕见病。
所以就算检查本身挺不错,你观察到的假阳性数量,也会超过真阳性——
因为不存在那么多可供发现的真阳性。
这个东西叫基础率:信号实际存在的百分比。算它的工具叫贝叶斯法则。
故意容忍高假阳性率——宁可虚惊,不要漏掉。 它的任务不是确诊,是把人群缩小。
只对初筛阳性的人做。成本高,但误诊率低。
对初筛阳性的人进行费用高昂的二次检查,能极大地纠正初次误诊的错误。
所以假阳性率高的初筛,不但不是废物,还是整套体系里不可替代的一环。
2×2 表格常常只有一半能看见
「你们非常棒,是精英中的精英。」
这是实话。 但招生委员会心知肚明:名单往下再拉长一截,还能再录一大批优秀学子。
那些没被录取的人,到底是不是一个错误?
永远不会知道。 我们看不到那个「录取了他们」的平行世界。
关于「精神科医生和假释委员会能不能判断谁危险」的争论,吵了很久
然后发生了一件事:严重的预算不足,部分看守机构不得不释放所有人。
即使精神科医生判定某些人「过于危险,不应释放」,州政府的回答是:
「好吧,我们不在乎你的意见,总之我们要释放他们。」
于是那一格被打开了。结果是:
大多数被判定为「危险」的人,在接下来的 3 年里没有再犯任何暴力罪行。
学过统计的人,这一节会很解气
p 值的意思是:在事实上不存在任何关联的情况下,检测到你所观察到的这种强度的关联的概率。
两个数相差 0.002。一个能发论文,一个不能。
我们凭什么认为这两个数据,一个很重要,另一个不重要?
老一辈统计学家定了它。按照惯例,这个决定是为了避免假阳性,而不是假阴性。
也就是说——统计学的默认设置里,已经装了一个价值判断。
原则上,你完全可以主张用更高或更低的临界值。
社会干预的效果测量:样本小、噪声大,再加一道防假阳性的严苛阈值——
真实但微弱的效果,永远达不到 p < 0.05,于是被弃如敝屣。
而要不要改这个默认值,书说:是一个价值判断的问题。
先试,再看结果,再回头优化。 立法者的版本叫「日落条款」——到期重新评估才续拨款。
副作用:日落条款会刺激各党派歪曲证据,来支持或反对某个项目续命。
再等等,多收点证据。经济不明朗时推迟买房或跳槽;医生等检测结果更明确再决定要不要做侵入性治疗。
市长收到洪水预警,要不要疏散。军官发现闯入限航区的飞机,要不要开火。
陪审员不能说「法官大人,我们有 82% 的把握」。
这句话悄悄跳过了一步。
书明确说:有令人信服的科学证据证明封控可以减少病毒传播。 这一句是事实。
但还要把这个风险和封控造成的危害(经济、教育、心理)放在一起权衡。
这并不意味着政府采取封控措施是科学所授意的。
证据说两边各有多重。哪边更值得避免,科学不回答。
我们学会了报概率、学会了校准、学会了分辨信号和噪声、也学会了在两种错误之间明码标价。
你量一扇门,量十次取平均,随机波动就抵消了。
可要是你手里那把卷尺,洗过水之后缩了 3 毫米呢?
量一万次,那 3 毫米还在。
第 9 章:统计不确定性和系统不确定性
| → ↓ 空格 | 下一页 |
| ← ↑ | 上一页 |
| Home / End | 首页 / 末页 |
| N | 讲稿面板 |
| O | 缩略图总览 |
| F | 全屏 |
| P | 讲义模式(可打印) |
| Esc | 关闭浮层 |
| ? | 本帮助 |