你说的那个 70%,兑现了吗
发推的是一位德高望重的美国科学家
美国的新冠疫情将在 4 周内结束,官方通报的总死亡人数将低于 17 万。
后来的事大家都知道了。到这本书写作时,美国的死亡人数已经超过 100 万。
但这一页要说的不是他错了。
没有「我有 80% 的把握」。
甚至没有一丁点儿暗示,表明这个判断有可能是不全面的、是会错的。
根据证据的多寡来确定信仰的深浅……方为智者。
— 大卫·休谟
一个数字在组织内部走了一趟,变成了另一个数字
事故后的调查,翻出了一件事
NASA 官方发布的预测是:每 10 万次发射,会有 1 次失败。
但惨剧发生的五年前,NASA 自己专家的报告里写着:
「挑战者号」解体,正逢第 25 次发射。
1/29 和 1/100,000 之间的距离。
没有证据显示有人造假。 书的说法是:NASA 内部「肯定是发生了什么不为人知的事情」,让一个近乎百分之百悲观的风险评估,变成了一个极为乐观的预估。
这一章唯一要记住的概念
选一个:① 巴拿马 ② 苏伊士
然后——写下你对自己这个答案的把握,50% 到 100% 之间的一个数。
(50% 就是纯猜。)
你说 75% 把握的那些事,长期统计下来,应该有大约 75% 成真。
不多,也不少。
准确率低于你报的数字 → 过度自信
准确率高于你报的数字 → 过度谦逊
报 50% 时,实际正确率略高于 50%——他们懂的比自以为的多。
从此往右,实际表现一路落在对角线下方,而且差距越拉越大。
三个领域,三次同样的失败
任务:按月预测未来 6 个月的 DAX 指数
每次预测要划一个 90% 的置信区间——也就是说,专家认为指数十次有九次会落在这个范围里。
结果:
每一个月,DAX 指数的实际值,都完全落在大部分专家 6 个月前给出的区间之外。
在长达 26 个月的研究里,超过一半的时间段,区间能涵盖实际值的专家不到总数的一半。
你用来预测未来 6 个月 DAX 指数的那些东西。
行业经验、模型、数据。
你对自己这些知识的了解。
我这套东西,在什么情况下靠谱、什么情况下不靠谱、误差大概有多大?
德国那 350 位专家缺的不是知识,是元知识——他们对自己的知识盲区毫无概念。
任务:对 5 年和 10 年后的事件做「是 / 否」预测
比如:2016 年,普京还会是俄罗斯总统吗?
每个预测还要给一个 1–9 分的置信度。
两个结果:
预测对了的专家,置信度均值 6.5–7.6。
预测错了的专家,置信度均值 6.3–7.1。
两者之间没有显著差异。
一个人表现出的自信程度,不能用来判断他准不准。
它们在数据上就是不相关的。
光速 c 的测量史,1870 年 → 1960 年代
按理说应该这样:最早的误差棒很长,随着研究推进一点点变短,而且每一次新测量,都应该落在前一次的误差范围之内。
把历年的估值和误差棒画出来之后,他们看到的是:
估值四散分布。经常出现某项研究的结果,完全超出前一项研究给出的误差范围。
同样的问题也出现在:精细结构常数、普朗克常数、电子电荷、电子质量、阿伏伽德罗常数。
在经历了漫长的、有时甚至异常忙碌的工作之后,光速 c 的值终于稳定下来,达到了一个相当令人满意的「稳定」状态。
— 物理学家雷蒙德·伯奇,1941 年
有。而且原因很具体
预测 5 年、10 年后的事。
反馈:要等很多年,而且到时候没人回头核对。
后果:预测错了,职业生涯基本不受影响。
预报员说「明天有雨的概率 80%」——
长期统计下来,那些「80%」的日子里,确实约有八成下了雨。
反馈:明天就知道。
后果:校准得好不好,直接决定职业声望。
这个人做完判断,多久能知道对错?当天?三年后?还是永远不知道?
判断错了,他会付出代价吗?还是可以用「情况变了」一笔带过?
气象预报员、外科医生、扑克职业选手、期货交易员。
长期战略预测、宏观评论、各种「趋势分析」。这不是人品问题,是环境没给他校准的机会。
不只是因为它知道得多
这个节目的规则里藏着一个关键设计:
所以真正决定胜负的,不是「你知不知道答案」,而是——
你能不能在零点几秒内,判断出自己知不知道。
沃森的程序能实时完成这个自我评估,而且完成得非常出色。它很清楚自己的认知盲区。
你以为你在判断内容,其实你在判断语气
心理学家做过模拟实验:公开场合演一场「犯罪」,找真实的目击者出庭,让模拟陪审员来听。
结论:陪审员对证词可信度的判断,与他们感知到的证人的自信程度,存在相当显著的正相关。
不是证词的内容。是证人看起来有多确定。
这是人类默认的判据,而且它几乎不用花脑力——这正是它流行的原因。
研究发现:一旦一个自信满满的人被证明错了,他的自信就不再有分量了。 相信过他的人会感到被背叛。
反过来——一开始就报了低置信度的人,被证错时,可信度并不下降。
难点在于:你得能拿到「他到底准不准」的反馈。拿不到的时候,人就会偷懒,直接拿自信当准确。
想绝对不出错?简单。开一个足够宽的区间:
「我有 95% 的把握认为,他将获得 30%~70% 的选票。」
这句话基本不可能错。也基本没有人会觉得说这话的人是专家。
区间越窄,信息量越大,置信度就必然越低。
又要校准得好,又要有信息量——这就是专家真正的难处。
「我今天只允许自己发表 5 条意见,所以最好三思而后行。」——不要觉得你必须对自己不太了解的事发表看法。
「我有 75% 的把握……」或者至少「我认为很有可能……」
他承不承认自己可能错?他说不说自己可能错在哪?
一个说「我掌握的东西还不够多,无法提供确切意见」的专家,恰恰是可靠且值得信赖的信号。
本章一路在打过度自信,很容易让人走到另一头去。
校准曲线的左端已经说明了:报 50% 的人,实际正确率高于 50%——他们低估了自己。
过度谦逊同样是校准失败。它的代价更隐蔽:
目标不是「少说」,是说得对得上。
但还有一个更早的问题:
一条上下抖动的曲线,哪一段是真实的趋势,哪一段只是随机波动?
答案比想象中滑溜——同一段数据,对甲是噪声,对乙正好是信号。
第 6 章:从噪声中提取信号
| → ↓ 空格 | 下一页 |
| ← ↑ | 上一页 |
| Home / End | 首页 / 末页 |
| N | 讲稿面板 |
| O | 缩略图总览 |
| F | 全屏 |
| P | 讲义模式(可打印) |
| Esc | 关闭浮层 |
| ? | 本帮助 |