07
第二部分 · 理解不确定性

看到不存在的规律

一个特别擅长找规律的大脑,会找出根本不存在的规律

第 7 章 · 约 55 分钟 · 《第三个千年思维》读书会

上次留了个悬念

索尔团队在智利看到的那条完美正弦波,论文已经送到了《自然》杂志。

今天揭晓。 但在那之前,先做一道题——

你来判

两串抛硬币的结果,一串是真抛的,一串是编的

A HTTHH HTTTT TTTHT HHTTH HHHTH
  TTTTT HTHHT HTTTT THHTH THHTH
B HTHHT HTTHT HHHHH THTTH THTHH
  TTHTH TTTTT HTHHT HTHHT HTTHH

各 50 次。**哪一串是真的?**

第7章 · 看到不存在的规律

真的是 A

编造的是 B。

编的人心里在想:连着放太多 H 或 T,看起来就不像随机了。他们试着放了几段连续的,但不够大胆——放到四连就觉得太刻意,赶紧收手。

而真正随机抛出来的结果,连续重复的程度出人意料地高

007-005

本章唯一要记住的那个动作

看到一个规律,别问「这看起来像不像巧合」。

问:这个规律,在纯随机数据里出现的频率是多少?

前者是直觉,后者要算。统计学存在的一大理由就是替你算这个。

007-007

一个不那么抽象的版本

你开一家店

你发现:存货连续 5 周,每个周四都卖光了。

你的第一反应是进更多货,压在周四。

书的建议是:先去问统计学家一件事——「连续 5 个周四清仓,纯属随机巧合的概率有多大?」

如果那个概率并不低,你就省下了一批滞销品。

007-008
第7章 · 看到不存在的规律

二、还有一重麻烦

你看的数据越多,越容易被骗

四选一

朋友告诉你:她连续抛出了 10 次正面

下面哪种情况最令人惊讶

  • A 她是唯一的玩家,总共就抛了 10 次
  • B 很多人一起玩,每人抛 10 次,都把结果告诉了你
  • C 很多人一起玩,每人抛 100 次,都把结果告诉了你
  • D 她是唯一的玩家,总共抛了 100 次
第7章 · 看到不存在的规律

结果一样,惊讶程度完全不同

差别只在一个数:总共抛了多少次。

而真正的麻烦是——

当有人发表一项新成果、或者你读到一些奇闻逸事时,你并不总能知道其「抛硬币」的次数

事实上,做研究的人往往也不知道自己到底抛了多少次。

007-036

三、第一个案例:基金经理

一个五年一轮的抛硬币游戏

2013—2017 年,美国顶尖共同基金

按基金经理的「股票预测能力」排名

  • 少数人的表现比平均水平高出约 4%
  • 大部分人和平均水平差不多
  • 其余人比平均水平低了约 10%

你会很自然地认为:排在最前面的那些人,投资技巧或知识确实更强

那么,同一批人,接下来的五年(2018—2022)表现如何?

007-037
第7章 · 看到不存在的规律

毫无关联

前五年的排名,和后五年的表现,几乎完全没有关系

在第一个五年里表现出色的那些经济分析能力和投资直觉,到了第二个五年就失效了

007-040

关键在于:有多少人在抛

大多数人根本没意识到,每一分每一秒,有多少只基金同时在场上。

在这么多参与者里,必定会出现一批表现优异的和一批表现糟糕的——全凭运气,不靠技巧。

这就是为什么专家通常只建议买大型指数基金,不要去认购基金经理拼凑出来的组合。

007-041

四、第二个案例:查看别处效应

一个滑坡,每一步都很合理

你设计了一项阿司匹林实验

招募了 1000 名受试者

原假设: 每天服用阿司匹林,能降低心脏病发病风险。

然后你想:既然费这么大劲招了 1000 人,顺便测一下能不能降低患癌风险吧。

再想:既然都测癌症了,不如分开测肺癌和直肠癌。

再想:要不把哮喘也加上。

每一步都很合理。而你已经掉进陷阱了。

007-045
第7章 · 看到不存在的规律

这就叫「查看别处效应」

不是找一种模式,而是同时找好几种——噪声伪装成「你想找的那个」的机会就被不断放大。

书点名了两个真实案例:激素替代疗法饮用水铅含量对人体影响

两项研究的结论后来都备受质疑:加的变量太多,当初的设计撑不住。

007-046

对策,书给了两条

分析之前先定死变量

在看数据之前,决定好你要检验哪些变量。定完就不许再加。

按变量数量反算样本量

你当然可以研究很多变量——但那需要更多受试者,才能得到有统计功效的结果。

换成日常话就是

先说你要找什么,再去看。不能一边看一边改自己在找什么。

007-047
第7章 · 看到不存在的规律

五、第三个案例:花 100 亿美元防这件事

粒子物理学家怎么处理同一个问题

日内瓦,大型强子对撞机

先坐电梯下到 100 米深

你会发现自己站在一条 27 千米长的环形隧道里,里面布满了数千个比公共汽车还长的电磁铁

质子被加速到极致,顺时针的一束对着逆时针的一束撞上去。每次碰撞都炸成一锅粥——大量粒子向四面八方喷射。

绝大多数是早就认识的:电子、光子、缪子。

科学家要做的是:在数万亿次碰撞里,找出那个从没见过的。

007-012
第7章 · 看到不存在的规律

数据图上有一个小小的凸起

它正好在预想的位置附近。

但这张图上,别的地方也有类似的凸起。

如果没有那条实线把它衬出来、没有箭头指着它——你分得出它和其他凸起有什么本质不同吗?

这个实验的造价,差不多 100 亿美元。

007-018

他们在造对撞机的时候就想好了

两台探测器

在环上的两个不同碰撞点,两支互相竞争的国际团队,各装一台大型探测器。

一台叫 ATLAS,一台叫 CMS

一个约定

同一时间公布各自的结果。

不许为了抢跑而提前公布没把握的东西。

007-019
第7章 · 看到不存在的规律

两台都看到了类似的凸起

于是他们宣布——

「类希格斯粒子」

不是「我们发现了希格斯粒子」。

007-023

物理学家平时怎么训练这项技能

互相考图

拿一张数据图给同事看,问一句:这上面的起伏,是真信号还是噪声?

生成假数据

模拟「如果希格斯粒子根本不存在,探测器会收集到什么样的数据」——图上所有起伏都由随机波动造成。

十选一

10 张图摆出来,其中夹着一张真实数据。你来挑哪张是真的。
挑错了,就说明你眼里那个「有趣的发现」不过是随机噪声。

007-024
第7章 · 看到不存在的规律

还有一个细节,容易被漏掉

你在图上看到的那个箭头,是画给读者看的。

物理学家当年没有箭头。 他们并不知道希格斯粒子的质量到底是多少。

也就是说,整个能量范围内的任何一个凸起,都可能是它。

这就是查看别处效应。所以他们事先把峰值的判定标准提高了——在比较两台探测器之前。

007-048

书自己给了一个不太正经的类比

如果你打算把相亲对象的每一个随机肢体动作都当成「他对我有没有意思」的证据——

「哦,看,对方的一只脚尖隐约地指向了我,还微微翘起了左手小指……」

那你必须把判定标准提高,否则一定会过度解读。

真正该坚持的标准是:长时间的、火辣辣的眼神交流,而不是漫不经心的随意一瞥。

书里的类比
007-048

六、谜底

回到智利

第二年,他们又去了智利

想看看这颗脉冲星有没有变化

按预想,脉冲频率应该会变慢——因为脉冲星在每秒数千次的自转中,会以引力波的形式逸散大量能量。

第一晚:整晚守着望远镜。信号没有出现。

第二晚:回到望远镜前。信号回来了。

第三晚:信号又消失了。

然后他们注意到了一件事——

007-051
第7章 · 看到不存在的规律

信号的有无,和另一台仪器的开关完全对得上

望远镜另一侧的穹顶处,装着一台用于其他研究的仪器

那台仪器一开机,脉冲星信号就出现;一关机,信号就消失。

007-051

三重巧合,每一重都恰到好处

灵敏度太高

他们的光电探测系统灵敏到捕捉到了另一台设备泄露出来的信号

频率恰好对上

那台设备泄露的信号频率,恰好就是他们期待的每秒约 2000 次

连多普勒偏差都对上了

泄露信号的偏差范围也恰到好处——校正掉地球自转和公转之后,它正好变成了一段完美的正弦波。

007-052
第7章 · 看到不存在的规律

虽然我当时还很年轻,但好在身边都是经验丰富的杰出科学家,而且我们发现错误后做出澄清的速度足够快,人们并没有因此而过度指责我们。但我要说的是,当我所在的科研团队在十几年后发现宇宙正在加速膨胀的证据时,这个由于误读噪声而造成的严重错误又在我的脑海中清晰地浮现出来。

— 索尔·珀尔马特

007-054

十几年后,那份谨慎换来了什么

宇宙膨胀团队在宣布之前,做完了他们能想到的全部交叉检查和测试,并对结果的置信水平做了量化。

然后他们宣布:宇宙的膨胀在加速,可能有一种未知的「暗能量」在主导。

这一次和上一次的区别在于——这个结果后来被多项其他测量支持。有些用了相同的技术,有些用了完全不同的三角测量方法

007-055

本章最容易被记岔的一处

✗ 「所以凡是规律都不能信」

这一章连着拆了三个「发现」,很容易让人走到全盘怀疑。

按这个标准,希格斯粒子也不该信——那也只是图上的一个凸起。

✓ 书要的不是怀疑,是流程

两者的区别不在凸起有多明显,而在于:

  • 两台独立探测器各自看到
  • 事先提高了判定阈值
  • 十选一训练眼睛
  • 只敢说「类希格斯粒子」

同一个凸起,配不同流程,可信度完全不同。

第7章 · 看到不存在的规律

这一章,回顾

  • 我们对「随机长什么样」的直觉是系统性错误的。真随机里全是看起来不随机的连串
  • 看到规律,别问「像不像巧合」,问:它在纯随机数据里出现的频率是多少
  • 同样的「连抛 10 次正面」,取决于总共抛了多少次。而你往往不知道这个数
  • 基金经理前五年排名和后五年表现毫无关联。他们不是骗子,这才是可怕的地方
  • 查看别处效应:同时检验的假设越多,噪声伪装成信号的机会越大
  • 对策:看数据之前定死变量,并按变量数量反算样本量
  • 希格斯:两台独立探测器、事先提高阈值、十选一训练、只敢说「类希格斯粒子」
  • 那颗系外行星是隔壁一台仪器漏出来的信号。它连多普勒校正都对得上
第7章 · 看到不存在的规律

下周就能用的四件事

  1. 看到「连续 N 次」的规律,先估一下:纯随机能不能造出这个
  2. 别人给你一个结论,问:你一共看了多少个指标?这个是不是挑出来的
  3. 数据复盘前先把指标定死,会上追一句:我们是先定的指标,还是看完数据才挑的
  4. 玩一次「十选一」:把你的真实图表和几张打乱重排的假图混在一起,让同事挑
第7章 · 看到不存在的规律

好,现在我们知道要小心了

但小心是有代价的。

阈值定得越高,你越不会把噪声当信号——但你也会漏掉更多真信号。

希格斯团队提高了标准,代价是可能错过真的发现。
筛查放宽了标准,代价是一堆虚惊。

这两种错误,不可能同时降到零。

那么,该怎么在它们之间选?——这个选择,其实不是科学问题。

第 8 章:两误相较,如何取其轻?

快捷键

→ ↓ 空格下一页
← ↑上一页
Home / End首页 / 末页
N讲稿面板
O缩略图总览
F全屏
P讲义模式(可打印)
Esc关闭浮层
?本帮助