一个特别擅长找规律的大脑,会找出根本不存在的规律
索尔团队在智利看到的那条完美正弦波,论文已经送到了《自然》杂志。
今天揭晓。 但在那之前,先做一道题——
各 50 次。**哪一串是真的?**
编造的是 B。
编的人心里在想:连着放太多 H 或 T,看起来就不像随机了。他们试着放了几段连续的,但不够大胆——放到四连就觉得太刻意,赶紧收手。
而真正随机抛出来的结果,连续重复的程度出人意料地高。
看到一个规律,别问「这看起来像不像巧合」。
问:这个规律,在纯随机数据里出现的频率是多少?
前者是直觉,后者要算。统计学存在的一大理由就是替你算这个。
你开一家店
你发现:存货连续 5 周,每个周四都卖光了。
你的第一反应是进更多货,压在周四。
书的建议是:先去问统计学家一件事——「连续 5 个周四清仓,纯属随机巧合的概率有多大?」
如果那个概率并不低,你就省下了一批滞销品。
你看的数据越多,越容易被骗
下面哪种情况最令人惊讶?
差别只在一个数:总共抛了多少次。
而真正的麻烦是——
当有人发表一项新成果、或者你读到一些奇闻逸事时,你并不总能知道其「抛硬币」的次数。
事实上,做研究的人往往也不知道自己到底抛了多少次。
一个五年一轮的抛硬币游戏
按基金经理的「股票预测能力」排名
你会很自然地认为:排在最前面的那些人,投资技巧或知识确实更强。
那么,同一批人,接下来的五年(2018—2022)表现如何?
前五年的排名,和后五年的表现,几乎完全没有关系。
在第一个五年里表现出色的那些经济分析能力和投资直觉,到了第二个五年就失效了。
大多数人根本没意识到,每一分每一秒,有多少只基金同时在场上。
在这么多参与者里,必定会出现一批表现优异的和一批表现糟糕的——全凭运气,不靠技巧。
这就是为什么专家通常只建议买大型指数基金,不要去认购基金经理拼凑出来的组合。
一个滑坡,每一步都很合理
招募了 1000 名受试者
原假设: 每天服用阿司匹林,能降低心脏病发病风险。
然后你想:既然费这么大劲招了 1000 人,顺便测一下能不能降低患癌风险吧。
再想:既然都测癌症了,不如分开测肺癌和直肠癌。
再想:要不把哮喘也加上。
每一步都很合理。而你已经掉进陷阱了。
不是找一种模式,而是同时找好几种——噪声伪装成「你想找的那个」的机会就被不断放大。
书点名了两个真实案例:激素替代疗法、饮用水铅含量对人体影响。
两项研究的结论后来都备受质疑:加的变量太多,当初的设计撑不住。
在看数据之前,决定好你要检验哪些变量。定完就不许再加。
你当然可以研究很多变量——但那需要更多受试者,才能得到有统计功效的结果。
先说你要找什么,再去看。不能一边看一边改自己在找什么。
粒子物理学家怎么处理同一个问题
先坐电梯下到 100 米深
你会发现自己站在一条 27 千米长的环形隧道里,里面布满了数千个比公共汽车还长的电磁铁。
质子被加速到极致,顺时针的一束对着逆时针的一束撞上去。每次碰撞都炸成一锅粥——大量粒子向四面八方喷射。
绝大多数是早就认识的:电子、光子、缪子。
科学家要做的是:在数万亿次碰撞里,找出那个从没见过的。
它正好在预想的位置附近。
但这张图上,别的地方也有类似的凸起。
如果没有那条实线把它衬出来、没有箭头指着它——你分得出它和其他凸起有什么本质不同吗?
这个实验的造价,差不多 100 亿美元。
在环上的两个不同碰撞点,两支互相竞争的国际团队,各装一台大型探测器。
一台叫 ATLAS,一台叫 CMS。
同一时间公布各自的结果。
不许为了抢跑而提前公布没把握的东西。
于是他们宣布——
不是「我们发现了希格斯粒子」。
拿一张数据图给同事看,问一句:这上面的起伏,是真信号还是噪声?
模拟「如果希格斯粒子根本不存在,探测器会收集到什么样的数据」——图上所有起伏都由随机波动造成。
把 10 张图摆出来,其中夹着一张真实数据。你来挑哪张是真的。
挑错了,就说明你眼里那个「有趣的发现」不过是随机噪声。
你在图上看到的那个箭头,是画给读者看的。
物理学家当年没有箭头。 他们并不知道希格斯粒子的质量到底是多少。
也就是说,整个能量范围内的任何一个凸起,都可能是它。
这就是查看别处效应。所以他们事先把峰值的判定标准提高了——在比较两台探测器之前。
如果你打算把相亲对象的每一个随机肢体动作都当成「他对我有没有意思」的证据——
「哦,看,对方的一只脚尖隐约地指向了我,还微微翘起了左手小指……」
那你必须把判定标准提高,否则一定会过度解读。
真正该坚持的标准是:长时间的、火辣辣的眼神交流,而不是漫不经心的随意一瞥。
回到智利
想看看这颗脉冲星有没有变化
按预想,脉冲频率应该会变慢——因为脉冲星在每秒数千次的自转中,会以引力波的形式逸散大量能量。
第一晚:整晚守着望远镜。信号没有出现。
第二晚:回到望远镜前。信号回来了。
第三晚:信号又消失了。
然后他们注意到了一件事——
望远镜另一侧的穹顶处,装着一台用于其他研究的仪器。
那台仪器一开机,脉冲星信号就出现;一关机,信号就消失。
他们的光电探测系统灵敏到捕捉到了另一台设备泄露出来的信号。
那台设备泄露的信号频率,恰好就是他们期待的每秒约 2000 次。
泄露信号的偏差范围也恰到好处——校正掉地球自转和公转之后,它正好变成了一段完美的正弦波。
虽然我当时还很年轻,但好在身边都是经验丰富的杰出科学家,而且我们发现错误后做出澄清的速度足够快,人们并没有因此而过度指责我们。但我要说的是,当我所在的科研团队在十几年后发现宇宙正在加速膨胀的证据时,这个由于误读噪声而造成的严重错误又在我的脑海中清晰地浮现出来。
— 索尔·珀尔马特
宇宙膨胀团队在宣布之前,做完了他们能想到的全部交叉检查和测试,并对结果的置信水平做了量化。
然后他们宣布:宇宙的膨胀在加速,可能有一种未知的「暗能量」在主导。
这一次和上一次的区别在于——这个结果后来被多项其他测量支持。有些用了相同的技术,有些用了完全不同的三角测量方法。
这一章连着拆了三个「发现」,很容易让人走到全盘怀疑。
按这个标准,希格斯粒子也不该信——那也只是图上的一个凸起。
两者的区别不在凸起有多明显,而在于:
同一个凸起,配不同流程,可信度完全不同。
但小心是有代价的。
希格斯团队提高了标准,代价是可能错过真的发现。
筛查放宽了标准,代价是一堆虚惊。
这两种错误,不可能同时降到零。
那么,该怎么在它们之间选?——这个选择,其实不是科学问题。
第 8 章:两误相较,如何取其轻?
| → ↓ 空格 | 下一页 |
| ← ↑ | 上一页 |
| Home / End | 首页 / 末页 |
| N | 讲稿面板 |
| O | 缩略图总览 |
| F | 全屏 |
| P | 讲义模式(可打印) |
| Esc | 关闭浮层 |
| ? | 本帮助 |