有一种误差,你量一万次它还在
大部分游乐设施要求身高 40 英寸
你翻出抽屉深处那把旧卷尺,给孩子量。
量出来刚好卡在线上。你手有点抖,一会儿觉得够了,一会儿觉得不够。
于是你想:多量几次取个平均,总能抹平手抖吧。
然后你想起来——
这把卷尺,好像被你塞在裤兜里丢进过洗衣机。
每次量出来的数在真值附近随机上下跳。
多量几次取平均,误差会互相抵消,越来越接近真相。
叫统计不确定性。
每次量出来的数都朝同一个方向偏。
量十次、量一百次、量一万次——那 3 毫米永远都在。
叫系统不确定性。
统计不确定性 / 系统不确定性
信度 / 效度
精确度 / 准确度
方差 / 偏差
一个所有人都经历过的版本
第一家:咦,比预想轻了 3 磅,这台秤怕是坏了。
第二家:哎呀,这台显示我重了 2 磅。
你想:这么多家酒店的秤,总不至于全部偏轻或全部偏重吧?
那把它们平均一下,应该就接近真实体重了。 —— 这个想法是对的。
回到家,你用自己的秤。它一直显示你比真实体重轻 5 磅,而你不知道。
你先以为是长途飞行脱水。结果连称一个月,还是轻 5 磅。
不管你称多少次,它都会一直轻 5 磅。
你为自己减掉的 5 磅欢欣鼓舞——你一两肉都没掉。
三步,第三步最有想象力
一英里训练 = 绕跑道四圈。教练要测第三圈的用时
做法很朴素:莎拉跨过起跑线,按下秒表;再跨过一次,按停秒表。
麻烦在于:这位教练反应总是慢半拍,永远比实际时间晚按。
这是系统误差——多测几次取平均,消不掉。
但是……
开始慢半拍,结束也慢半拍。
两个偏差方向相同、大小相同——在相减的那一刻,自己抵消了。
这不是运气。这正是科学家在设计测量时不懈追求的东西。
一个 5% 的系统偏差
(纸质选票)
对候选人一无所知时,人更倾向于投给排在第一位的那个。
排首位的候选人,通常能多拿约 5% 的选票。
(电话民调,调查员依次念出候选人)
结果完全反过来——
最后一个被提到的候选人,会获得更高的支持率。
加州州议员竞选发现了姓名排序的偏差,于是:先把候选人随机排名,再打印纸质选票。
每个人都有均等的机会排在第一位,听起来很公平。
书的原话是:如果你对「公平」的理解有些荒诞,会觉得这很公平。
但目标不是让每个人有均等机会享受那 5% 的错误,目标是把那 5% 的错误去掉。
正确做法是加州在州议员和国会议员选举里用的:选票以县为单位印制,候选人姓名按加州的 58 个县轮流调整。
这样,排序偏差在各县之间互相平均掉——和你在出差时用很多家酒店的秤取平均,是同一个动作。
本章赌注最大的案例
假设全世界的测温员都在下午最热的时候记录当天气温。
这当然有偏差——测出来的数会整体偏高。
但只要这个偏差一百年没变,它就不会影响我们对「气温变化了多少」的判断。
——和莎拉的教练两次都慢半拍,是同一个道理。
20 世纪初,气温记录者大部分来自欧洲和北美,数据严重偏向这两块。到了世纪中期,非洲、南美、亚洲的资料越来越多,分布才趋于均衡。
从世纪初到中后期,城市人口持续扩大,来自城市及周边的数据越来越多。而城市地区的气温本来就高于周边农村。
20 世纪初,美国国家气象局建议在日落前后采集数据。到了世纪末,美国大部分地区把测温工作转到了早晨(那时气温相对更低)。
有研究团队做了对照研究——索尔本人参与了这个项目。
做法:把一个世纪以来城市周边地区和农村地区的气温变化拿来对比。
结果:两者的差异,远没有达到令人担忧的全球温室效应的量级。
所以:城市化不是这条曲线的关键偏差源。 这一条被排除了。
20 世纪初的做法
从船上扔下一个水桶,装满海水拉上来,测桶里的水温。
二战前后,改了
在船只发动机冷却水的进水口放温度计。
两种方法测出来的数必然不一样——进水口的水来自海平面以下更深处。
那偏差有多大?
没人知道。 当时做记录的人从没想过将来有人要拿这些数据做百年对比,所以没做过交叉校准。今天连当时用的船都难以追溯了。
设计成两头抵消的形式(莎拉的教练),或者轮换(加州的 58 个县)。
量出这个系统效应有多大,它就从「未知的定向偏移」变成了「一个带误差棒的修正量」——而误差棒是可以平均的。
像城市热岛那一条:测完发现量级不足以影响结论,就可以把它放下。
书举了一对很有意思的对照:
考虑到全球气温变化可能带来的严峻后果——也许只有 75% 的把握,就该果断采取行动。
而当我们判断「资源的全球性转移会重创全球经济」时——可能要有 95% 的把握才会动手。
同一批科学,两个不同的阈值。 因为两边的错误代价不一样。
系统偏差听起来无解,但并不是
一次市长选举的民调
你担心第 15 页那两个系统偏差:纸面看名单,第一位占便宜;电话听名单,最后一位占便宜。
做法:把调查拆成两半——一半打电话,一半在网上以书面形式做。
这两种方法各自带一种系统偏差,而且方向相反。
如果你想发掘出可能扭曲测量结果的系统不确定性,或许就需要去主动接触那些会质疑测量结果的人(尽管这会令你很痛苦)。
书说得更重:科学家互相审视、严厉抨击彼此成果的传统,在寻找系统偏差这件事上的重要性,
甚至超过了科学家为此接受的所有专业训练。
老板对你写的东西做批判性修改、驳回你的建议时——
你能清清楚楚地意识到:这里有偏差,得改。
而当老板对你递交的任何东西都照单全收时——
你对偏差浑然不觉。你开始产生一种错误的自我评价:我值得更好的位置。
然后你据此做出了跳槽的决定。
「重复实验」「样本量大」被当成了数据可信的万能护身符。
家里那台秤称一万次,还是轻 5 磅。
书的原话:我们获得了一个令人满意且可复现的结果,但它始终与事实相差 5 磅。
可复现 ≠ 正确。
对系统偏差有效的只有三招:抵消、测出来、证明它不够大——每一招都要动脑子,没有一招靠加数据量。
概率、校准、信号与噪声、错误权衡、两类误差——
但你可能会觉得有点丧:世界这么复杂,认知这么有限,
我们真的还能解决什么大问题吗?
书接下来的回答,是全书语气最强硬的一部分。
第三部分 · 激进的「敢做能为」科学观
第 10 章:科学乐观主义
| → ↓ 空格 | 下一页 |
| ← ↑ | 上一页 |
| Home / End | 首页 / 末页 |
| N | 讲稿面板 |
| O | 缩略图总览 |
| F | 全屏 |
| P | 讲义模式(可打印) |
| Esc | 关闭浮层 |
| ? | 本帮助 |