十九、为什么随机对照试验特别有力量?
前面的水晶例子其实已经把随机对照试验最重要的逻辑说出来了。它的力量并不来自“随机”“双盲”“安慰剂”这些词本身。真正重要的是,研究者主动设计条件,把几种可能解释尽量拆开。
如果两组人在开始时已经不同,我们不知道结果来自治疗,还是来自两组人的差别。如果患者知道自己在哪组,我们不知道结果来自治疗,还是来自期待。如果评价者知道分组,我们又不知道最后的判断有没有受到暗示。
随机化、盲法和对照,都是在逐层减少其他解释。随机试验强,并不是因为现实简单。恰恰相反,是因为现实太复杂,所以研究者主动创造一个比较干净的条件,让“改变了什么”和“结果变了什么”尽量能够对应起来。
二十、如果根本不能随机,因果关系还能研究吗?
很多真正重要的问题根本不能随机实验。我们不能随机让一半人开始吸烟几十年,然后看看谁得肺癌;不能随机制造一次核事故;也不能为了研究童年教育,把婴儿随机送进完全不同的家庭环境。如果“不能随机”就等于“不能研究因果”,那么医学、公共卫生、地质学、经济学和社会科学的大量问题都只能停在相关关系上。现实并不是这样。
不能随机时,科学会换一种办法:尽量寻找那些自然产生的比较。
例如,两个地区原本很相似,其中一个突然实施了一项政策,另一个没有。我们可以比较政策前后,两地的变化是否开始出现不同。又例如,某些规定刚好以一个年龄、收入或者日期作为分界线。分界线两边的人可能本来非常接近,却因为规则获得了不同处理。这种人为形成的差别,有时会提供接近实验的比较机会。
还可以沿时间追踪大量人群。如果吸烟者和不吸烟者在很多方面都不同,就尽量测量这些差别,再看不同人群、不同年代、不同国家中是否都出现相似关系。如果停止吸烟以后风险随时间下降,这又提供另一条线索;如果接触越多,风险通常越高,也提供新的信息;如果实验室、病理研究和生物机制又指向同一个方向,证据会继续增强。
这里没有任何一种方法能够像一次理想随机试验那样,一下子把其他解释全部清掉。真正的做法是:让不同方法犯不同的错误,再看它们是否仍然指向同一个结论。
一种观察研究可能受生活方式影响,一种自然实验可能只适用于某个地区,实验室研究又可能离真实人体太远。但如果这些来源完全不同的证据不断收敛,某一个隐藏因素同时解释全部结果会越来越困难。
所以“没有随机试验”绝不等于“只能凭感觉”。它意味着结论必须更仔细地说明:我们依赖了哪些假设?还有哪些其他解释?如果这些解释成立,应该还能看到什么现象?有没有另一种数据能够把它们区分开?
有些因果问题永远无法获得像理想随机试验那样干净的证据。但科学并不是在“完全证明”和“完全不知道”之间二选一。证据可以一层一层累积。