先别急着继续找支持它的证据,而是把假设改写成一句可被推翻的陈述,再问:如果它是错的,哪个指标、哪个分组、哪个时间点会先露出矛盾?能提前说清“看到什么就放弃它”,这个假设才算可检验。反证问题的作用不是证明假设成立,而是把保留、改写和退出三种动作分开。
模糊假设通常长这样:“留存下降是因为新用户质量变差。”它几乎无法被反驳,因为任何数据都能被解释成质量差。可检验的写法要包含对象、比较和方向,例如:“如果留存下降主要由新用户质量变差造成,那么同一获客来源内部、按注册周对齐后,新用户次周留存应低于老用户,且差距在获客量没有明显变化的周同样存在。”
改写后立刻能看出需要什么证据:同一来源内的分组、对齐的时间窗、以及一个不依赖总量的比较。反过来,如果差距只在获客量激增的周出现,而在量平稳的周消失,那“质量变差”就不是唯一解释,更可能是流量结构或承接能力变化。
一个反常结果往往能列出三四种解释。构造反证问题的关键,是让不同解释对同一份证据给出相反预期,而不是各自找一堆支持材料。可以按下面顺序操作:
假设例子:某功能入口的点击率一周内从平稳转为明显下滑。解释A是入口位置改动,解释B是同期流量来源变化。反证问题可以设计为:按来源分组后,如果各来源的点击率同步下滑,位置改动更值得保留;如果只有某个来源下滑而其他来源平稳,来源结构变化更值得保留。这里的数字只是说明比较方法,不代表任何真实项目结果。
三种动作对应不同前提,不要等到看完所有报表才决定。
一个实际动作是:在动手拉数前,把判定规则写进分析笔记,注明“若A组与B组差异方向相反,则退出当前解释”。这样做的结果是,后续看到任何结果都有对应的下一步,而不是反复调整故事。若规则被触发为退出,下一步应转向检查数据口径和采集链路,而不是继续加维度。
第三方估算流量、搜索引擎报告与站内统计的口径不同,直接相减或相除很容易制造出假的反常。反证问题在这里应该先问:这两个数是否覆盖同一批对象、同一时间窗、同一事件定义?如果答案是否定的,那么“某指标下降”不能单独证明某个解释成立,也不能单独证明处理正确。
可核对的证据链通常包括:原始事件定义、去重规则、时间对齐方式、以及分组前后总量是否守恒。例如站内统计显示某页面访问下降,但搜索引擎报告显示曝光平稳,这既可能是点击率变化,也可能是统计口径或跳转链路变化。此时合理的反证问题是:如果只是统计口径变化,那么同一批用户在另一条可比的路径上应出现对应变化;如果没有,就不能把口径当作唯一解释。
最后把问题压缩成一句可执行的话:如果解释X成立,那么在分组Y上应看到Z;若看到非Z,则退出或改写X。 这句话要能直接对应一个查询、一张分组对比或一次口径核对。执行后,结果只有三种去向:保留并继续、改写并重设规则、退出并转向数据质量或其他原因。把这三步写清楚,比堆更多指标更能帮助判断,也能避免把统计相关当成因果。