先查分母,不要先改结论。分组后结论与总体相反,通常意味着你比较的不是同一批对象、同一段时间或同一种口径。把每个分组的分子和分母摊开,确认谁进入了分母、谁被排除、时间窗是否一致,往往就能找到反转的来源。下面用一份假设的月度流量表为例,说明具体怎么查。
假设你手里有一张按渠道拆分的月度表:总体转化率从上月 3.0% 升到 3.2%,但搜索、推荐、广告三个分组各自都在下降。这种“总体涨、分组跌”并不矛盾,它最常见的解释是结构变化——高转化分组在总体中的占比上升,把总体均值拉高了。这就是辛普森悖论的典型形态。
要区分两种可能:一是分组内部真的变差,只是被结构掩盖;二是分组本身的口径变了,比如某个渠道的统计范围调整过。判断方法是先固定分组定义,再分别看每个分组的分子、分母绝对值,而不是只看比率。
分母是“谁被算进来了”。不同来源的分母往往定义不同:
把三个口径的分母并排列出,看它们是否指向同一批访问。如果搜索分组的分母只统计了部分落地页,而总体分母包含全部页面,两组比率本来就不可直接比较。这一步的动作是:为每个分组写明“进入分母的条件”,写不出来就说明口径没定义清楚。
反转经常来自时间错位。假设总体数据取的是自然月,而某个分组取的是滚动 30 天,两者覆盖的日期不同,比率自然对不上。另一种情况是去重规则不一致:总体按访客去重,分组按会话计数,同一用户多次访问会让分组分母偏大。
可执行的处理是:把所有分组统一到同一时间窗和同一去重单位,再重算一次。如果重算后反转消失,说明原来的结论是口径造成的,不需要进一步归因。如果反转仍在,才进入下一步查分子。
分母对不上,不等于数据错了。还有几种合理解释需要排除:
用证据区分它们:调出分组的绝对访问量和绝对转化数,看变化来自分子还是分母。如果某分组转化数没变、访问量骤降,那更可能是分母被过滤,而不是转化能力下降。请求量或抓取量归零也不能单独证明处理正确,它同样可能是采集延迟、权限变更或过滤规则生效造成的。
假设你确认反转来自结构变化:高转化分组占比上升。那么下一步不是去优化低转化分组,而是先决定是否要按占比加权后再比较。若目标是评估各渠道自身表现,就固定分组口径、分别看趋势;若目标是解释总体变化,就做结构分解,量化占比变化贡献了多少。
把这次用到的分母定义、时间窗、去重规则记录到分析模板里,下次出现反转时直接对照,能省掉大半排查时间。结论能否成立,取决于分母是否可比,而不是比率本身好不好看。