排查内部流量时误删真实访问,通常不是因为过滤规则本身写错,而是因为过滤条件把“同一来源特征”的真人访问也一起排除了。要判断有没有误删,不能只看过滤后总量下降多少,而应回到原始日志或原始事件表,按来源、路径、设备与时间四个维度做交叉核对,并保留一份未过滤的对照数据。下面以假设的站点日志为例,说明怎样把一份可疑的过滤结果转成可执行的处理方案。
内部流量通常通过 IP 段、公司网络出口、测试账号、特定 User-Agent 或固定设备标记来识别。误删往往出现在两类规则上:一类是范围过宽,例如把整个云服务商网段或整段办公区 IP 都排除;另一类是特征过泛,例如把包含“test”字样的 URL 或某个通用浏览器标识全部排除。
检查时先把过滤规则逐条列出,并标注每条规则命中的访问量。假设某条规则排除了一个 C 段 IP,过滤后该段访问全部归零。这时不能直接认定这些访问都是内部流量,因为同一段 IP 也可能包含通过代理、VPN 或共享出口进入的真实用户。合理做法是保留该段未过滤的原始记录,再检查其中是否存在登录、下单、表单提交等只有真实用户才会完成的行为。如果存在,说明该规则至少误删了一部分真实访问。
单看来源特征不足以判断,行为证据更可靠。可以把过滤前后的记录按同一会话 ID 或同一访客标识对齐,观察以下几类信号:
假设一份日志中,某个被排除的 IP 在过滤前有 40 次页面浏览和 1 次表单提交。页面浏览可能来自内部测试,但表单提交需要填写字段并触发后端写入,属于更强的真实访问证据。此时应把该 IP 从全量排除改为按路径或按账号排除,而不是继续整段删除。动作的结果是:过滤规则收窄后,内部测试流量仍可被识别,真实访问不再被一并移除,后续分析才有可用的分母。
误删有时不是规则导致的,而是对比时用了不同口径。站内统计、日志分析和第三方估算的统计范围不同,过滤前后如果切换了数据源,下降可能来自口径变化而非过滤本身。检查时要固定同一数据源、同一时间窗口、同一页面范围,再比较过滤前后的差异。
一个可执行的对照方法:取同一小时、同一批 URL,分别导出未过滤和已过滤两份记录,按来源字段分组计数。假设未过滤记录中某来源有 120 次访问,已过滤记录中同一来源只剩 0 次,而该来源在其他小时的记录中仍有转化行为,那么更可能是过滤规则过宽,而不是该来源真的没有真实用户。若过滤后总量下降但转化事件数量基本不变,也要警惕:这可能说明被删掉的主要是低价值内部访问,也可能说明转化事件本身没有按同一规则过滤,需要进一步核对事件表的过滤条件。
确认存在误删后,不要直接删除整条规则。更稳妥的做法是分三步调整:
假设调整后某个原本被排除的 IP 恢复了访问,但表现为固定间隔请求同一接口、没有页面跳转、没有静态资源加载,这更接近脚本行为,可以重新加入排除;如果恢复后出现多页面浏览、停留时间分布正常、并伴随表单或登录动作,则应保留。这个动作的结果直接影响下一步:保留则继续观察其转化贡献,重新排除则要记录新的判断依据,避免下次再凭单一特征整段删除。
样本量很小、访问来源高度集中或站点本身没有登录与转化事件时,行为证据会变弱,上述交叉核对只能作为参考。此时更可靠的做法是人工抽样查看原始日志中的请求路径与时间分布,而不是依赖自动规则。另外,如果内部流量与真实用户共用同一出口 IP,任何按 IP 整段排除的方案都会存在误删风险,应考虑改用账号标记、设备标记或请求头中的可控字段来区分。检查的目标不是让过滤后数字好看,而是让被保留和被排除的记录都能说清依据。