页面访问量里混入机器人或内部访问时,不必急着把所有异常流量一刀切删除。更稳妥的做法是先判断干扰来自哪里、影响哪些报表、是否改变了你要回答的问题,再决定是过滤、分组、标注还是保留观察。时间和人手有限时,优先处理会直接改变结论的那部分干扰。
机器人、内部访问和第三方估算口径是三种不同问题。机器人可能是搜索引擎爬虫、监控探针、采集脚本或刷量工具;内部访问通常来自公司办公网络、测试设备、员工手机或自动化任务;第三方估算则可能只是统计方法不同,并不代表你的站内数据错了。把这三类混在一起清洗,容易把真实用户也误删。
判断标准不是“看起来像机器人就删”,而是这条访问是否会影响你当前要回答的问题。例如,评估内容页的真实阅读趋势时,内部测试访问应当排除;评估服务器容量时,爬虫请求反而必须保留。
页面访问量本身不足以还原访问来源。站内统计、搜索引擎报告和第三方估算的统计口径不同,同一页面出现差异是常见现象,不能仅凭某一项数字断言“流量被机器人污染”。可以按下面顺序核对:
这里要区分“可能原因”和“已经定位的原因”。访问量突增可能是爬虫、内部压测、外部推广或统计口径变化,未完成日志核对前,不应断言唯一原因。例如,假设某页面在周二上午访问量翻倍,同时段服务器日志显示同一网段以固定间隔请求,且该网段属于公司办公网络,那么可以较有把握地归为内部访问;如果日志显示来源分散、user agent 杂乱,则更可能是外部机器人或刷量,需要继续观察。
处理方式主要有四种:过滤、分组、标注、保留观察。选择依据是干扰是否持续、是否可识别、是否影响核心结论,以及维护成本。
如果时间和人手有限,优先处理会改变决策的干扰。例如,你要判断某篇内容是否值得继续投入,内部访问和测试点击必须排除;你要判断服务器是否需要扩容,爬虫请求则应保留并单独统计。不要为了报表“好看”而清洗所有非人类访问,那会让容量评估失真。
可以按以下顺序执行,每一步都留下记录,便于回看判断依据:
检查项包括:过滤规则是否覆盖了移动设备和办公网络;分组视图是否仍能还原总量;标注是否写明了判断依据和日期。判断结果是,如果排除干扰后结论方向不变,说明干扰影响有限,可以保留观察;如果结论方向改变,说明必须先处理再分析。
下一步,选一个你正在看的页面访问量报表,按上述步骤标出本周最可疑的一段异常,并写下它是已确认原因还是待确认原因,再决定过滤、分组还是标注。