能不能连接,取决于旧曲线和新数据源之间有没有一条可复算的“公共刻度”。如果历史点位是用旧来源的抓取量、索引量或排名位置直接落库,而新来源对这些量的定义、采样时点和去重方式不同,那么曲线在切换点必然出现断口,即使工具界面把两条线画在一起,也不代表它们可比。对已经尝试过导出重传、改时间轴仍失败的情况,通常遗漏的条件是:没有先建立一段新旧来源同时存在的重叠期,用来校准差异,而不是直接拼接。
假设一个情境:某团队用一款百度搜索引擎优化软件跟踪一批页面的收录与排名趋势,原数据源停止返回后换成另一来源,图表上旧段仍在、新段从切换日开始,中间出现一段空白或数值跳变。此时要区分两种原因。
判断动作:取切换前后各一周,把两段数据按同一时间粒度对齐,观察差异是随机的还是成比例的。若差异稳定成比例,属于口径断裂;若只是切换当天缺值,属于数据缺失。这个结论决定下一步是补数还是换算。
如果两个来源在切换前后有一段同时可用的时间,这段重叠期就是校准依据。具体做法是:在重叠期内,对同一批页面、同一时间点分别取新旧来源的数值,计算比值或差值的中位数,而不是用单点相减。中位数能降低个别页面异常带来的干扰。
假设重叠期为十天,旧来源数值普遍是新来源的1.2倍,且这个比例在头部页面和长尾页面上大致一致,那么可以把旧段乘以换算系数后与新段连接,并在图上注明“已按重叠期校准”。如果比例在不同页面类型间差异很大,说明两个来源的统计对象不同,此时不应强行换算,而应把旧段保留为独立参考线,新段另起一条。
这个动作的结果直接影响下一步:可换算时,历史曲线能继续用于趋势判断;不可换算时,历史段只能作为背景,不能和新段做同比或环比。
常规做法里最容易被跳过的是时间粒度和去重逻辑。百度搜索引擎优化软件展示的曲线通常经过聚合,而聚合规则往往写在数据源侧而非展示侧。
这三项中任何一项不一致,都会让曲线在切换点产生看似“数据丢了”的跳变。逐一核对后,往往能定位到具体是哪一项导致断口,而不是笼统地归因于换源。
当重叠期不存在、或重叠期内差异无规律时,历史曲线不应被当作连续序列使用。可行的替代是:把旧段和新段分别标注数据来源与统计口径,只在新段内部做趋势比较,旧段仅用于说明“过去曾达到过的量级区间”,且必须带上口径说明。
如果业务上必须保留一条连续曲线,可以考虑重建:用新来源对历史时间段重新采集一次,前提是新来源支持回溯且回溯口径与当前一致。这一步的成本通常高于直接接受断口,是否值得取决于历史趋势是否用于对外报告或预算决策。
无论选哪种处理,都应在图表或报告中写明切换日期、来源变更和校准方式。缺少这行说明,后续读者会把断口误读为真实的流量或排名变化。具体到某一款工具的字段定义和回溯能力,需要以该工具当前文档或实际返回为准,不同工具之间不能互相套用。