确定异常开始时间,核心是找到指标从正常波动进入持续偏离的那个时间点,而不是看到峰值的那一刻。常用做法是:先选定一个稳定基线,再用滑动窗口比对,最后回到原始日志或分维度报表确认第一个真正越界的样本。峰值时间、告警时间和异常开始时间经常不是同一个点,误把峰值当起点,后续排查方向就会偏。
网站数据监控里,同一个异常往往对应三个不同时间:
如果只看告警时间,容易漏掉更早的诱因;如果只看峰值,容易把已经积累很久的问题当成突发。判断方法是:把这三个时间都标在趋势图上,看哪个点最早出现持续偏离。
单看某个数值高不高,很难判断是否异常,因为流量、转化本身有周期波动。更可靠的做法是建立基线:取过去若干天同一时段的正常值,算出均值和波动范围。然后用滑动窗口逐点比对,找出第一个连续多个点都超出范围的时刻。
执行步骤可以这样安排:
这里的关键是“持续越界”。单个点偶然跳高,可能只是采样波动;连续越界才更可能是真实异常的开始。
聚合报表会平滑掉细节,分钟级甚至秒级的原始记录才能定位准确起点。确认时重点看:
举个例子(假设场景):某页面访问量在报表上显示上午十点骤降。回看原始日志发现,九点四十分起该页面的返回状态就开始异常,十点只是聚合报表显示的明显低谷。此时异常开始时间应记为九点四十分,而不是十点。这个判断只适用于能拿到原始记录的情况;如果只有小时级汇总,就只能精确到小时,并说明精度限制。
站内统计、搜索引擎报告和第三方估算流量的采集方式不同,同一异常在各自报表里的开始时间可能相差较大。比较时要注意:
因此,确定异常开始时间时,优先用粒度最细、最接近原始记录的那一份数据,再用其他口径交叉验证方向是否一致。如果几份数据给出的起点差异很大,先检查时区、统计周期和归因窗口是否统一,而不是直接采信某一个。
把异常开始时间固定下来后,立即截取该时间点前后各一段的完整数据,标注你使用的基线区间、检测窗口和判断依据。然后围绕这个时间点,去核对同一时刻的发布记录、配置变更、外部来源变化或采集任务状态,看哪一项与起点吻合。起点定得越准,后续要排查的范围就越小。