本文提供一套可落地的运维方法,覆盖探针布局、指标选取、阈值与抖动策略、告警分级与自动化恢复,帮助团队在面对 台湾 CN2 专线时提升整体可观测性与链路稳定性,并缩短故障定位与恢复时间。

首先明确监控目标:业务链路、BGP 会话、物理接口、MPLS/LSP 状态与上游出口。对每一路由口同时采集延迟、丢包、抖动、带宽利用率与错误帧,结合路由变动与告警日志,建立全栈视图,避免只看单一指标导致盲区。
建议在本地边缘、防火墙后、核心汇聚与对端 PoP 各部署主动探针与被动采集:在本地放置合成探测(ICMP/TCP/HTTP)与被动 NetFlow/tcpdump,在对端与中间点部署轻量探针以实现端到端视角,能快速定位是本地、上游还是对端问题。
对关键业务链路每端至少 2 个合成探针,关键节点增至 3~5 个冗余探针;采样频率对延迟/丢包建议 10~30 秒一测,对流量采样(sFlow/NetFlow)可用 1:1000 或 1:2000 以平衡开销与精度。高频问题可临时提升采样。
主动监控(合成事务)能稳定复现延迟与连通性问题,被动监控捕获真实流量与异常流向。两者结合可在合成探测告警时用被动数据回溯包痕迹,确认是否受流量突增、黑洞或路由波动影响,从而避免误报。
采用多层阈值:临界(短暂抖动)与严重(持续影响)。如延迟阈值设为 100ms(临界)与 200ms(严重),丢包 1% 与 5%。使用窗口化检测(例如 3/5 次触发)与抑制策略(恢复必须稳定 N 次),并按业务重要性分级告警与通知渠道。
推荐使用 Prometheus + Alertmanager/Grafana 作为指标与告警前端,配合 Zabbix 或商业 NMS 做设备层面的 SNMP 检测。通过 Alertmanager 的路由与抑制规则实现告警分级;对常见故障接入自动化脚本(Ansible、Salt、自定义 webhook)执行恢复或收集诊断包。
构建标准化的 runbook:告警触发 -> 自动抓包/合成测试 -> 自动化上下文(BGP 路由表、MPLS 标签)抓取 -> 指定抄送链路给上游 ISP。使用 BFD 快速检测链路死活,使用 IP SLA 或合成事务验证切换后业务可达性,减少人工沟通时间。