1.
准备与前置网络检查
- 登录:SSH 到
韩国云服务器(示例:ssh root@KR_SERVER_IP)。
- 检查网卡与速率:ethtool eth0;确认为1G/10G 并开启 ring/tx/rx 合适值。
- 放通端口并查看防火墙:ufw status 或 iptables -L;开放 iperf3 默认 5201 端口以便测试。
2.
基本工具安装
- Ubuntu/Debian 安装:apt update && apt install -y iperf3 mtr fping traceroute ethtool curl。
- 推荐长期监控工具:Prometheus + node_exporter + blackbox_exporter,或 Zabbix agent;Grafana 用于可视化。
3.
带宽测试(iperf3 TCP)
- 服务端:在韩国机上运行:iperf3 -s -D(以 daemon 方式运行)。
- 客户端(从中国或监控端发起):iperf3 -c KR_SERVER_IP -P 4 -t 60;-P 并发流数,-t 测试秒数。
- 结果解读:看 Transfer 与 Bandwidth。若接近 NIC 极限或有大差异,检查抖动/丢包或 ISP 限速。
4.
抖动与丢包(iperf3 UDP 模式)
- 服务端同上,客户端运行:iperf3 -c KR_SERVER_IP -u -b 100M -t 60(-u UDP, -b 带宽)。
- 输出包含丢包与 jitter(抖动)数值,例如 “Jitter: 0.123 ms, Loss: 10/10000 (0.10%)”。
- 多次测试并求均值,避免一次波动误判。
5.
路径级丢包定位(mtr/fping/traceroute)
- 使用 mtr:mtr -r -c 100 -i 0.2 KR_SERVER_IP 会给出每跃点丢包率与延迟分布。
- traceroute 可定位是哪一跳开始丢包:traceroute -I KR_SERVER_IP(使用 ICMP)。
- 若某一跃点持续高丢包,联系对应 ASN/上游运营商排查。
6.
ICMP 连通性与稳定性(ping 批量)
- 连续 ping:ping -c 200 -i 0.2 -s 1400 KR_SERVER_IP,观察丢包统计与 rtt 最小/平均/最大。
- 丢包计算:ping 输出的 “packet loss” 即总体丢包率;rtt 标准差可作为抖动参考。
7.
长期监控架构(Prometheus + blackbox_exporter)
- 部署步骤:在监控服务器安装 Prometheus、node_exporter 与 blackbox_exporter。
- blackbox_exporter config 示例(icmp)并在 prometheus.yml 添加 scrape job:使用 module: icmp。
- 指标与查询:blackbox_up (成功/失败)、probe_duration_seconds、probe_success。Grafana 用这些指标绘制丢包/时延曲线。
8.
告警规则示例(Prometheus Alertmanager)
- 丢包告警:expr: (1 - avg_over_time(probe_success{job="blackbox"}[5m]))*100 > 3 持续 5m 发送告警。
- 抖动阈值:avg_over_time(probe_duration_seconds{job="blackbox"}[5m]) > 0.1(即 100ms)报警。
- 带宽异常:通过 iperf 压测不适合频繁自动化,可结合流量采集(node exporter 或 sFlow)监控出口带宽占用。
9.
Grafana 面板与常用查询
- 建议面板:时延时序图、丢包百分比、UDP jitter 分布、出口带宽利用率。
- 常用 PromQL:rate(node_network_receive_bytes_total[1m]) 用于计算带宽;(1 - avg_over_time(probe_success[5m]))*100 计算丢包%
10.
故障排查流程(一步步来)
- 第一步:确定问题是持久还是短暂(查看历史面板/日志)。
- 第二步:从 mtr 查是哪一跳开始丢包,若在本地网络而不是上游,调整本端 MTU、关闭部分 offload。
- 第三步:重复 iperf UDP 测试确认抖动与丢包,必要时在不同时间、多点位并行测试确认是否为 CN2 路由问题。
11.
优化建议与注意事项
- 测试时注意不要超过服务器/链路允许的带宽,防止触发运营商限流。
- CN2 路由优势在于对华优化,遇到问题时同时提供 mtr/traceroute/iperf 输出给云商支持。
- 定期校准:每周或每小时做小样本测试,保存结果用于趋势分析。
12.
实用命令速查表
- iperf3 TCP:iperf3 -c SERVER -P 4 -t 60
- iperf3 UDP:iperf3 -c SERVER -u -b 100M -t 60
- mtr:mtr -r -c 100 SERVER
- ping:ping -c 200 -i 0.2 -s 1400 SERVER
13.
问:如何用 iperf3 快速判断是带宽不足还是丢包导致的低吞吐?
14.
答:先用 iperf3 TCP(-P 多流)测最大可达吞吐;若吞吐低,再用 iperf3 UDP 指定接近预期带宽(-b),观察输出的丢包与 jitter。如果 UDP 丢包高且 TCP 性能差,可能为丢包导致;若 UDP 丢包低但 TCP 不好,考虑 TCP 窗口/丢包重传或中间限速。
15.
问:mtr 报告中某一跳丢包高,是否就是问题所在?
16.
答:不一定。中间路由器可能对 ICMP 优先级低导致“看起来丢包”,但真正用户流量(TCP/UDP)不受影响。用 iperf/服务端日志做二次验证,再联系运营商确认。
17.
问:设定丢包和抖动的合理告警阈值是多少?
18.
答:经验阈值:丢包 <1% 良好,1-3% 警告,>3% 需处理;抖动(延迟抖动)<30ms 良好,30-100ms 视业务可接受性,>100ms 对实时语音/视频会有明显影响。可根据业务再微调阈值并加上持续时长判断。
来源:监测手册韩国云服务器cn2带宽 丢包率与抖动监控指标与工具