判断网络能力首先看公网带宽与实际吞吐,关注的是
带宽(Gbps线路、峰值带宽)、网络延迟(RTT)、丢包率和抖动。优选支持多线接入或BGP的机房,并查询运营商到目标用户的链路质量。对于韩国节点,还要看是否有本地优质链路(SKB、KT、LG U+)与国际骨干连接。
要求:带宽峰值要>=预估并发*单连接平均流量,延迟低于目标用户容忍值,丢包率尽量接近0,并确认出口限速、端口并发限制和网络突发上行策略。
带宽标称值与真实吞吐常有差异,建议做ISP链路质量测试并结合CDN分流来降低单节点压力。
硬件影响并发能力的核心是CPU核数、单核性能、内存容量、I/O(SSD/ NVMe)和网卡规格(10/25/40Gbps)。
操作系统层面要做内核调优(tcp_tw_reuse、net.core.somaxconn、文件描述符限制等)、合理的文件描述符(ulimit)和网络队列(IRQ/中断亲和)设置,确保每秒连接数与并发连接上限充足。
至少确认:CPU核数与负载比、内存余量、磁盘I/O延迟、网卡速率、操作系统连接数与线程池配置是否满足峰值。
单机纵向扩展有极限,结合多机横向扩展与缓存(Redis/Memcached)能更稳定承载高并发。
判断重点看是否有多层负载均衡(L4与L7)、健康检查、会话保持策略及故障切换能力。架构上应支持无单点故障、自动扩容和流量削峰(CDN、缓存、队列)。
负载均衡器要能处理并发连接、快速探测后端实例状态,并支持连接保持与粘性策略(若业务需要)。同时后端服务应做无状态设计,方便弹性扩容。
确认是否存在:多可用区部署、自动伸缩策略、CDN分发、反向代理缓存与后端队列(如消息队列)用于削峰。
负载均衡层自身也需容量评估,必要时采用云厂商或第三方托管的高可用LB与流量清洗节点。
使用压力测试工具(JMeter、Locust、wrk、k6)模拟真实业务流量和峰值并发,建议测试并发为预期的1.5~3倍,并观测响应时间分位(P50/P95/P99)、错误率、CPU、内存、网络带宽和磁盘I/O。
结合APM与实时监控(Prometheus+Grafana、CloudWatch等)设置告警阈值,关注慢请求、连接积压、线程或goroutine爆满等信号。
运行压测时记录:成功率、吞吐(RPS)、延迟分布、资源利用率、后端数据库与缓存命中率,以及异常日志和系统指标。
压测需在尽量接近生产环境的网络条件下进行,且考虑峰值时段的外围影响(第三方API、认证服务等)。
评估服务器与机房提供的DDoS防护和安全能力,包括流量清洗(scrubbing)、速率限制、WAF、黑洞路由和网络层 ACL。确认服务商是否提供主动防护与按流量计费的清洗能力。
此外应用层防护(WAF、验证码、限流策略)和监控异常请求模式是必要补充,以便在流量异常时能快速触发防护规则并切换流量。
核实:供应商的防护带宽上限、清洗延迟、自动/人工响应流程、WAF签名能力与日志审计能力以及是否支持源站黑名单与速率控制。
单靠服务器级别防护不够,推荐结合云端DDoS清洗、CDN和WAF形成多层防护体系,并演练应急切换流程。