判断一个机房网络性能应优先看三个核心指标:延迟(Latency)、丢包率(Packet Loss)和抖动(Jitter)。对实时应用(如语音/视频、金融行情)尤其敏感。
应测量从主要客户或用户地区到机房的平均RTT,关注峰值与95/99百分位延迟;同时了解路由路径是否经由稳定的主干和是否存在绕路。
询问历史丢包率数据及监控方式;对于关键业务,要求丢包低于0.1%或按SLA约定处罚机制。
带宽不仅看峰值,还要关注承诺带宽(Committed)与突发策略(Burst/Burstable),以及是否有流量整形或限速策略。
电力可靠性核心看双路供电、UPS配置、柴油发电机(Genset)容量与自动切换时间(ATS),以及电力冗余设计(如N+1、2N)。
确认UPS可支持多长时间的负载(分钟/小时),并核实发电机启动到承载的切换时间与负载能力是否可覆盖整个机房。
优先选择标注为N+1或更高冗余(建议2N用于关键业务)。同时查看是否有独立环网、双路市电输入。
要求机房提供发电机燃料保障时间、定期维护记录与自动补给计划,以降低长期停电风险。
网络冗余体现在多线接入、不同运营商的物理路径、BGP冗余策略与本地IX(Internet Exchange)互联情况,这直接影响可用性与延迟。
确认机房是否接入至少两家以上相互独立的ISP并支持BGP路由选择,检查是否支持社区路由与流量工程。
优选位于台北等互联网交换密集地区的机房,能直连主要CDN与云服务商,减少中转跳数与延迟。
评估运营商间故障切换时间、历史中断记录与是否在合同中有明确的切换与补偿条款。
可靠的机房应提供温湿度曲线、PUE(电源使用效率)、机柜功率利用率、各供电回路电流与电压历史记录,以及实时告警接口。
要求提供近期PUE值,定期公布能耗数据以评估散热与电力利用效率,PUE越低代表基础设施越节能且散热设计更好。
查看至少3—6个月的温湿度、电压波动与断电事件记录,判断是否存在频繁的过压/欠压或温控不稳的情况。
优先选择支持SNMP/API推送、提供实时告警(如电力异常、温度超限)的机房,便于托管方及时响应。
合同应明确网络可用率(如99.95%/99.99%)、电力可用率、最大容忍丢包、平均故障恢复时间(MTTR)与故障赔偿机制。
将可用率细分为网络层与电力层,并写入对应的服务信用(Service Credit)或金钱赔偿计算方式。
明确计划性维护的通知时间、频率与对业务影响的补偿,避免未经通知的维护影响生产环境。
若业务易受攻击,需约定DDoS防护能力、峰值吸收带宽与应急响应时长,以及在遭受攻击时的流量清洗策略与费用分摊。