台湾云服务器的SLA是合同中最重要的部分,签订前应明确至少三类指标:一是可用性(Uptime)百分比,如99.95%或99.99%;二是故障响应和恢复(RTO/RPO)时限,明确「响应启动时间」与「服务恢复时间」;三是性能保障,如带宽、IOPS、延迟上限。除此之外,要在SLA中写明计量口径(以哪个监控系统为准)、维护窗口时间及通知方式,以及当指标未达标时的补偿方式(例如按时长退款或服务延长)。在合同条款中对“例外情况”做出定义(例如不可抗力、客户配置错误),避免产生争议。
明确SLA数值、度量口径和补偿机制,并约定例外情形。
将补偿形式写成“小时计费退款”或“服务抵扣”,并设定申诉时限。
若是高可用业务,优先选择有多可用区或异地容灾方案的供应商。
与供应商商议时,要把响应时间细化为「首次响应」和「问题修复」两个层次,并基于业务影响分级:优先级P0(系统宕机/数据丢失、影响全部用户)、P1(关键功能不可用)、P2(部分功能异常)、P3(低影响或咨询类)。每个级别都应有明确的首次响应时间(例如P0:15分钟内,P1:1小时内),以及预计修复或缓解时间。还应明确工作时间界定:24x7支持与工作日支持差别、节假日响应机制,以及当供应商未按时响应时的升级链路和联络人名单。
合同中应列出分级联系人、电话/工单/邮件顺序,以及超时自动升级的触发条件。
约定远程处理能力与必要时的现场派遣时限(若有现场运维服务)。
规定以何种监控数据作为响应判断依据,若可能,双方共享监控或采用第三方监控作为仲裁。
清晰的责任划分能减少纠纷。与供应商商议时,要列明哪些运维任务由供应商负责(例如底层网络维护、硬件更换、宿主机补丁),哪些由客户负责(如应用部署、数据库调优、业务配置)。同时明确供应商拥有的操作权限范围:是否可以登录客户实例进行排查、用什么身份(例如代理账号)、操作记录如何保存和回溯。应要求供应商提供变更通知机制和变更审批流程,任何可能影响可用性的改动需提前通知并取得同意。
要求供应商按最小权限原则操作,并提供审计日志导出或定期安全报告。
规定变更窗口、回滚计划和变更后的验证步骤,避免单方面改动导致故障。
在合同附表中列出“运维责任矩阵(RACI)”,明确R(Responsible)和A(Accountable)。
故障处理流程要具体并可操作:包括故障上报渠道(API/工单/电话)、信息格式(影响范围、日志片段、复现步骤)、临时缓解措施、根因分析(RCA)时限和报告模板。沟通机制方面,要规定定期状态汇报频率(如每30分钟一次)、关键里程碑通知(确认、缓解、恢复、RCA提交)和最终报告内容。此外,应约定在重大事件发生后,供应商需安排专人负责联络,并在限定时间内提供正式的书面RCA与改进计划。
合同中应要求所有沟通保留记录,作为索赔和改进的依据。
建议把定期演练和恢复演习写入合同,明确演练频次与目标。
若支持,采用自动告警与工单系统并约定告警阈值与接收人。
赔偿条款要与SLA配套,包括违约金计算方式、最高赔偿上限以及触发赔偿的条件(非例外情况下的SLA违约)。就备份而言,要指定备份频率、保留周期、备份完整性校验与恢复演练,并明确备份数据的存放地点与加密措施。演练条款方面,约定定期(例如半年或年度)做恢复演练,演练范围(全量/增量)和验证指标(恢复时间、数据完整性)。另应规定在重大故障后双方应共同参与复盘,以及供应商需在限定时间内实施防范措施并提交改进计划。
明确索赔申请流程、所需证据、审核时限与争议解决方式(协商、仲裁或法院)。
若涉及敏感或合规数据,明确数据存放地域、访问控制与合规审计责任。
可考虑加入服务迁移支持条款,若提前终止或迁移到其他供应商时的协助细则与数据导出格式。