关键指标通常包括服务可用率(Uptime)、平均修复时间(MTTR)、平均故障间隔时间(MTBF)、网络延迟(Latency)、丢包率(Packet Loss)、抖动(Jitter)以及带宽保障(Throughput)。
其中,服务可用率直接关系到业务连续性,企业应争取商业级SLA,例如月度可用率99.9%或以上;MTTR决定故障恢复速度,常见承诺在数小时内;网络指标(延迟/丢包/抖动)则影响应用性能,尤其是实时语音、视频和跨境同步业务。
优先关注:可用率、MTTR、网络丢包与延迟,再评估带宽与QoS保障。
可用率通常以月度为单位计算:可用时间除以总时间。合同中需明确定义“可用”含义(例如控制面与数据面均可达),以及测量来源(运营商监控、第三方监测或客户自测)。
为避免争议,应约定监测窗口、判定标准(如连续包丢失多少秒视为不可用)、以及是否扣除计划内维护时间。建议采用独立第三方或双方共识的监测日志作为仲裁依据。
可用率计算周期:按自然月;计划维护提前通知时间:至少48小时;紧急维护例外需明示。
避免模糊定义,如“短暂中断”未界定,会导致补偿争议。
SLA应包含明确的故障响应等级(例如P1、P2、P3)和相应的响应时间与修复时间承诺。P1类紧急事件通常要求24/7响应与快速上报,并在约定小时内启动故障处理。
补偿机制一般采用“服务信用”的形式,按月度费用比例返还。合同中要明确计算公式、申请流程(是否需客户提交工单与证据)、以及补偿上限(通常不超过当月或年度费用的一定比例)。
示例:若月度可用率低于99.9%但≥99.0%,返还10%当月费用;低于99.0%但≥95.0%,返还30%;低于95%,返还100%(或允许合同终止)。具体比例可谈判。
规定证据要求与仲裁方式(双方指定第三方或仲裁机构),避免单方面判定。
SLA必须明确区分“服务方责任”与“不可归责”情形。计划内维护应有固定的维护窗并提前通知(通常48-72小时),维护时间应从可用率计算中豁免。不可抗力、客户网络或设备故障、第三方链路问题等应列为例外条款。
同时,应对紧急维护做出限定:只有在影响大面积用户或存在安全风险时才可临时执行,并需在事后提供详细报告与影响评估。
列出典型例外:自然灾害、政府行为、客户配置错误、第三方承载链路故障等;并明确由哪方承担责任与通知义务。
建议将常规维护安排在业务低峰时段,并提供回滚与测试机制。
SLA中应明确安全责任边界,包括防护措施(如DDoS缓解、入侵检测)、日志保存时长、事件通报流程与时间,以及数据加密和客户数据隔离机制。若涉及个人数据,应列明适用的隐私法规与配合义务(例如香港本地或跨境数据传输要求)。
此外,要求服务商提供定期安全审计报告或第三方合规证书(如ISO 27001)会更有保障。对敏感业务,还可约定应急恢复(DR)RTO/RPO目标与演练频率。
约定审计权限、频率与费用承担,确保企业在合规检查时可获得必要日志与证明。
明确安全事件通报时限(例如发现后1小时内初步通知,24小时内提供技术报告)与补救措施责任。
对接入点、跨境链路与边界设备进行单列SLA,可减少责任不清导致的索赔困难。