1.
SSH无法连接与安全组配置
(1)问题表现:22端口超时或连接被拒绝,经常因安全组未放行或本地IP发生变更导致。
(2)排查步骤:在阿里云控制台检查实例安全组入方向规则,确认协议TCP、端口22已允许。
(3)快速修复:临时在安全组新增来源为0.0.0.0/0的TCP 22,确认能连后收紧为业务IP段。
(4)案例:客户案例A,ECS规格 ecs.c6.large(2vCPU 4GB,系统盘40GB,公网带宽1Mbps),因为安全组只放行了80端口导致SSH断连,放行22后恢复。
(5)补充建议:使用阿里云控制台“会话管理”或云盾急救系统做无网断操作,并开启密钥对登录和禁止root直接密码登录。
2.
带宽/计费异常与限速问题
(1)常见状况:突发流量导致带宽峰值耗尽,出现丢包或TCP重传。
(2)监控项:通过云监控查看实例公网入出流量、带宽占用和包丢失率,设定告警阈值(例如90%带宽持续5分钟)。
(3)应对办法:升级公网带宽或购买按天按量的突发带宽包,必要时开通阿里云DDoS基础防护。
(4)数据示例:某电商促销期间,带宽由1Mbps瞬时飙升至80Mbps,启用弹性公网带宽并将实例从1Mbps扩容至50Mbps后90%请求正常响应。
(5)计费注意:核对按量计费项(公网流量按GB计)与带宽峰值包月费用,避免未授权的流量产生高额账单。
3.
域名解析与DNS生效延迟
(1)问题点:域名解析修改后TTL未清导致旧IP缓存。
(2)解决流程:提前将TTL调低至60秒,修改记录并验证解析(dig +short example.com @8.8.8.8)。
(3)实战建议:在切换服务器前72小时内将重要记录TTL降至60-300秒,切换后再恢复到默认值。
(4)案例:客户B将A记录从1.2.3.4切换到5.6.7.8,TTL原为3600导致1000用户仍访问旧机,通过降低TTL并等待TTL过期解决。
(5)工具:使用nslookup/dig以及阿里云解析记录的“解析线路/解析权重”功能做灰度切换。
4.
CDN缓存与静态资源加速配置
(1)痛点:更新静态文件后用户仍看到旧内容。
(2)快速方法:使用CDN刷新(目录或文件)并设置合适的Cache-Control:max-age=86400或根据需求短期缓存。
(3)命令示例:在发布脚本中加入cdn刷新API调用或使用带版本号的文件(如 app.v20260728.js)。
(4)案例数据:某门户站点接入阿里云CDN后,静态资源响应延迟从320ms降到45ms,带宽峰值压力减小约70%。
(5)最佳实践:对HTML设置较短缓存或不缓存,静态资源走长缓存并使用版本号;启用gzip、Brotli压缩并配置Header。
5.
DDoS防御与高可用策略
(1)常见攻击:SYN Flood、HTTP GET洪水、UDP泛洪。
(2)防护手段:购买阿里云Anti-DDoS(基础/专业)并配合WAF规则限制异常请求频率。
(3)高可用设计:多可用区或跨地域部署,使用SLB负载均衡并结合健康检查与自动扩容。
(4)真实案例:一次HTTP洪水峰值达350K QPS,启用Anti-DDoS专业后将恶意流量清洗至20K QPS,业务可用率恢复至99.95%。
(5)建议:定期做流量白名单与黑名单评估,结合日志分析(ELK)制作攻击指纹。
6.
备份、快照与恢复演练
(1)备份策略:系统盘做镜像/快照,数据盘每日快照并异地归档;保留周期视RPO/RTO而定。
(2)演练频率:至少每季度一次完整恢复演练,验证快照可用性与配置脚本。
(3)示例配置:ECS实例 ecs.c6.large,系统盘40GB每日快照;业务库使用RDS备份并开启Binlog。
(4)恢复步骤:从最新快照恢复新实例,更新安全组和弹性IP,完成DNS切换。
(5)注意事项:快照并非替代异地备份,重要数据应定期导出并存储到对象存储OSS。
| 型号 |
vCPU/内存 |
带宽 |
典型场景 |
参考月费(人民币) |
| ecs.t6.small |
1/2GB |
1Mbps |
小型网站/测试 |
约100元 |
| ecs.c6.large |
2/4GB |
1-10Mbps |
中小型应用 |
约300元 |
| ecs.g6.4xlarge |
16/64GB |
按需 |
高并发服务/缓存节点 |
按配置计费 |
来源:运维实践 阿里香港云服务器租期间常见问题与快速解决办法