检查效劳器状态不可只看效劳器是否能登录,而应依次确认外部可达性、端口监听、效劳历程、CPU与内存、磁盘空间、应用响应和系统日志。远程会见失败时先判断网络路径;可以登录效劳器时,再从资源、效劳和应用层逐级缩小故障规模。
效劳器状态检查的有用顺序是“先外部、后内部,先基础设施、后营业效劳”。单独看到历程正在运行、端口处于监听或主机可以 ping 通,都不可直接证实营业正常,由于效劳可能已经卡死、依赖组件异常,或者请求在反向署理和应用层失败。
检查效劳器状态时,第一步是把问题归入网络、主机、效劳或应用中的一个主要层级,阻止一最先就重启效劳而丧失现场信息。
远程可达性检查可以先区分“请求没有抵达效劳器”和“请求已经抵达但效劳没有处置惩罚”两类问题。ICMP测试失败纷歧定代表主机宕机,由于防火墙可能榨取 ping;端口毗连失败则需要进一步审查监听状态、会见控制和网络战略。
网络连通性检查显示主机可达但营业端口欠亨时,优先进入效劳器内部检查效劳是否启动和端口是否监听。网络连通性检查显示端口可通但页面或接口异常时,应阻止重复修改防火墙,转而检查应用日志和依赖效劳。
效劳器资源检查需要同时视察使用率、期待时间和一连趋势,瞬时占用较高并纷歧定是故障,但资源恒久靠近上限通;崛眯Ю统薄⑴连群集或历程被系统终止。
Linux常用下令:uptime 审查运行时间和负载;top 或 vmstat 1 5 审查CPU、内存和期待;free -h 审查内存;df -h 与 df -i 审查容量和inode;ss -s 审查毗连概况。
Windows常用下令:Get-Process 审查历程;Get-Counter 获取CPU、内存和磁盘计数器;Get-Volume 审查卷空间;Get-NetTCPConnection 审查TCP毗连。下令效果需要连系故障爆发时间,阻止把正常的准时使命误判为异常。
效劳状态检查要同时确认效劳治理器状态、历程状态和监听端口,由于“效劳已启动”只体现启动下令没有连忙失败,不代表历程仍在事情或能够处置惩罚请求。
效劳历程检查发明重复重启时,应先审查退出缘故原由、设置变换、权限、证书、依赖组件和资源限制。设置文件有专用语法检查下令时,先举行设置校验,再决议是否重载或重启;不要在没有保存日志的情形下一连重启。
应用层检查比端口检查更靠近用户真实体验,应用层检查应验证请求是否返回预期状态、响应时间是否稳固、要害数据是否完整,以及依赖的数据库、缓存、新闻行列或第三方效劳是否可用。
Linux日志检查:journalctl -p err -b --no-pager可审查本次启动以来的过失;针对详细效劳可使用journalctl -u 效劳名 --no-pager。Windows可使用Get-WinEvent读取系统和应用事务日志,再按故障时间筛选。
效劳器故障处置惩罚应先保存现场,再执行影响较小的操作。纪录历程、端口、资源、日志和设置转变后,才华判断重启是否真正解决问题,也能阻止故障重复时缺少比照依据。
| 征象 | 优先检查 | 常见缘故原由 | 先执行的行动 |
|---|---|---|---|
| 主机和端口都无法会见 | 网络路径、主机电源、云平台状态 | 网络中止、主机宕机、会见控制阻挡 | 保存客户端测试效果,核对网络装备和带外治理信息 |
| 主机可登录但营业端口欠亨 | 效劳状态、监听地点、防火墙 | 效劳阻止、监听过失、规则变换 | 审查效劳日志和监听端口,再举行设置校验 |
| 端口可通但请求超时 | CPU、内存、线程池、毗连池和下游依赖 | 资源耗尽、慢盘问、依赖效劳延迟 | 纪录资源快照和慢请求,再定位壅闭环节 |
| 磁盘靠近满或已经写满 | 大文件、日志、暂时文件和inode | 日志增添、备份群集、暂时文件未整理 | 确认可清静整理的文件,阻止直接删除正在使用的数据 |
| 效劳频仍自动重启 | 退出码、内核纪录、设置和内存限制 | 设置过失、历程瓦解、内存缺乏、依赖不可用 | 先保存最克日志和历程状态,再修正根因 |
再次检查效劳器状态时,应重复验证外部毗连、端口监听、效劳历程、资源曲线、应用响应和新增日志。短暂恢复不即是故障竣事;若是效劳恢复后资源继续上涨、过失日志继续增添或响应时间再次恶化,就需要继续追踪触发条件,而不是仅纪录一次“效劳已启动”。