Linux 下 Ansible 怎么检测服务器健康状态

作者:袖梨 2026-07-13
Ansible 通过组合命令、模块和逻辑判断实现 Linux 健康检查标准化,聚焦三类检查:服务可用性(systemd 状态、端口监听、HTTP 响应)、资源阈值(CPU 负载、磁盘使用率、Inode)、日志异常(journalctl 时间窗口扫描),并支持自动化闭环处理。

Ansible 本身不直接提供“健康状态”的抽象概念,而是通过组合命令、模块和逻辑判断,把 Linux 健康检查的通用实践标准化、批量执行。关键不是“Ansible 怎么检测”,而是“用 Ansible 怎么可靠地执行三类检查”:服务是否真可用、资源是否够用、日志是否干净。

服务可用性:三重校验比单看进程更准

别只跑 systemctl statusps —— 它们容易误判。推荐在 playbook 中分步验证:

  • 查 systemd 状态:ansible all -m command -a "systemctl is-active --quiet nginx && echo ok" -c local,靠 $? 判断是否返回 0(active)
  • 确认端口监听:ansible all -m command -a "ss -tln | grep ':80' > /dev/null",用 ss 而非 netstat,避免高负载卡顿
  • 探测真实响应:ansible all -m uri -a "url=http://localhost/health method=GET status_code=200 timeout=3",URI 模块自动处理 HTTP 状态码和超时

系统资源:阈值驱动,不靠人盯

健康不是“看起来还行”,而是指标没越界。常用指标可封装为变量+条件任务:

  • CPU 负载:用 shell 模块读 /proc/loadavg,对比 {{ ansible_processor_vcpus }},例如 load1 > vcpus × 2 就告警
  • 磁盘使用率:运行 df -h / | awk '$5 ~ /[0-9]+%/ {sub(/%/,"",$5); if ($5 > 90) print $1,$5}',提取超 90% 的分区
  • Inode 耗尽风险:df -i / | awk 'NR==2 {if ($5 > 95) print "inode critical"}',尤其要防日志写爆

日志异常:按时间窗口扫描关键词

服务“活着但已瘫痪”最常藏在日志里。避免全量扫描,用 journalctl 限定范围:

  • 查最近一小时 Nginx 错误:ansible web -m command -a "journalctl -u nginx --since '1 hour ago' | grep -i 'error|fail|timeout' | head -n 10"
  • 统计 MySQL 日志错误频次:ansible db -m shell -a "journalctl -u mysqld --since '24 hours ago' | grep 'ERROR' | wc -l",结果大于 50 就触发后续动作
  • 匹配典型失败线索:grep 'No space left' /var/log/sysloggrep 'Connection refused' /var/log/messages

自动化闭环:脚本 + 条件 + 恢复动作

巡检不是只报错,而是形成“发现→记录→通知→尝试恢复”链路:

  • 把上述检查写进 shell 脚本(如 /opt/bin/health-check.sh),每项设明确阈值(如磁盘 >90%、curl 连续 3 次失败)
  • 用 Ansible 的 script 模块分发并执行:- script: /opt/bin/health-check.sh,结果存入 register 变量
  • when 和 Jinja2 测试语句做判断:when: health_result.stdout | search("CRITICAL"),再触发重启服务或清理磁盘等动作
  • 结合 cron 在被管节点上定期运行,或由 Ansible 控制节点定时调用整个 playbook

相关文章

精彩推荐