VRRP是Nginx集群实现VIP漂移的核心机制,通过虚拟路由器组、优先级选举和健康检查联动,确保故障时1~3秒内自动接管。
在 Nginx 集群中,VRRP 协议是实现虚拟 IP(VIP)漂移的核心机制,它不依赖应用层逻辑,而是通过网络层协作完成快速、自动的故障接管。
为什么必须用 VRRP 解决 VIP 漂移
客户端通常只配置一个入口 IP(比如 192.168.10.100),如果该 IP 固定绑定在某台 Nginx 服务器上,机器宕机即中断服务。VRRP 把多台 Nginx 节点组织成一个“虚拟路由器组”,对外暴露同一个 VIP 和虚拟 MAC 地址(格式为 00-00-5E-00-01-{VRID}),由其中一台节点担任 MASTER 实际响应 ARP、转发流量;其余为 BACKUP,仅监听 MASTER 的心跳通告。一旦 MASTER 失联,BACKUP 在 1~3 秒内自动升级并接管 VIP。
VRRP 组建与角色选举关键点
VRRP 组内节点需满足以下前提才能正常协作:
- 所有节点必须处于同一二层广播域(同网段、能互通 ARP),不能跨 VLAN 或云厂商受限私有网络(如阿里云默认禁用 VRRP,需改用 ENI 多 IP 或 SLB)
- 配置相同 virtual_router_id(VRID),标识属于同一个 VRRP 组
- MASTER 设置更高 priority(如 100),BACKUP 设置较低值(如 90),优先级相同时比较 IP 地址大小
- 启用 authentication(如 PASS + 6 位密码),防止非法节点加入组
- 设置合理 advert_int(建议 1 秒),控制心跳通告间隔
让 VIP 真正跟随 Nginx 状态联动
VRRP 本身只管“谁持有 VIP”,但若 Nginx 进程已挂而 Keepalived 还在运行,VIP 仍留在故障节点上,导致请求失败。因此必须通过 vrrp_script 实现状态联动:
- 编写检测脚本:检查 nginx 进程是否存在、80/443 端口是否可连、或执行 curl -I http://127.0.0.1/health
- 在 vrrp_instance 中引用该脚本,并设置 track_script 和权重变化规则(如检测失败则 priority -20)
- 启用 nopreempt(仅 BACKUP 节点配置),避免脑裂时反复抢主
验证 VIP 漂移是否生效
切换不是配置完就结束,必须实测确认业务无感连续:
- 用 ip addr show 查看 VIP 是否出现在当前 MASTER 的网卡(如 eth0:1)
- 在客户端 ping VIP,同时手动 down 掉 MASTER 的网卡或 kill nginx 进程,观察丢包是否 ≤ 3 个
- 抓包验证 ARP 表更新:MASTER 下线后,新 MASTER 会主动发送免费 ARP(Gratuitous ARP),刷新下游设备的 ARP 缓存
- 检查后端服务日志,确认请求在切换前后持续到达健康节点