MASTER_HEARTBEAT_PERIOD必须显式设置,因为MySQL 8.0默认不启用心跳机制(值为0),而跨网段场景下TCP keepalive常被中间设备静默中断,仅靠该参数才能触发主库主动发送心跳包以及时探测连接存活,避免假断连或故障发现延迟。
跨网段主从同步失败,90%不是配置错,而是网络抖动或防火墙拦截导致心跳中断;MySQL 8.0 默认不显式暴露心跳参数,必须靠 MASTER_HEARTBEAT_PERIOD 和底层 TCP 参数协同控制。
MASTER_HEARTBEAT_PERIOD 必须显式设置?MySQL 8.0 的复制线程默认使用 TCP keepalive(系统级),但该机制在跨网段、NAT 或云厂商负载均衡后常失效——连接空闲超时被中间设备静默断开,而 MySQL 不感知。此时仅靠 CHANGE MASTER TO 中的 MASTER_HEARTBEAT_PERIOD 才能触发主动心跳探测。
MASTER_HEARTBEAT_PERIOD 单位是秒,取值范围 0–4294967,0 表示禁用心跳(不推荐)CHANGE MASTER TO 时生效,修改后需 STOP SLAVE; START SLAVE;
slave_net_timeout(从库等待主库响应的超时),二者需配合slave_net_timeout 和 MASTER_HEARTBEAT_PERIOD 怎么配才不冲突?这两个参数共同决定“多长时间内没收到任何数据就判定主从断开”。若配错,会出现假断连或真断连不恢复。
slave_net_timeout 是从库侧全局变量,默认 60 秒;它必须 > MASTER_HEARTBEAT_PERIOD,否则心跳包还没发完就被判定超时MASTER_HEARTBEAT_PERIOD = 15,slave_net_timeout = 30(重启从库或运行 SET GLOBAL slave_net_timeout = 30;)slave_net_timeout 至少设为 MASTER_HEARTBEAT_PERIOD × 2 + 5
STOP SLAVE; START SLAVE;,否则新 timeout 不生效仅靠 MySQL 参数不够。Linux 内核的 tcp_keepalive_* 会影响底层连接存活,尤其在有状态防火墙/NAT 设备的路径上。
sysctl net.ipv4.tcp_keepalive_time net.ipv4.tcp_keepalive_intvl net.ipv4.tcp_keepalive_probes
/etc/sysctl.conf):net.ipv4.tcp_keepalive_time = 600(首次探测前空闲时间)net.ipv4.tcp_keepalive_intvl = 60(探测间隔)net.ipv4.tcp_keepalive_probes = 3(失败后重试次数)sysctl -p 生效;注意:这些是系统级设置,影响所有 TCP 连接,非仅 MySQL不能只看 SHOW SLAVE STATUSG 中的 Seconds_Behind_Master,要抓底层行为。
tcpdump -i any port 3306 -nn -A | grep -i "heartbeat"(需安装 tcpdump;实际不会打印文字 "heartbeat",但可观察到小包周期性收发)Slave_IO_Running 状态变化时间是否接近你设的 slave_net_timeout
tail -f /var/log/mysqld.log | grep -i "lost connection|heartbeat",确认断连原因是否为超时而非认证失败error connecting to master 或 network error
跨网段主从最易忽略的是中间设备对长连接的静默回收策略——它比 MySQL 自身参数更早切断连接。所以心跳不是“加了就稳”,而是必须和网络设备策略对齐;调参后一定要模拟一次网络闪断,否则上线后半夜出问题很难回溯。