bond接口未生效需先确保Linux网络栈识别:检查bonding模块是否加载、配置文件是否正确、slave网卡是否纳入bond、物理链路是否稳定,否则RAC私网将单路径运行并引发心跳丢失。
bond 接口没起来,或者 ifconfig 显示 bond0 有 IP 但 ethtool bond0 报 “No such device”,基本就是绑定没生效——这不是 Oracle 层面的问题,得先让 Linux 网络栈认出这个聚合接口。很多故障源于 modprobe bonding 没执行,或 /etc/modprobe.d/bonding.conf 缺失/错误。rhel/centos 5/6 下必须显式加载模块:
lsmod | grep bonding —— 若无输出,说明模块未加载modprobe bonding mode=1 miimon=100(主备模式)临时启用,再查 cat /proc/net/bonding/bond0
mode,换用 mode=0 或 mode=4(LACP 需交换机配合)/etc/sysconfig/network-scripts/ifcfg-bond0 中必须含 BONDING_OPTS="mode=1 miimon=100",且 DEVICE=bond0、BOOTPROTO=none、ONBOOT=yes
常见现象:bond0 up,但 cat /proc/net/bonding/bond0 显示 “No slaves”,或只列了一个网卡。这会导致 RAC 私网流量实际只走单路径,一旦该物理口抖动就丢心跳。
eth0、eth1)的配置文件中含 SLAVE=yes 和 MASTER=bond0
ifdown eth0 && ifup eth0 后仍不入 bond?检查 dmesg | tail -20 是否有 “bond0: Adding slave eth0 failed” 类提示——通常是 speed/duplex 不一致ETHTOOL_OPTS="speed 1000 duplex full autoneg off",避免协商失败导致 bond 初始化失败RAC 对私网延迟和稳定性极度敏感,仅看 ping 通是不够的。必须验证心跳包实际走的是 bond 路径,且无丢包、无抖动。
tcpdump -i bond0 -c 100 'host and port 12560'(CSS 心跳默认端口)确认流量确实经 bond0 出入ethtool -S bond0 查 rx_packets 和 tx_packets 是否持续增长;若某 slave 的 rx_missed_errors 非零,说明接收队列溢出,需调大 net.core.netdev_max_backlog
ping -c 1000 -i 0.05 ,重点关注 mdev(标准差),超过 0.5ms 就需警惕;RAC 要求 95% 包延迟 ≤ 2ms当 crsctl check cluster -all 报 CRS-4535,但节点本身能 ssh 登录,大概率是 OCR 所在存储路径依赖的私网 bond 不稳定,导致 CSSD 进程无法完成集群成员资格仲裁。
tail -f /oracle/11.2.0/grid/log/<hostname>/cssd/ocssd.log</hostname>,搜索 “IPC timeout” 或 “missed heartbeat”crsctl start crs 可能触发误驱逐ifconfig bond0 down && ifconfig bond0 up,观察 ocssd.log 是否停止报错;若恢复,说明 bond 驱动状态异常,需重载 bonding 模块bond 配置写对了只是第一步。RAC 私网的稳定性最终取决于物理链路层——交换机端口双工是否强制全双工、网线是否接触不良、甚至网卡固件版本是否过旧。这些细节不暴露在 Oracle 日志里,却会直接导致 ocwd.log 中密集出现 CRS-1611,而你翻遍 srvctl 命令都找不到原因。