Oracle RAC数据库实例无法拉起?检查OCR与Voting Disk健康
OCR与Voting Disk故障排查:当集群的“心脏”与“大脑”停摆时
OCR磁盘组无法挂载会导致CRS启动失败,表现为CRS-4535错误;常见原因包括ASM未启动、磁盘组未识别、路径权限异常或OCR文件头损坏,应优先检查ASM状态、磁盘发现结果及手动挂载尝试,并从备份恢复OCR而非直接dd清零。
OCR磁盘组无法挂载导致CRS无法启动
如果把RAC集群比作一个生命体,那么OCR(Oracle Cluster Registry)就是它的“大脑”和“配置中心”。一旦存放OCR的ASM磁盘组无法挂载,crsd.bin进程就会直接罢工退出。这时候,你运行crsctl check crs,通常会看到一种“割裂”的状态:底层服务在线(CRS-4638: Oracle High A vailability Services is online),但集群就绪服务却失联了(CRS-4535: Cannot communicate with Cluster Ready Services)。
免费影视、动漫、音乐、游戏、小说资源长期稳定更新! 👉 点此立即查看 👈
问题根源往往集中在几个方面:ASM实例没起来、OCR所在的磁盘组ASM认不到、磁盘路径权限不对,或者最麻烦的——磁盘组里的OCR文件头本身损坏了。
- 第一步,确认ASM是否在运行:执行
ps -ef | grep asm_pmon看看有没有进程。如果没有,别慌,先尝试手动启动:srvctl start asm -n。 - 第二步,检查ASM的“视野”:用
asmcmd lsdsk -k命令,看看OCR磁盘(比如/dev/oracleasm/disks/OCR_VOTE)的状态。关键是要显示为PROVISIONED(已配置),而不是UNKNOWN(未知)。 - 第三步,尝试手动挂载:如果磁盘能看见,但磁盘组就是挂不上,可以登录
sqlplus / as sysasm,执行ALTER DISKGROUP OCR_VOTE MOUNT。这时要特别留意是否报ORA-15032或ORA-15017错误,这通常指向磁盘路径不可达或者UDEV规则失效了。 - 最重要的一点:切忌病急乱投医:千万别一看到OCR可能损坏就直接用
dd命令清零磁盘,这是毁灭性的操作。正确的姿势是优先从备份恢复:先用ocrconfig -showbackup找到备份文件,然后用ocrconfig -restore进行恢复。
Voting Disk离线引发节点驱逐(Node Eviction)
Voting Disk可不是什么“可选组件”,它是RAC集群心跳仲裁的“心脏”。规则很简单:只要集群中任何一个节点无法访问多数(Quorum)的Voting Disk,这个节点就会在60秒内被强制重启,以避免“脑裂”。日志里通常会留下这样的证据:cssd(9819)ERROR: clssnmvDRLUpdate: Aborting local node to a void split-brain.。
这里有个关键认知:Voting Disk可以放在ASM磁盘组里(这也是官方推荐的做法),也可以放在裸设备或NFS上。但无论放在哪里,都必须确保所有节点对同一份Voting Disk有一致、低延迟且无中断的读写能力。
- 查看状态:运行
crsctl query css votedisk,重点看输出结果中的STATE列,必须全部是ONLINE才行。 - 诊断离线:如果状态显示
OFFLINEls -l看文件是否存在,再用 dd if=简单测试一下I/O通路是否畅通。of=/dev/null bs=4k count=1 - 注意ASM依赖:如果Voting Disk存放在ASM中,那么它的在线状态完全依赖于底层ASM磁盘组的挂载情况。如果执行
crsctl query css votedisk报错CLSU-00100: Operating System function: ioctl() failed with error data: 25,十有八九是ASM没能加载到那块磁盘,或者udev绑定出了错。 - 操作规范:添加或替换Voting Disk,必须使用
crsctl replace votedisk这个专用命令。千万不要手动去底层复制或修改文件内容,因为Voting Disk的内容是由CSS守护进程独占管理的。
OCR/Voting Disk共存于同一ASM磁盘组的风险
Oracle确实允许把OCR和Voting Disk放在同一个ASM磁盘组里(比如常见的+OCR_VOTE)。但这就像把鸡蛋放在同一个篮子里,是一把双刃剑:部署是简化了,但也把集群的“大脑”(配置)和“心脏”(仲裁)这两个最关键的路径耦合在了一起。一旦这个唯一的磁盘组因为磁盘故障、路径抖动或者ASM本身的Bug而无法挂载,整个集群会在瞬间同时失去配置管理和节点仲裁能力,后果是灾难性的。
所以,对于生产环境,强烈建议将两者分离:OCR单独放一个磁盘组(如+OCR),Voting Disk放在另一个磁盘组(如+VOTE)。更理想的情况是,这两个磁盘组后端的物理磁盘,不要共享同一个存储控制器或光纤链路,实现真正的物理隔离。
- 检查是否共存:对比
ocrcheck -detail命令输出中的Location,和crsctl query css votedisk命令输出的路径,看看它们是否属于同一个ASM磁盘组名。 - 分离操作步骤:这是一个需要停集群的操作:
crsctl stop crs -f→ 在各个节点分别执行ocrconfig -repair -add +VOTE(添加新位置)→crsctl replace votedisk +VOTE(替换投票盘)→ 清理旧路径 → 最后重启集群。 - 特别注意:
ocrconfig -repair命令仅仅修复的是OCR在集群注册表中的位置信息,它不会移动物理文件。真正的物理文件迁移,需要结合dd命令或者asmcmd cp命令(使用后者要求目标磁盘组已经存在且可写)来完成。
诊断时最容易忽略的底层细节
很多DBA排查时会卡在一个尴尬的境地:磁盘路径存在、权限也对、ASM也能识别到磁盘,但实例就是拉不起来。这时候,问题往往藏在更底层:不是配置错了,而是通路“断”了。
- 多路径映射陷阱:在多路径(multipath)环境下,
ocrconfig -showbackup显示的路径可能是/dev/mapper/mpathb,而crsctl query css votedisk输出的却是/dev/oracleasm/disks/VOTE1。如果这两者之间没有通过udev规则正确映射,CSS进程根本就找不到真正的Voting Disk。 - 检查udev规则:务必确认
/etc/udev/rules.d/99-oracle-asmdevices.rules这个文件里包含了对应WWID(全球唯一标识符)的绑定规则。并且在执行start_udev重新加载规则后,通过ls -l /dev/oracleasm/disks/能看到持久化的设备链接。 - 私网的间接影响:集群私网(Cluster Interconnect)不通,也会间接影响OCR的同步。CSS守护进程依赖UDP多播来维持集群节点视图。如果使用
ping -I测试发现丢包,或者延迟持续大于20ms,可能会触发节点的误驱逐,进而破坏OCR的一致性。 - 时间同步的蝴蝶效应:时间不同步虽然不会直接导致实例拉不起来,但它会让OCR备份的时间戳陷入混乱。你可能会在
ocrconfig -showbackup的输出中,看到未来时间的备份文件,这会在恢复时严重误导你的判断。
游乐网为非赢利性网站,所展示的游戏/软件/文章内容均来自于互联网或第三方用户上传分享,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系youleyoucom@outlook.com。
同类文章
SQL如何调试复杂的嵌套查询_利用EXPLAIN分析执行路径
SQL如何调试复杂的嵌套查询:利用EXPLAIN分析执行路径 调试复杂SQL,尤其是嵌套查询,最怕的就是面对执行计划一头雾水。其实,读懂EXPLAIN的输出,关键在于理解优化器背后的权衡逻辑,而不是死记硬背几个术语。下面这几个常见的执行计划“疑点”,就是很好的切入点。 EXPLAIN 看不懂执行计划
mysql如何将时间戳转为日期_使用from unix time函数转换
MySQL中FROM_UNIXTIME()转换时间戳需注意时区、引号、NULL及类型溢出 在MySQL数据库操作中,将时间戳转换为可读日期是常见需求,FROM_UNIXTIME()函数是实现这一功能的核心工具。然而,实际应用中存在四个关键细节极易被忽视,直接影响数据准确性:必须使用 +08:00 格
mysql如何将表定义转化为JSON格式_数据库结构文档化技巧
MySQL表结构转JSON:避开常见陷阱,实现高效文档化方案 你是否需要将MySQL的表定义转换为一份清晰、可直接使用的JSON文档?这项工作听起来简单,但实际操作中,直接解析SHOW CREATE TABLE命令的输出会遇到格式不统一的问题,容易出错。有没有更稳定可靠的方法?答案是肯定的。 利用
SQL如何高效合并两个结构相似的表_使用UNION_ALL代替不必要的JOIN
SQL如何高效合并两个结构相似的表:使用UNION ALL代替不必要的JOIN 想把两个结构相似的表合并起来,你首先想到的是不是JOIN?其实,在很多场景下,UNION ALL才是那个更直接、更高效的选择。关键在于,你得先搞清楚自己的目标:是要把数据“纵向堆叠”起来,还是要“横向关联”起来。前者是U
mysql如何定期清理过期测试数据_mysql数据生命周期管理
MySQL测试数据清理:从“能删”到“会删”的四个关键步骤 清理数据库中的过期测试数据,看似是一项基础的运维任务,实则蕴含着诸多技术细节与风险考量。直接执行DELETE语句固然简单,但如何高效、安全、可控地完成清理,才是衡量专业度的关键。 用 DELETE + WHERE 清理过期测试数据最直接,但
- 日榜
- 周榜
- 月榜
1
2
3
4
5
6
7
8
9
10
相关攻略
2015-03-10 11:25
2015-03-10 11:05
2021-08-04 13:30
2015-03-10 11:22
2015-03-10 12:39
2022-05-16 18:57
2025-05-23 13:43
2025-05-23 14:01
热门教程
- 游戏攻略
- 安卓教程
- 苹果教程
- 电脑教程
热门话题

