HBase运维基础——元数据逆向修复原理

本文面向HBase运维人员,从基础原理出发,重点讲解数据完整性及元数据逆向恢复机制,为后续系列文章奠定基础。

HBase目录结构(1.x版本)

HBase在HDFS上的根目录通常为/hbase,关键子目录包括:data(存储表数据和region信息)、WALs(写入日志)、oldWALs(已持久化的WAL)、archive(归档文件)、corrupt(损坏文件)、MasterProcWALs(Master过程日志)、hbase.id和hbase.version(集群标识与版本)等。其中,表数据目录下包含tableinfo(表属性)、regioninfo(region边界与状态)、HFile数据文件、recovered.edits(恢复日志)及临时目录(.tmp、.splits、.merges)。

主要文件与数据完整性

HFile:数据文件,存储实际记录,通过firstkey/lastkey用于元数据重建。

Reference文件:split/merge时引用父HFile,无效引用需手动清理。

regioninfo:记录region的startkey/endkey、状态等。

tableinfo:保存表名、列族属性及自定义配置。

hbase:meta表:记录所有region的分配信息,是集群路由核心。

元数据逆向生成原理

当元数据丢失或损坏时,可依据数据文件反向恢复:

tableinfo:优先从Master缓存恢复,否则仅能恢复表名和列族名,其他属性恢复默认值。

regioninfo:扫描HFile的firstkey/lastkey,按排序确定region边界,重新生成regioninfo。

meta表:根据regioninfo序列化填充meta行,并标记默认Server,待region上线时重新分配。

还需处理region空洞(补充缺失region)和重叠(合并重叠region)问题。

修复工具

hbck(在线):依次执行-fixTableOrphans、-fixHdfsOrphans、-fixHdfsOverlaps、-fixHdfsHoles、-fixMeta、-fixAssignment,逐步修复tableinfo、regioninfo、region范围、meta表并触发重新上线。

OfflineMetaRepair(离线):直接重建meta表,适合集群无法启动场景。

使用工具前务必先执行hdfs fsck检查数据完整性。若涉及第三方组件写入元数据,需额外备份自定义属性,修复后手动核对。后续文章将继续深入HBase运维实践。

相关推荐
Nturmoils17 分钟前
一份 KDMS 评估报告,怎样排出迁移先后顺序
数据库
这个DBA有点耶17 分钟前
异构数据集成怎么做?5 种同步方案对比 + 金融级 CDC 实战解析
数据库·oracle·架构
独泪了无痕17 分钟前
SQL函数实战:GREATEST与LEAST的技巧
数据库·sql·mysql
码少女1 小时前
Linux--多路转接之select
java·服务器·数据库
梁辰兴1 小时前
软件工程:软件维护的副作用
数据库·软件工程·梁辰兴·控制方法·软件维护的副作用·副作用类型·副作用原因
这个DBA有点耶1 小时前
MySQL 8.0.20移除了Block Nested Loop,之前学的JOIN优化知识还适用吗?
数据库·mysql·架构
蓝胖的四次元口袋2 小时前
Docker Compose多容器编排与Nginx集群实战
运维·nginx·docker compose
懂软件的胡子个哥2 小时前
微信 API 消息回调怎么设计,才能避免丢消息和重复处理
运维·微信·架构·wechatapi·个人微信号二次开发
吉甫作诵2 小时前
Redis 常用命令大全:11 大类命令速查手册
运维·数据库·redis·缓存·nosql
2501_933670792 小时前
库存管理分析岗校招能力模型:SQL、库存周转、补货预测怎么准备
数据库