TIDB——TIKV——raft

一、raft

定义:1个leader与多个follower的集群叫做1个raft group ,多个raft group也就是multi raft

二、具体分析

region内的存储方式

tikv node中的region有leader,follow之称,region内的数据按照key的顺序排序,存储形式为键值对

场景1:region内无数据时

  • 连续插入数据时,region默认96MB,超过之后,创建下一个逻辑单元 region,逻辑单元的key都是左闭右开,例如[1,1000),[1001.2000)

场景2:region内有数据时

  • update与delete处理region内的数据,数据可能少于96MB,当小于设定数值(96)时进行region的合并,也有可能多于这个数,当到达144MB时1分为2

功能:

日志复制(多副本数据复制,即为多副本一致)
实现步骤
1、进入propose

leader会把写入请求到日志文件格式<region号_ID,写入请ID>

注:客户端的写入数据只发送给leader,因leader负责读写follower不负责;ID为第几条写入请求,请求按照先后顺序

2、进入append:持久化

leader将日志文件存储到rocksdb raft中

3、复制replicate

将leader raft的日志文件复制给follower内的leader raft

4、committed

follower复制完毕会给leader给一个回应,大多数follower给出信号,

5、apply

根据rocksdb raft将数据写入rocksdb kv中

注:用户提交指的是rocksdb kv中的数据

leader选举

选举概念:term时期,是集群维持关系的周期,无固定长度

场景1:初始状态即集群无leader时期
  • 关键点:全follower但region都有election timeout(raft-election-timeout-ticks)
  • 具体实现:当谁率先超过这个值时,意识到集群无leader,谁就是candidate,并且term时期数字变大,然后给集群中的region发起选举信号,其它region投票给term大的region,candicate票给自己,票超过集群一半就变为leader
场景2:leader节点宕机
  • 关键点:leader心跳信息传递给follower确认term时期,heartbeat time interval(raft-heartbeat-ticks)
  • 具体实现:但是隔heartbeat time interval所设定时间,leader没有发心跳信息,即leader挂掉,开始下一段term,region率先到heartbeat time interval,谁就是candidate,宕机的leader恢复正常变成candidate,term数大者为leader
场景3:region同时迈入另一terms时期

region出现同时到达election timeout或者是heartbeat time interval,各自投票给自己,term时期数字增大,变为candidate,要是没有选出,系统进行下一轮投票(设置election timeout为random 数值)

注:ticks是什么?设置raft-base-tick-interval默认1s,那么raft-election-timeout-ticks等于5,就是5s了

raft-election-timeout-ticks不能小于raft-heartbeat-ticks


题外话:

  • 要是node内超过5w个region,管理成本很高

更于2025-12-16 0:42:48

相关推荐
清平乐的技术专栏几秒前
【Kafka笔记】(一)认识 Kafka
笔记·分布式·kafka
坚定信念,勇往无前10 分钟前
electron-vite 安装better-sqlite3
javascript·数据库·electron
大明者省14 分钟前
Ubuntu22.04 宝塔面板与 XFCE 远程桌面端口兼容性分析
运维·服务器·数据库·笔记
清平乐的技术专栏39 分钟前
【Kafka笔记】(四)Kafka 三种消费模式
笔记·分布式·kafka
liudanzhengxi40 分钟前
巧用ULN2003A轻松扩展单片机IO口
数据库·mongodb
Teable任意门互动1 小时前
深度解析:AI 赋能开源多维表格,实现企业全场景数据整合与高效应用
数据库·人工智能·低代码·信息可视化·开源·数据库开发
DevOpenClub1 小时前
职教高考及高职分类招生控制线 API 接口
java·数据库·高考
funnycoffee1231 小时前
华为S5736交换机3层ECMP负载方式
linux·服务器·数据库
添砖java‘’1 小时前
MySQL复合查询
数据库·mysql