为什么会有“建议MySQL单表数据控制在2000W”的说法?

前言

经常听到"建议MySQL单表数据控制在2000W"这样的说法,这个说法的背后是因为表数据量过大会导致查询性能低下。那么2000W是怎么来的?

行记录是如何存储的?

这得从MySQL存储设计说起,以InnoDB存储引擎为例:

  1. InnoDB是以为单位进行存储和管理数据的,目的是为了减少磁盘IO的次数,‌提高数据的读写速度。‌
  2. 为了提高查询效率,InnoDB以索引组织表数据,且每张表至少会有一个索引(聚簇/主键索引)。

所以,在组织表数据时会存在索引页数据页。不论是哪种页,其结构是一样的,大概是这样的:

更详细的说明请移步至《面试官:存储引擎InnoDB是如何快速定位到行数据的?》

图中的「用户数据」可以存放多少行记录是至关重要的,因为它关系到"单表数据控制在2000W"的这个说法是否成立。

那么,索引页和数据页可以存放多少行记录?

数据页可以存放多少行记录?

InnoDB页大小默认为16KB,「文件头」、「页头」、「页目录」等占用了1/16的空间,剩下的15KB就用来存行记录。

索引页存放的数据是索引和指针 ,数据页则存放的是完整的行数据

通常我们的主键都是数值类型(int、bigint...),以bigint为例,一行索引记录会占用8B加上指针占用的空间6B,也就是14B。那么索引页就可以存放15*1024/14≈1098行记录。

数据页能存放多少行记录则需要看每个字段占用多少空间来估算,这里假设一行记录是1KB,那么数据页可以存放15行记录。

基于以上的情况,InnoDB是如何以索引组织2000W数据的?

InnoDB如何以索引组织2000W数据?

以B+tree索引结构为例,其叶子结点是数据页,非叶子结点为索引页。

  • 如果树的高度为2,1层索引页和数据页,那么可以存放1098*15≈2W行记录。
  • 如果树的高度为3,2层索引页和1层数据页,那么可以存放1098*1098*15≈2000W行记录。
  • 如果树的高度为4,3层索引页和1层数据页,可以存放1098*1098*1098*15≈200000W行记录。

如此看来,"建议MySQL单表数据控制在2000W"并不是没有道理的。因为树高度过高时,会有以下两个原因导致查询速度变慢:

  1. 树高度过高,意味着在进行数据检索时需要进行更多的磁盘I/O操作。
  2. 在这样大的数据量下,索引的体积也会很大,维护索引结构的复杂度也会相应提高。

总结

综上所述,"建议MySQL单表数据控制在2000W"是根据每行记录大小为1KB估算的,并非一个标准,还是要根据实际情况去决定单表的数据量。

相关推荐
vx-Biye_Design9 小时前
SSM伴侣动物伴护星小程序06330-计算机课程设计、毕业设计
spring boot·后端·elasticsearch·小程序·架构·课程设计·idea
2分钟速写快排11 小时前
什么是 RAG?如何用 RAG 实现一个用户记忆?
前端·后端·ai编程
面向Google编程11 小时前
Apache Iceberg Variant 类型:v3 半结构化数据不再「二选一」
大数据·后端
jason成都12 小时前
Spring WebFlux 适配达梦新方案|dm‑r2dbc:Netty 异步传输的实验性 R2DBC 驱动
java·后端·spring
SendTomo12 小时前
【技术交流】从0到1构建一个汉字学习平台:汉字吧(hanzi8.com)的技术架构猜想
redis·mysql·nginx·php·个人开发
IT大白鼠12 小时前
MySQL 分布式集群系列 · 第四篇——实操部署指南:从零搭建生产级 MySQL NDB 集群
数据库·分布式·mysql
IT大白鼠12 小时前
MySQL 分布式集群系列 · 第三篇——核心原理精讲:NDB 自动分片、多主写入与数据同步
数据库·分布式·mysql
北岛贰13 小时前
迷茫焦虑期,我做了一个带支付带官网的 AI 聊天虚拟恋人 App
前端·人工智能·后端
初願致夕霞15 小时前
MySQL_索引
数据库·mysql
一只小李郁vickie16 小时前
mysql 开启压缩传输3402条数据2.1秒压缩到毫秒级
数据库·mysql