达梦数据库表统计信息收集时间分析

本测试用于估算表统计信息的收集时间。

测试步骤:

1、创建测试表

create table t1(a int , b int,c int,d int);

2、写入数据

insert into t1 select dbms_random.RANDOM,dbms_random.RANDOM,dbms_random.RANDOM,dbms_random.RANDOM

from dual connect by level <=100000;

写入10万行随机数据。

3、创建索引

create index ind_t1_d on t1(d);

在d字段上创建索引

4、收集表的统计信息,级联收集其上建立的索引统计信息

dbms_stats.gather_table_stats('SYSDBA','T1',null,100,TRUE,'FOR ALL COLUMNS SIZE AUTO');

DMSQL executed successfully

used time: 739.213(ms). Execute id is 8366.

5、删除索引

drop index ind_t1_d;

6、再次收集表的统计信息

dbms_stats.gather_table_stats('SYSDBA','T1',null,100,TRUE,'FOR ALL COLUMNS SIZE AUTO');

DMSQL executed successfully

used time: 803.643(ms). Execute id is 8368.

7、删除一半数量的字段

alter table t1 drop column c;

alter table t1 drop column d;

8、将表的行数增加一倍

insert into t1 select * from t1;

9、收集表的统计信息

dbms_stats.gather_table_stats('SYSDBA','T1',null,100,TRUE,'FOR ALL COLUMNS SIZE AUTO');

DMSQL executed successfully

used time: 520.518(ms). Execute id is 8373.

结论:

1、索引并不会增加统计信息收集的时间,反之收集总时长会略微减少。

2、字段数量是表统计信息收集时间的因素。上面测试中字段减少一半,行数增加一倍,表的总字节数没有改变的情况下统计信息收集时长由803.643毫秒减少为520.518毫秒。

分析原因:

表的统计信息收集过程会拆解为三个部分:

1、统计表的行数(NUM_ROWS)

系统后台通过执行select count(*) from "T1"这样的语句收集表的统计信息。由于达梦是索引组织表,统计行数非常快。

2、统计字段的NUM_DISTINCT和数据的分布情况

系统后台通过执行select "A" , count(*), 4 from "T1" group by "A" order by 1 这样的语句收集字段的统计信息。这一步比较耗时,但如果该sql可以利用已经排好序的索引,执行时间将会显著缩短。

3、统计索引的BLEVEL、LEAF_BLOCKS

索引一半较小,这一步时间较短。

实测过程:

相关推荐
CNSSIRD数据库12 分钟前
中国企业环境信用数据库2003-2026
大数据·数据库·数据分析·论文笔记
fd320041 分钟前
达梦数据库更新统计信息后仍走旧执行计划解决方案
数据库
华章酱1 小时前
MySQL幻读是怎么出现的
数据库·mysql·幻读
浅念-2 小时前
Redis基础详解:单线程模型、String与Hash数据结构
服务器·数据库·redis·sql·mysql·nosql数据库·nosql
updayday8542 小时前
离职域账号状态变更与Ping64操作记录核对
大数据·网络·数据库·安全·智能路由器
Nturmoils2 小时前
只恢复一张表,别把整个库都还回去
数据库
龙腾AI白云3 小时前
大语言模型:从语言理解到通用智能的跃迁
数据库·人工智能·机器学习·知识图谱
SelectDB3 小时前
快手基于 Apache Doris 千亿多模态检索的实践
大数据·数据库·数据分析
SelectDB3 小时前
StarRocks 迁移至 Apache Doris 完整指南:三步完成结构、数据与业务平滑切换
大数据·数据库·数据分析
这个DBA有点耶3 小时前
InnoDB索引组织表下,复合主键和自增主键的物理存储差异与选型对比
数据库·mysql·架构