Hive分区表添加字段

文章目录

分区表新增字段

hive提供了为分区表添加字段的功能,新添加的字段会处于现有列的末尾。相关语法如下:

bash 复制代码
ALTER TABLE table_name 
  [PARTITION partition_spec]                 -- (Note: Hive 0.14.0 and later)
  ADD|REPLACE COLUMNS (col_name data_type [COMMENT col_comment], ...)
  [CASCADE|RESTRICT]                         -- (Note: Hive 1.1.0 and later)

结论

1.不添加cascade只会修改表元数据

此时历史分区的新增字段均会显示NULL(无论数据是否带有新字段数据),此时有两种解决方法

  • 方式一:手动给历史分区新增字段
  • 方式二:先删除历史分区再重入该历史分区数据(相比正常直接重入历史分区数据而言)

2.添加cascade会修改表和所有历史分区元数据

此时历史分区的旧数据会显示NULL,但新插入的带有新增字段的数据会正常显示

注意:如果是有多个分区字段且分区数量特别多的表,要谨慎使用cascade修改,可能造成元数据部分表锁表。

不使用cascade修改

bash 复制代码
1、准备表和数据
create table add_test(id int,name string) partitioned by (pt string) stored as parquet;
insert into table add_test partition (pt="2024-11-01") values (1,"zhangsan"),(2,"lisi");
insert into table add_test partition (pt="2024-11-02") values (3,"wangwu"),(4,"wuliu");

2、查看表和数据
desc add_test;
select id,name,pt from add_test;

3、增加字段
alter table add_test add columns(age int);

如果不添加CASCADE 此时只会修改表元数据 分区元数据没有改变

bash 复制代码
4、查看表和分区
desc add_test;
desc add_test partition (pt="2024-11-01")


bash 复制代码
5. 验证分区数据
# 插入新分区数据和历史分区数据
insert into table add_test partition (pt="2024-11-03") values (5,"a",11),(6,"b",12);
insert into table add_test partition (pt="2024-11-01") values (0,"c",21);

此时新分区数据可以正常显示新增字段信息,历史分区新增字段为NULL

bash 复制代码
6. 手动添加分区字段
alter table add_test partition (pt="2024-11-01") add columns(age int);

方式一:单独给历史分区添加字段元数据后,新增字段正常显示

bash 复制代码
7. 删除分区重入数据
alter table add_test drop partition (pt="2024-11-02");

方式二:删除分区 重新导入数据,新增字段正常显示

使用cascade修改

bash 复制代码
1、准备表和数据
create table add_test4(id int,name string) partitioned by (pt string) stored as parquet;
insert into table add_test4 partition (pt="2024-11-01") values (1,"zhangsan"),(2,"lisi");
insert into table add_test4 partition (pt="2024-11-02") values (3,"wangwu"),(4,"wuliu");

2.cascade修改
alter table add_test4 add columns(age int) cascade;

3.查看分区和表
desc add_test4;
desc add_test4 partition (pt="2024-11-01")

添加cascade后,表和分区的元数据均会更新

bash 复制代码
4.验证分区数据
insert into table add_test4 partition (pt="2024-11-01") values (0,"c",21);

此时插入历史分区的数据,也会正常显示新增字段

相关推荐
喂完待续6 小时前
Apache Hudi:数据湖的实时革命
大数据·数据仓库·分布式·架构·apache·数据库架构
计艺回忆路8 小时前
从Podman开始一步步构建Hadoop开发集群
hadoop
计算机源码社1 天前
分享一个基于Hadoop的二手房销售签约数据分析与可视化系统,基于Python可视化的二手房销售数据分析平台
大数据·hadoop·python·数据分析·毕业设计项目·毕业设计源码·计算机毕设选题
计算机毕设残哥2 天前
完整技术栈分享:基于Hadoop+Spark的在线教育投融资大数据可视化分析系统
大数据·hadoop·python·信息可视化·spark·计算机毕设·计算机毕业设计
计算机源码社2 天前
分享一个基于Hadoop+spark的超市销售数据分析与可视化系统,超市顾客消费行为分析系统的设计与实现
大数据·hadoop·数据分析·spark·计算机毕业设计源码·计算机毕设选题·大数据选题推荐
beijingliushao3 天前
33-Hive SQL DML语法之查询数据-2
hive·hadoop·sql
Lx3523 天前
如何正确选择Hadoop数据压缩格式:Gzip vs LZO vs Snappy
大数据·hadoop
让头发掉下来3 天前
Hive 创建事务表的方法
大数据·hive·hadoop
Q_Q19632884753 天前
python基于Hadoop的超市数据分析系统
开发语言·hadoop·spring boot·python·django·flask·node.js
计算机毕业设计木哥3 天前
计算机毕设大数据选题推荐 基于spark+Hadoop+python的贵州茅台股票数据分析系统【源码+文档+调试】
大数据·hadoop·python·计算机网络·spark·课程设计