spark on hive

需要提前搭建好hive,并对hive进行配置。

1、将hive的配置文件添加到spark的目录下

bash 复制代码
cp $HIVE_HOME/conf/hive-site.xml $SPARK_HOME/conf

2、开启hive的hivemetastore服务

提前创建好启动日志存放路径

mkdir $HIVE_HOME/logStart

bash 复制代码
nohup /usr/local/lib/apache-hive-3.1.3-bin/bin/hive --service metastore  > logStart/hivemetastore.log 2>&1 &

3、开启spark的thriftserver服务,运行端口为1000

bash 复制代码
cd $SPARK_HOME/sbin
start-thriftserver.sh

注意:其实还是hive的thirftserver服务,同时还需要启动spark集群

4、远程连接thirftserver服务

连接thirftserver服务后,就可以使用hive的元数据(hive在hdfs中的数据库和表),并且将spark作为分析引擎,来执行hivesql了。

那我自己集群的数据做例子:

bash 复制代码
show databases ;
use clickhouse;
相关推荐
牛企老板俱乐部1 小时前
广东机器人结构验证手板产业格局:深圳珠海东莞三城分析
大数据·人工智能
Keystone_Onion1 小时前
基于5大仓群路由算法的中大件美国海外仓降本架构与数据实测分析
大数据
buligbulig1 小时前
智能电网的数据底座:电力行业大数据治理路径解析
大数据
ltqvibe1 小时前
企业AI改造的四层路径:从点上应用到企业大脑
大数据·人工智能·本体语义平台·企业ai改造·数据打通·企业大脑·企业认知基础设施
anxiao_m1 小时前
园区数字孪生怎么搭建?主流方案与服务商深度对比
大数据·运维·人工智能
stonewl25992 小时前
2026化工企业标签打印自动化方案
大数据
独隅3 小时前
VS Code Git 工作树多分支并行开发实战指南
大数据·git·elasticsearch
千维百策6663 小时前
AI 软件开发中的人与智能体:软件工程循环、人在环路中与框架工程
大数据·人工智能·软件工程
梦伢mm4 小时前
直播切片素材不足,易元 AI 可以自动拆分直播视频做带货素材吗?
大数据
Lalolander5 小时前
2026年成长型企业上金蝶,抓3个重点(预算有限如何起步)
大数据·制造·erp·金蝶erp·erp实施·金蝶ai星空