spark on hive 参数

set hive.execution.engine=spark;

set spark.app.name=test9999;

set spark.executor.cores=5;

set spark.executor.memory=20G;

set spark.executor.instances=5;

set spark.driver.memory=5G;

set spark.memory.fraction=0.9;

--定义了 Spark 作业中每个 stage 的默认 task 数量。 Spark 官方建议的设置原则是,将spark.default.parallelism 设置为 num-executors * executor-cores 的 2 到 3 倍。

spark.default.parallelism=50;

set hive.merge.sparkfiles=true;

--是否自动转换为mapjoin

set hive.auto.convert.join=true;

--小表的最大文件大小,默认为25000000,即25M

set hive.mapjoin.smalltable.filesize=25000000;

--是否将多个mapjoin合并为一个

set hive.auto.convert.join.noconditionaltask=true;

--多个mapjoin转换为1个时,所有小表的文件大小总和的最大值。

set hive.auto.convert.join.noconditionaltask.size=25000000;

相关推荐
GlobalInfo3 分钟前
创新不是追逐热点,是在变化中建立长期竞争力
大数据·算法
Safeploy安策数据1 小时前
国密合规怎么落地?从密钥管理到内网安全完整流程
大数据·安全
2601_960017621 小时前
饲料添加剂研发PLM选型:解读一半科技流程行业适配能力
大数据
baopixiaoz1 小时前
BeeQuant × BeeAgent:AI量化新范式
大数据·人工智能·python·区块链
Raas1001 小时前
AI网关在架构中的位置?MAI Gateway(魔芋企业级AI网关)给出企业级答案
大数据·网络·人工智能·架构·gateway·ai网关·mai gateway
2601_960017621 小时前
油田化学品PLM系统选型:一半科技聚焦配方、工艺、数据管理
大数据·科技
IT毕设实战小研2 小时前
基于大数据的AI应用对就业与收入增长的区域差异分析及可视化
大数据·人工智能·python·随机森林·机器学习·课程设计
user_admin_god2 小时前
一体化数据归集接口详细设计说明
java·大数据·spring boot·后端·spring
美股研究社2 小时前
出海合规战,TEMU先胜“一城”
大数据·人工智能·物联网
qq407855602 小时前
2026 最新鼎捷 vs 轻流:生产管理系统功能对比与选型指南
大数据·人工智能·低代码·制造