spark on hive 参数

set hive.execution.engine=spark;

set spark.app.name=test9999;

set spark.executor.cores=5;

set spark.executor.memory=20G;

set spark.executor.instances=5;

set spark.driver.memory=5G;

set spark.memory.fraction=0.9;

--定义了 Spark 作业中每个 stage 的默认 task 数量。 Spark 官方建议的设置原则是,将spark.default.parallelism 设置为 num-executors * executor-cores 的 2 到 3 倍。

spark.default.parallelism=50;

set hive.merge.sparkfiles=true;

--是否自动转换为mapjoin

set hive.auto.convert.join=true;

--小表的最大文件大小,默认为25000000,即25M

set hive.mapjoin.smalltable.filesize=25000000;

--是否将多个mapjoin合并为一个

set hive.auto.convert.join.noconditionaltask=true;

--多个mapjoin转换为1个时,所有小表的文件大小总和的最大值。

set hive.auto.convert.join.noconditionaltask.size=25000000;

相关推荐
晓窗科技1 小时前
AI基座哪家好
大数据·人工智能·python
中科同志科技1 小时前
真空回流炉高温合金元器件焊接炉实操教程:从参数设定到良率提升
大数据·人工智能·机器人·业界资讯
a16252704632 小时前
环保与安全双重约束下全球煤炭供需收缩及其价格上行研究
大数据·人工智能
小码哥哥2 小时前
企业资料管理的「第三次浪潮」:当网盘遇上知识库,文件开始“会思考“
大数据·人工智能
科技在线2 小时前
《读懂中国孩子》蓝皮书观察篇在数博会发布 童书借阅集中于五大类,具体书目分散
大数据
晶捷软件2 小时前
离散型制造数字化转型:晶捷智能全栈方案打通从研发到交付全链路
大数据·人工智能·制造
阿童木写作3 小时前
自动智能抠图工具推荐:跨马翻译批量处理图片与视频字幕,跨境电商高效翻译
大数据·人工智能·python·音视频
shengchanxian13 小时前
2026年9月家电总装倍速链流水线定制工厂走访笔记:探厂看穿交付实力
大数据·笔记·家电总装倍速链流水线工厂
光锥智能3 小时前
当Agent开始“动手”,企业AI竞争已从模型跑到“体系”
大数据·人工智能
jkyy20143 小时前
从娱乐座舱到健康服务空间:重构智能出行的主动守护范式
大数据·人工智能·健康医疗