spark读mongodb

idea maven依赖

<dependency>

<groupId>org.mongodb.spark</groupId>

<artifactId>mongo-spark-connector_2.11</artifactId>

<version>2.3.2</version>

</dependency>

val mongoURL = s"mongodb://账号:密码@机器ip:27017"

val builder = SparkSession.builder()

builder.appName(appName)

builder.config("spark.serializer", "org.apache.spark.serializer.KryoSerializer")

builder.config("spark.rdd.compress", "true")

builder.config("dfs.client.socket-timeout", "300000")

//builder.master("local1") 本地跑打开

val spark= builder.getOrCreate()

import spark.implicits._

val source = spark.read.mongo(ReadConfig(Map("uri" -> mongoURL, "database" -> "", "collection" -> "", "batchSize" -> "30000")))

.select("x")

//解析

source.map(it => {

val x= it.getAsString("x")

x

})

相关推荐
拾光师6 小时前
MapReduce OutputFormat 解析:结果怎么从键值对变成文件
大数据
Allen_LVyingbo6 小时前
医疗人工智能项目全生命周期管理系统:监管知识建模、工程实现与实证评估(下)
大数据·数据库·人工智能·python·自然语言处理·自动化
志栋智能6 小时前
超自动化巡检如何生成“有灵魂”的运维报告?
大数据·运维·人工智能·架构·自动化
湘美书院--湘美谈教育7 小时前
湘美书院随笔:AI时代的生活经济学
大数据·人工智能·安全·自动化·生活
用户3610588626127 小时前
Flink高级之侧输出流Side Output原理及代码实现:从OutputTag到多流分发
大数据·flink
Geeys7 小时前
3an推客是什么用途
大数据
shirsl7 小时前
数据开发每日面试题 Day 5
大数据·数据库·sql·big data
llilian_167 小时前
PTP时钟服务器时间溢出隐患解决方案 1588时钟服务器 ptp服务器
大数据·网络·单片机·嵌入式硬件·51单片机
Elastic 中国社区官方博客7 小时前
将 Vercel 数据导入 Elastic:无需安装任何东西的无服务器可观测性
大数据·运维·elasticsearch·搜索引擎·云原生·serverless·全文检索
cspttty7 小时前
数字营销应届岗技能栈:Excel、SQL、GA4、投放平台与AI工具怎么学
大数据