spark读取csv文件

测试spark读取本地和hdfs文件

python 复制代码
from pyspark.sql import SparkSession

spark = SparkSession.builder \
    .appName("Example PySpark Script") \
    .getOrCreate()

# 读取本地csv文件
df = spark.read.csv("/Users/xiaokkk/Desktop/local_projects/spark/intents.csv", header=True, inferSchema=True)
# 显示前几行数据
df.show(5)
# 读取HDFS的csv文件
df = spark.read.csv("hdfs://127.0.0.1:9001/data/intents.csv", header=True, inferSchema=True)
df.show(5)
相关推荐
用户36105886261216 小时前
Spark 核心之广播变量、累加器原理深度剖析
大数据·spark
用户3610588626122 天前
Spark 核心之二次排序、分组取 TopN 优化分析
大数据·spark
头茬韭菜3 天前
Apache Fluss 项目深度分析与技术文档系列计划
flink·spark·realtime·fluss
Gent_倪4 天前
Spark聚合算法:HashAggregate与SortAggregate详解
大数据·spark
用户3610588626125 天前
Spark 核心之任务调度角色划分以及资源调度角色划分详解
大数据·spark
用户3610588626126 天前
Spark 核心之 Stage 并行度划分及优化详解
spark
用户3610588626126 天前
Spark 核心之 Stage 切分划分与计算模式详解
spark
用户3610588626126 天前
Spark 核心之 RDD 窄依赖与宽依赖详解
spark
用户3610588626127 天前
Spark 核心之 Stage 和 Task 原理剖析
spark
java1234_小锋7 天前
【免费】基于Spark实时医疗健康数据监测与疾病预测系统(Java版本+可视化大屏+Kafka+SpringBoot+Vue3) 锋哥原创出品,必属精品
大数据·spark·kafka·实时医疗健康数据监测·实时疾病预测系统