spark读取csv文件

测试spark读取本地和hdfs文件

python 复制代码
from pyspark.sql import SparkSession

spark = SparkSession.builder \
    .appName("Example PySpark Script") \
    .getOrCreate()

# 读取本地csv文件
df = spark.read.csv("/Users/xiaokkk/Desktop/local_projects/spark/intents.csv", header=True, inferSchema=True)
# 显示前几行数据
df.show(5)
# 读取HDFS的csv文件
df = spark.read.csv("hdfs://127.0.0.1:9001/data/intents.csv", header=True, inferSchema=True)
df.show(5)
相关推荐
starzy199016 小时前
SparkStreaming 之配置参数详解
大数据·spark
starzy199016 小时前
SparkStreaming 之 DStream 底层结构剖析
大数据·spark
阿里云大数据AI技术2 天前
从 Common Crawl 到可训练语料:用 EMR Serverless Daft 构建清洗、模型标注与向量化管线
人工智能·spark
凉凉的知识库2 天前
一文讲清 Spark 集群队列:YARN 多租户、容量隔离与资源共享
大数据·spark·yarn
markvivv2 天前
【译】适合在RTX 5090、DGX Spark或类似机器上可运行的最佳新模型是什么?
大数据·人工智能·spark
FYKJ_20102 天前
django学习成绩预警系统10905
java·javascript·spring boot·python·spark·django·php
逸Y 仙X2 天前
Spark SQL
java·大数据·sql·spark
starzy19902 天前
SparkStreaming 之接收数据原理剖析
大数据·spark
用户3610588626122 天前
SparkSQL 之 Hive On Spark 原理分析
大数据·spark
for_ever_love__2 天前
PySpark学习: PySpark数据计算
python·学习·spark