spark读取csv文件

测试spark读取本地和hdfs文件

python 复制代码
from pyspark.sql import SparkSession

spark = SparkSession.builder \
    .appName("Example PySpark Script") \
    .getOrCreate()

# 读取本地csv文件
df = spark.read.csv("/Users/xiaokkk/Desktop/local_projects/spark/intents.csv", header=True, inferSchema=True)
# 显示前几行数据
df.show(5)
# 读取HDFS的csv文件
df = spark.read.csv("hdfs://127.0.0.1:9001/data/intents.csv", header=True, inferSchema=True)
df.show(5)
相关推荐
用户36105886261218 小时前
SparkStreaming 之 updateStateByKey 算子详解及代码实现
大数据·spark
用户3610588626122 天前
SparkStreaming 之 transform 算子详解及代码实现
大数据·spark
starzy19902 天前
SparkStreaming 之 Direct 模式深度剖析
大数据·spark
JLWcai202510093 天前
树脂砂轮质保与科学存放
mongodb·zookeeper·spark·memcached·storm
用户3610588626123 天前
SparkStreaming 之 DStream 底层结构剖析
大数据·spark
Code知行合壹4 天前
数据中台设计
大数据·分布式·spark
weixin_307779134 天前
PySpark根据输入的表名和过滤条件生成 INSERT 语句
python·spark·云计算·big data
阿里云大数据AI技术5 天前
一套 Spark SQL,打通多种 Catalog:EMR Serverless Spark 统一数据处理实践
人工智能·sql·spark
绿算技术5 天前
大模型本地化的经济账:DeepSeek V4 Flash 部署实测
人工智能·科技·算法·spark