大数据Spark范式

文章目录

大数据Spark范式

python 复制代码
from pyspark.sql import SparkSession
import json


def filter_debate(x):
    data = json.loads(x)
    return data["subject"]


if __name__ == '__main__':
    spark = SparkSession.builder.appName("NonDebateFilter").getOrCreate()
    sc = spark.sparkContext

    # 假设${DATA_ID:12455}是一个环境变量或需要替换的具体路径前缀
    input_path = "${DATA_ID:00001}:Auser/data_en/*"
    rdd = sc.textFile(input_path)
    filtered_rdd = rdd.map(debate)

    # 取消注释以保存所有过滤后的记录,而不是只取前100条
    output_path = "${DATA_ID:00001}:Auser/data_en/01"
    filtered_rdd.saveAsTextFile(output_path)

    # 如果确实只需要前100条记录进行打印或其它处理,可以在保存后单独处理
    # for i in filtered_rdd.take(100):
    #     print(i)

    sc.stop()
相关推荐
RPAdaren3 分钟前
AI 舆情智能体频繁断跑、漏抓发酵?90% 团队都踩了同一层坑
大数据·人工智能
DanCheng-studio12 分钟前
计算机技术与科学毕业设计简单的方向建议
python·毕业设计·毕设
言乐621 分钟前
Python排名统计折线图
开发语言·python·django·virtualenv·pygame
浩瀚地学27 分钟前
deepagents学习打卡day08
经验分享·笔记·python·学习·agent
Data-Miner29 分钟前
怎么批量处理Excel文件?一段月底对账剧本讲明白
大数据
卷无止境32 分钟前
便宜模型和贵模型到底差在哪儿?一份关于Claude与GPT分级体系的深度梳理
后端·python
玩美移动36 分钟前
AI Skin Analysis API 技术解析:文件上传、异步任务与结果读取
java·人工智能·python
千里码aicood1 小时前
基于Hadoop的机票价格波动分析系统的设计与实现
大数据·hadoop·分布式
無a伟1 小时前
彻底搞懂ToolCalling、MCP,Skills的核心区别,能力上的层层封装
大数据·agent·mcp·toolcalling·skills
xbgRS1 小时前
Elasticsearch的分词器
大数据·elasticsearch·搜索引擎