大数据Spark范式

文章目录

大数据Spark范式

python 复制代码
from pyspark.sql import SparkSession
import json


def filter_debate(x):
    data = json.loads(x)
    return data["subject"]


if __name__ == '__main__':
    spark = SparkSession.builder.appName("NonDebateFilter").getOrCreate()
    sc = spark.sparkContext

    # 假设${DATA_ID:12455}是一个环境变量或需要替换的具体路径前缀
    input_path = "${DATA_ID:00001}:Auser/data_en/*"
    rdd = sc.textFile(input_path)
    filtered_rdd = rdd.map(debate)

    # 取消注释以保存所有过滤后的记录,而不是只取前100条
    output_path = "${DATA_ID:00001}:Auser/data_en/01"
    filtered_rdd.saveAsTextFile(output_path)

    # 如果确实只需要前100条记录进行打印或其它处理,可以在保存后单独处理
    # for i in filtered_rdd.take(100):
    #     print(i)

    sc.stop()
相关推荐
遨游xyz19 小时前
Trie树(字典树)
开发语言·python·mysql
重启编程之路19 小时前
AlphaLens Pro V14.0 商业级量化推演终端 | 功能白皮书
python
xrczsjq19 小时前
客流增长新观察:从三个重庆案例看商业街区设计的演变
大数据·文旅商业美陈设计·商场氛围布置·文旅街区升级改造·商业美陈设计·商场美陈设计·商业街区设计
二十雨辰20 小时前
[python]-生成器和正则
python
人机与认知实验室20 小时前
2026:人形机器人的未来发展趋势
大数据·人工智能·机器人
Loo国昌20 小时前
【AI应用开发实战】06_向量存储与EmbeddingProvider设计
人工智能·后端·python·语言模型·自然语言处理·prompt
两万五千个小时20 小时前
构建mini Claude Code:07 - 一切皆文件:持久化任务系统
人工智能·python·架构
番茄去哪了20 小时前
python基础入门(一)
开发语言·数据库·python
Humbunklung20 小时前
深入解析PPTX:编程实现批量字体替换的原理与实践
人工智能·python·计算机视觉·manus
YangYang9YangYan20 小时前
2026中专大数据技术专业学数据分析的实用性分析
大数据·数据挖掘·数据分析