Spark(分布式计算系统)

Apache Spark 是一个开源的分布式计算系统,专为快速计算而设计。它建立在 Hadoop MapReduce 之上,扩展了 MapReduce 模型以有效地使用更多类型的计算,包括批处理、交互式查询、流处理和机器学习。Spark 提供了多种编程语言的 API,如 Scala、Java、Python 和 R,以及用于数据处理的高级抽象,如 RDD(弹性分布式数据集)、DataFrame 和 Dataset。

以下是一些关于 Spark 大数据的教程和资源,可以帮助你入门和深入学习 Spark:

  1. 代码+案例详解:使用Spark处理大数据最全指南 - 知乎

    • 链接:点击访问
    • 简介:这篇文章提供了 Spark 的界面介绍,以及如何使用 Spark 的 Dataframe API 简化数据科学家向大数据过渡的过程。同时,还提供了 GitHub 上的代码示例。
  2. Spark入门看这篇就够了(万字长文) - 知乎

    • 链接:点击访问
    • 简介:这篇文章详细介绍了 Spark 的基本概念,如 Application、Driver、Master 和 Worker、Executor、Job、Task、Stage、窄依赖与宽依赖、Shuffle、RDD、DAG 等,以及 Spark 的执行流程和运行模式。
  3. 【狂野大数据】自学教程|Spark从零到精通完整版 - 哔哩哔哩

    • 链接:点击访问
    • 简介:这是一个视频教程,包含 227 条视频,涵盖了 Spark 的概述、目标、特点、组成等内容,适合初学者从零开始学习。
  4. Apache Spark 教程 - W3Schools

    • 链接:点击访问
    • 简介:这个教程为渴望使用 Spark 框架学习大数据分析基础知识并成为 Spark 开发人员的专业人士准备。它假设你已经接触过 Scala 编程、数据库概念和 Linux 操作系统。
  5. 《Spark编程基础(Scala版)》教材官网 - 厦门大学数据库实验室

    • 链接:点击访问
    • 简介:这是一本教材的官网,提供了 Spark 编程的基础知识,适合作为高等院校计算机、软件工程、数据科学与大数据技术等专业的教材。官网提供了全套的在线教学资源,包括讲义 PPT、习题、源代码、软件、数据集、授课视频、上机实验指南等。
相关推荐
蘑菇蘑菇不会开花~3 分钟前
分布式Redis(14)哈希槽
redis·分布式·哈希算法
问道飞鱼1 小时前
分布式中间件-Pika一个高效的分布式缓存组件
分布式·缓存·中间件
小宋10213 小时前
玩转RabbitMQ声明队列交换机、消息转换器
服务器·分布式·rabbitmq
懒洋洋的华3698 小时前
消息队列-Kafka(概念篇)
分布式·中间件·kafka
March€8 小时前
分布式事务的基本实现
分布式
DieSnowK10 小时前
[Redis][环境配置]详细讲解
数据库·redis·分布式·缓存·环境配置·新手向·详细讲解
Lill_bin11 小时前
深入理解ElasticSearch集群:架构、高可用性与数据一致性
大数据·分布式·elasticsearch·搜索引擎·zookeeper·架构·全文检索
涛思数据(TDengine)11 小时前
TDengine 与 SCADA 强强联合:提升工业数据管理的效率与精准
大数据·时序数据库·tdengine
isNotNullX12 小时前
如何用SQL Server和Oracle进行数据同步?
大数据·数据库·sql·oracle
RwTo13 小时前
Elasticsearch 聚合搜索
大数据·elasticsearch·搜索引擎·全文检索