Kafka简介

  1. Kafka核心要点
  • 基础概念:是分布式消息系统,有高吞吐量、可扩展等特性。包含Producer、Consumer等多种角色,消息按Topic分类存储,支持两种消息队列模式。

  • 安装与配置:安装前需准备JDK和Zookeeper,下载解压后修改配置文件,分发安装包到集群节点,配置环境变量后可启动。

  • 命令行操作:可进行Topic创建、查看、删除,数据生产与消费等操作。

  • 架构原理:消息以Topic分类,Partition对应log文件存储数据,通过分片和索引提升效率。生产者有分区策略和可靠性保证机制,消费者采用拉模式,有分区分配和offset维护策略。

  • 组件整合:与Flume整合可实现数据监控传输,与SparkStreaming整合需导包并进行代码配置,还可利用Redis维护偏移量。

  1. Spark Core部署关键
  • Yarn模式部署:解压缩并重命名文件,修改Hadoop和Spark配置文件,启动HDFS和Yarn集群后提交测试应用,配置历史服务可记录任务运行情况。

  • Windows模式部署:解压到指定路径,执行bin目录下的spark-shell.cmd启动本地环境,在命令行执行代码指令进行操作。

相关推荐
用户3610588626129 小时前
Spark 核心之广播变量、累加器原理深度剖析
大数据·spark
用户3610588626121 天前
Spark 核心之二次排序、分组取 TopN 优化分析
大数据·spark
富士康质检员张全蛋1 天前
Kafka 事物
kafka
wear工程师2 天前
Kafka 消费者心跳正常,为什么还会被踢出组?拆清 max.poll.interval.ms
java·kafka
头茬韭菜2 天前
Apache Fluss 项目深度分析与技术文档系列计划
flink·spark·realtime·fluss
成为你的宁宁3 天前
【Kafka KRaft 集群】
分布式·kafka
Gent_倪3 天前
Spark聚合算法:HashAggregate与SortAggregate详解
大数据·spark
2601_960906724 天前
地球或逃逸到相对安全的日心轨道
kafka·hbase·flume·storm
用户3610588626124 天前
Spark 核心之任务调度角色划分以及资源调度角色划分详解
大数据·spark
creator_Li4 天前
Kafka深入刨析-Consumer
分布式·kafka