Kafka工具类

java 复制代码
package utils;

import org.apache.flink.api.common.eventtime.WatermarkStrategy;
import org.apache.flink.api.common.serialization.SimpleStringSchema;
import org.apache.flink.connector.kafka.sink.KafkaRecordSerializationSchema;
import org.apache.flink.connector.kafka.sink.KafkaSink;
import org.apache.flink.connector.kafka.source.KafkaSource;
import org.apache.flink.connector.kafka.source.enumerator.initializer.OffsetsInitializer;
import org.apache.flink.streaming.api.datastream.DataStreamSource;
import org.apache.flink.streaming.api.environment.StreamExecutionEnvironment;

/**
 * @Package utils.KafkaUtil
 * @Author xuang
 * @Date 2025/5/13 16:20
 * @description: kafka工具类
 */
public class KafkaUtil {
    public static KafkaSink<String> getKafkaProduct(String servers, String topic) {
        return KafkaSink.<String>builder()
                .setBootstrapServers(servers)
                .setRecordSerializer(KafkaRecordSerializationSchema.builder()
                        .setTopic(topic)
                        .setValueSerializationSchema(new SimpleStringSchema())
                        .build()
                )
                .build();
    }

    public static DataStreamSource<String> getKafkaConsumer(StreamExecutionEnvironment env, String servers, String topic) {
        // 配置 KafkaSource
        KafkaSource<String> source = KafkaSource.<String>builder()
                .setBootstrapServers(servers)
                .setTopics(topic)
                .setGroupId("flink-group")
                .setStartingOffsets(OffsetsInitializer.earliest())
                .setValueOnlyDeserializer(new SimpleStringSchema())
                .build();

        // 将 KafkaSource 添加到作业
        return env.fromSource(source, WatermarkStrategy.noWatermarks(), "Kafka Source");
    }
}

概述

KafkaUtil 是一个 Apache Flink 工具类,封装了 Kafka 作为数据源(Source)和数据汇(Sink)的常用操作,简化了 Flink 与 Kafka 集成的开发工作。

功能

实现细节

Kafka Sink 配置

Kafka Source 配置

最佳实践

  1. ​Kafka Sink​ - 将 Flink 数据流写入 Kafka

  2. ​Kafka Source​ - 从 Kafka 读取数据作为 Flink 数据源

  3. 使用 SimpleStringSchema 作为值的序列化器

  4. 支持多服务器配置

  5. 需要指定目标 topic

  6. 使用 SimpleStringSchema 作为值的反序列化器

  7. 从最早偏移量开始消费(earliest())

  8. 默认消费者组 ID 为 "flink-group"

  9. 不使用 watermark 策略

  10. ​消费者组管理 ​

    对于生产环境,建议在调用处自定义消费者组 ID,而不是使用默认的 "flink-group"

  11. ​序列化扩展 ​

    对于复杂数据类型,可以扩展此类支持自定义序列化/反序列化器

  12. ​容错配置 ​

    生产环境中应考虑添加以下配置:

    • 重试策略

    • 事务配置(精确一次语义)

    • 检查点配置

  13. ​安全配置 ​

    如果 Kafka 集群启用了安全认证,需要添加以下配置:

    • SSL/TLS

    • SASL 认证

    • ACL 权限

相关推荐
yumgpkpm5 小时前
Acceldata ODP(Open Data Platform)3.3.6.4(RHEL9)保姆级完整安装手册
大数据·人工智能·hive·hadoop·kafka·hbase·cloudera
starzy199011 小时前
Flink JobManager启动流程源码深度剖析:从ClusterEntrypoint到JobMaster启动的完整链路
大数据·flink
用户36105886261212 小时前
Flink Time 之 WaterMark 水位线原理剖析:从生成机制到传播触发与调优实战
大数据·flink
用户14944848132012 小时前
Raft 为什么取代了 Paxos?从 DLedger 和 KRaft 的技术选型聊起
kafka·raft
此时不提桶,更待何时13 小时前
06-16-B-Kafka面试与生产事故实战
分布式·面试·kafka
阿里云云原生13 小时前
Kafka 不止于消息:阿里云发布面向 AI 的流算湖一体化实时数据平台
kafka
俊哥大数据14 小时前
Flink 2.3.0 从理论到实践 —— 第 2 章 Flink 运行时架构
网络·架构·flink
俊哥大数据14 小时前
Flink 2.3.0 从理论到实践 —— 第 4 章 状态管理(State)
flink
俊哥大数据15 小时前
Flink 2.3.0 从理论到实践 —— 第 5 章 时间语义与 Watermark
flink
龙腾-虎跃15 小时前
Docker 一键启动服务合集:Redis、MySQL、Kafka、MinIO、Prometheus 等(网盘转存防失效)
redis·mysql·docker·kafka·prometheus·小龙虾·miniio