flink api-datastream api-source算子

Flink源算子API是构建数据处理程序的输入端组件,主要分为预定义源和自定义源两类实现方式。以下是核心分类与使用方式:

预定义数据源

‌1.集合数据源

通过fromCollection()方法从内存集合创建DataStream,支持List、Iterator等集合类型,需指定元素类型信息

java 复制代码
// 从List创建
DataStream<String> stream = env.fromCollection(Arrays.asList("a", "b"));
// 从Iterator创建(需指定类型)
DataStream<Long> numbers = env.fromCollection(
    new NumberSequenceIterator(1L, 10L), 
    BasicTypeInfo.LONG_TYPE_INFO
);

2.文件数据源

支持读取文本文件(readTextFile)或按行解析文件(readFile),可配置文件监控模式

java 复制代码
DataStream<String> logStream = env.readTextFile("hdfs://path/to/logs");

3.Socket数据源

通过socketTextStream从网络套接字读取实时流数据,需指定主机和端口

java 复制代码
DataStream<String> socketStream = env.socketTextStream("localhost", 9999);

4.Kafka数据源

官方推荐使用KafkaSource构建器,需配置bootstrap服务器和反序列化器

java 复制代码
KafkaSource<String> source = KafkaSource.<String>builder()
    .setBootstrapServers("kafka:9092")
    .setTopics("input-topic")
    .setDeserializer(new SimpleStringSchema())
    .build();
DataStream<String> kafkaStream = env.fromSource(source...);

自定义数据源

需实现SourceFunction接口(无并行)或ParallelSourceFunction接口(支持并行),重写run()方法定义数据生成逻辑,通过SourceContext.collect()发射数据

java 复制代码
public class CustomSource implements SourceFunction<Event> {
    @Override
    public void run(SourceContext<Event> ctx) {
        while (isRunning) {
            ctx.collect(new Event(...)); // 发射数据
            Thread.sleep(1000);
        }
    }
    @Override
    public void cancel() { isRunning = false; }
}
// 使用方式
DataStream<Event> customStream = env.addSource(new CustomSource());

API选择建议

**‌测试场景‌:**优先使用fromCollection或socketTextStream快速验证逻辑

**‌生产环境‌:**推荐fromSource配合Kafka/Pulsar等连接器,内置更完善的容错机制

**‌自定义扩展‌:**通过实现Source接口(新版本)替代旧版SourceFunction,支持更细粒度的水位线生成

相关推荐
lifallen4 小时前
Flink SQL 查询 核心概念与实战指南
大数据·数据库·sql·flink
KKKlucifer4 小时前
GPT-4 赋能恶意软件 GPT-MalPro:国内首现动态生成规避检测的勒索程序技术深度解析
大数据·人工智能·gpt
中科岩创4 小时前
某机场工程道桥工程5号下穿通道基坑自动化监测
大数据·人工智能·物联网
好开心啊没烦恼4 小时前
图数据库:基于历史学科的全球历史知识图谱构建,使用Neo4j图数据库实现中国历史与全球历史的关联查询。
大数据·数据库·python·数据挖掘·数据分析·知识图谱·neo4j
下一个绝世5 小时前
免费客户管理系统推荐:适合不同行业的解决方案
大数据·人工智能
RunningShare6 小时前
大数据消息中间件选型终极指南:深度解析Kafka、Pulsar、RocketMQ架构与性能
大数据·kafka·rocketmq·pulsar
盟接之桥8 小时前
盟接之桥说制造:源头制胜,降本增效:从“盟接之桥”看供应链成本控制的底层逻辑
大数据·网络·人工智能·安全·制造
数据皮皮侠8 小时前
中国绿色制造企业数据(绿色工厂|绿色供应链|绿色园区|绿色产品,2017-2023)
大数据·运维·服务器·人工智能·制造·微信开放平台
RFID舜识物联网8 小时前
NFC技术如何破解电子制造领域的效率瓶颈与追溯难题
大数据·人工智能·嵌入式硬件·物联网·安全·制造