flink kafka sink (scala)

将对象数据通过Gson 转为jsonString,在将数据写到kafka中,这个可以根据需要修改,比如按照\t分开也行,可以节省字段名称的空间。

这里还有一个问题,就是每来一条数据都需要new Gson 对象,有没有办法减少创建呢

我们知道job 和task之间是不能够传输序列化的对象的。

那么如果需要减少Gson的创建,可以自定义map函数,继承并实现RichMapFunction中的方法,其中open就可以只创建一次Gson。

data.map(new Gson().toJson(_))

.addSink(new FlinkKafkaProducerString("topicName", new SimpleStringSchema(), props, Optional.ofNullableFlinkKafkaPartitioner\[String](null)))

.uid("write-to-kafka")

.name("write-to-kafka")

自定义map:

private class DemoMap extends RichMapFunctionData, String {

var gson:Gson=_

override def open(parameters: Configuration): Unit = {

gson=new Gson()

}

override def map(value: Data): String = {

gson.toJson(value)

}

override def close(): Unit = {

}

}

相关推荐
functionflux17 小时前
kafka-python:Python 生态中最成熟的 Kafka 客户端
分布式·python·其他·kafka
暴躁小师兄数据学院18 小时前
【AI大数据工程师特训笔记】第15讲:大数据环境安装
大数据·hadoop·flink·spark
抛砖者20 小时前
flink打包方式问题
大数据·flink
q21030633721 天前
kafka启动几秒后挂了,重启多次无果
分布式·kafka
abcy0712131 天前
在Python 中使用Celery和Kafka进行消息队列的生产者和消费者实现
python·kafka
大大大大晴天️1 天前
Flink Resource Providers 深度解析:机制原理、部署模式与最佳实践
大数据·flink
大大大大晴天2 天前
Flink Resource Providers 深度解析:机制原理、部署模式与最佳实践
flink
阿坤带你走近大数据2 天前
如何保证kafka中的数据一致性
分布式·kafka
阿坤带你走近大数据2 天前
Kafka中的分区概念
分布式·kafka
uyermw_4112 天前
PyTorch数据集与加载器全解析
flink·etcd