Link入门

Filk概述

概念介绍

Apache Flink® --- Stateful Computations over Data Streams | Apache Flink

大致意思:Filk是一个

  1. 框架
  2. 分布式处引擎
  3. 支持有界和无界状态计算。
  • 有界数据指的是有开始的标志也有结束的标志
  • 这里的分布式强调的是不同的节点能进行不同的任务
  • 状态计算指的是在进行计算的时候能保留计算的中间结果

离线数仓和实时数仓对比

离线数仓 实时数仓
处理方式 批处理 流处理
数据稳定性 数据固定 数据变化
数据量
处理时间
划分依据 T+1 T

T+1表示的是现在一个单位时间之前,这里的单位时间可以说一天也可以一年;

Flink特点

处理数据的目标:

  • 低延迟
  • 高吞吐:每毫秒处理百万个数据
  • 准确性:提供了事件时间和处理时间
  • 容错性:状态基本一致
  • 可以连接到常用的外部系统:如Kfka,Hive,JDBC
  • 高可用:从故障中快速恢复,借助于Yarn

Flink和SparkStreaming对比

Spark是一个微批次数据的框架(他有一个'攒'批操作)

Flink Streaming
计算模型 流计算 微批处理
时间语义 事件时间+处理时间 处理时间
窗口 多、灵活 少、不灵活
状态 没有
流式SQL 没有

窗口

  • SparkStreaming窗口:滚动窗口、滑动窗口(必须是采集周期的整数倍)
  • FLink窗口:基于时间窗口,基于事件的窗口等;

Flink分层API

  1. 最高层语言:SQL

  2. 声明式领域专用语言:Table API

  3. 核心API:DataStream(无界数据)

    ​ DateSet(有界无界数据)

  4. 底层API:有状态流处理(基础数据操作map,flatMap)

相关推荐
皮皮林5519 小时前
开源实力派,给本地 AI 装上深度调研能力,一张 3090 跑到 95.7 分!
后端
努力的小雨10 小时前
把 Windows 桌面图标做成一个会自己运转的小世界
后端
武子康10 小时前
Search Console Platform Properties 扩大 SEO 资产边界:从 Page Ranking 到 Topic Coverage(5 类误读边界 + 3 表数据层设计)
前端·人工智能·后端
腾渊信息科技公司11 小时前
Spring Boot对接MES实战:视觉检测数据自动同步方案
java·人工智能·spring boot·后端·计算机视觉·ai·软件需求
IT_陈寒12 小时前
Vue这个特性差点让我加班到凌晨,谁懂啊
前端·人工智能·后端
段一凡-华北理工大学12 小时前
向量数据库实战:选型、调优与落地~系列文章12:文本分块策略实战:chunk_size 怎么选?重叠多少?
开发语言·数据库·后端·oracle·rust·工业智能体·高炉智能化
码事漫谈13 小时前
1999年的电商前夜和2026年的AI前夜 历史押韵但从不重复
后端
Conan在掘金14 小时前
鸿蒙报错速查:arkts-strict-typing Property does not exist on type 'object',object 装函数就炸,根因 + 真解法
后端
颜酱14 小时前
01 | 骨架搭建:FastAPI + Vue 跑通第一个 SSE 流式问答
前端·人工智能·后端
程序员cxuan15 小时前
Grok Build 被众人唾骂,结果老马把它开源了
人工智能·后端·程序员