大数据湖仓架构

一切如来心秘密1 天前
智驾数据闭环·大数据湖仓架构
数据闭环向量化流水线:Embedding 批量生产与湖仓向量表设计到上一篇为止,每张图片已经拥有了「结构化标签 + 自然语言说明」的双重表达。但要在千万张图片里回答「帮我找一批跟这张图相似的场景」,靠标签 LIKE 是做不到语义级匹配的——还需要把图片和文字编码成同一空间里的向量。这就是向量化流水线(Embedding 流水线)的职责。
一切如来心秘密2 天前
智驾数据闭环·大数据湖仓架构
数据闭环VLM 推理挖掘:多模态大模型如何补足长尾场景标签上篇说过,规则引擎再强也有够不着的地方:「施工区锥桶摆放混乱」「行人撑着花伞」「逆光下的临时交通管制」——这类语义级场景,结构化条件根本写不出来。这正是多模态大模型(VLM)推理挖掘的领地:让模型「看图说话」,把画面里的语义读成标签和说明。
一切如来心秘密15 天前
智驾数据闭环·大数据湖仓架构
智驾数据闭环湖仓实战:Flink CDC 实时入湖,多源数据接入架构设计上一篇我们把湖仓的「读」讲完了——双路查询架构让业务平台各取所需。但所有查询的前提是:数据得先进到湖里。智驾数据闭环的入湖数据源五花八门:五个平台的 MySQL 业务库、四类实时事件流、还有体量最大的采集大文件——延迟要求从秒级到亚秒级不等,合规要求也完全不同。
一切如来心秘密20 天前
智驾数据闭环·大数据湖仓架构
智驾数据闭环湖仓实战:StarRocks + Paimon 双路查询架构上一篇我们把 79+ 张表的命名、分区、Bucket 设计讲完了,有读者问了一个非常实际的工程问题:「数据都在 Paimon 湖仓里,但闭环大盘要毫秒级响应、训练平台点查难例库要随机圈选——查询引擎到底怎么查湖?全部导进 StarRocks,还是直接查外部表?」
我是有底线的