starrocks

镜舟科技3 天前
starrocks·sql·ai·prompt·agent·context·mip
从 StarRocks 到 MIP:数据平台的下一步是“理解”文 / 镜舟科技 CEO 孙文现回看 StarRocks 最初面对的客户问题,最直接的感受是:企业产生的数据越来越多,理解和使用数据的速度却没有同步提高。报表要等,复杂查询要等,业务人员提出一个问题后,还要经过数据加工、查询和分析,才能拿到结果。
docsz11 天前
starrocks
StarRocks 4.X实战FE:node-17、node-18、node-19 BE:node-17、node-18、node-19
EatFan12 天前
starrocks·flink·硬件架构·doris·湖仓一体·paimon
从T+1到分钟级:湖仓一体在大厂的真实落地收益对照(携程/网易云信/腾讯)湖仓一体、流式湖仓的架构文章已经不稀缺。公开可见的工程分享里,Flink 与 Paimon/Fluss 组合承担流式入湖,再由 StarRocks、Doris、Hologres 或湖上直查承担分析侧,这套范式在抖音、淘天、携程、京东物流、蚂蚁、淘宝闪购等企业的实践分享中反复出现 [1][4][5][6][7][8]。但绝大多数团队在立项评审时仍会卡在同一个问题上:这些架构我看得懂,收益数字我算不出来。
StarRocks_labs23 天前
数据库·starrocks·sql·ai·pipeline·数据处理·join
当大模型调用进入执行引擎:StarRocks AI Function 全新能力解析作者:王晓龙 阿里云技术专家;商静坤 阿里云高级开发工程师在越来越多的数据分析场景中,数据库查询已经不再是处理链路的终点。查询得到的文本、图片等数据,还需要经过模型完成摘要、分类、信息抽取、语义判断或向量化,再进入后续分析。
智码看视界1 个月前
大数据·starrocks·olap·数据建模·列式存储·clickhouse对比
大数据架构深度解析:StarRocks 实时数仓搭建:比 ClickHouse 更适合多维分析的场景很多团队早期用 ClickHouse 扛分析,但很快遇到三个痛点:多表 Join 慢:CH 擅长单表聚合,大表 Join 常常要改写成宽表,ETL 复杂
StarRocks_labs1 个月前
starrocks·sql·paimon·variant·shredding
StarRocks 如何查询 Paimon 半结构化数据?Variant、Shredding 与 SQL 实践作者:王日宇(霁谦)StarRocks Committer;阿里云技术专家在电商订单、用户行为和设备日志等场景中,一条数据通常同时包含两类信息:
StarRocks_labs1 个月前
starrocks·flink·jni·native·paimon·湖仓·fluss
StarRocks × Fluss × Paimon:流湖仓分析与 ETL 闭环作者:段彦 阿里云高级研发工程师导读:在传统数据架构中,一份数据从业务系统产生,到最终支撑分析、风控、报表及对外服务,往往需要经过多套系统、多份存储和多次口径对齐。随着业务对秒级数据新鲜度、运维效率及湖仓能力提出更高要求,传统架构的局限也愈发明显。
StarRocks_labs1 个月前
starrocks·flink·sstable·compaction·tablet·主键索引·存算分离架构
StarRocks 存算分离架构下的大规模实时导入优化实践作者:王衍波, StarRocks TSC Member;镜舟科技高级研发工程师导读:存算分离架构能够显著降低存储成本并提升系统弹性,但随着实时数据规模不断增长,对象存储请求、小文件、Compaction 以及 Publish 等环节逐渐成为大规模实时导入的性能瓶颈。针对这些挑战,StarRocks 围绕文件合并、大 Tablet、Tablet 内并行和主键索引优化等关键技术进行了系统性优化,并在多个生产场景中取得了显著效果。本文整理自王衍波在 Flink Forward Asia 2026 的分享,将介
StarRocks_labs1 个月前
starrocks·olap·schema·paimon·fluss·湖流一体
基于 Fluss、Paimon 与 StarRocks 构建淘天集团湖流一体数据链路作者:朱奥,淘天集团高级数据开发工程师导读:本文整理自淘天集团朱奥在 Flink Forward Asia 2026 的分享,介绍了 Fluss、Paimon 与 StarRocks 构建湖流一体架构的实践:Fluss 负责秒级实时数据,Paimon 沉淀历史数据,StarRocks 提供统一分析入口,实现秒级至历史数据的一体化分析。目前,该方案已实现开发效率提升 50% 以上、实时链路成本降低 80% 以上。
StarRocks_labs1 个月前
starrocks·ai·commit·分析·claude code
从 6000+ Commit 中识别升级风险:一个 StarRocks AI 升级扫描工具的实现摘要:本文转载自 StarRocks 社区贡献者 crossoverJie。在 StarRocks 跨版本升级过程中,如何快速识别潜在兼容性风险,一直是许多团队面临的现实问题。近期,crossoverJie 基于 Claude Code 开发了一款 StarRocks 升级风险扫描工具,通过 AI 辅助分析升级过程中的配置变更、兼容性影响及潜在风险点。
StarRocks_labs1 个月前
运维·starrocks·iceberg·schema·物化视图·tablet·存算分离架构
StarRocks 4.1:聚焦生产实践,持续降低运维复杂度高性能分析一直是 StarRocks 的核心优势,但性能本身并不足以保障生产环境的稳定运行。对于大规模部署 StarRocks 的团队而言,尤其是在面向客户的多租户分析场景中,仍然会面临一些常见的运维挑战:
StarRocks_labs1 个月前
starrocks·kafka·lambda·查询·paimon·fluss·湖流一体
StarRocks x Fluss x Paimon 湖流一体方案:构建秒级响应、湖流一体的实时数据引擎StarRocks x Fluss x Paimon 湖流一体方案通过将 Apache Fluss(面向分析场景的实时流存储)与 Apache Paimon(高性能湖格式表)深度融合,以 StarRocks 作为统一查询入口,构建了一套具备秒级新鲜度、十倍成本降低、一份数据一次查询的全新实时数据引擎。本文将介绍该方案的核心架构、技术优势、查询模式以及实现原理。
StarRocks_labs1 个月前
starrocks·paimon·业务分析·多模态处理·混合检索·全模态能力·内容处理
StarRocks 全模态能力导读:连接内容理解、混合检索与业务分析作者:周康,阿里云开源 OLAP 引擎团队负责人;StarRocks TSC Member导读:当图片、视频和文档经过模型理解并转化为描述、标签和向量,业务需要解决的已不只是“如何找到相似内容”,还包括结构化过滤、混合检索及后续的关联分析。本文将介绍 StarRocks 为什么建设全模态能力,以及多模态处理、内表、Paimon 和 Lance 四个能力方向如何连接内容理解、检索与业务分析。
大大大大晴天️2 个月前
大数据·starrocks
StarRocks 的查询性能为什么快?StarRocks 的查询链路可以拆成规划、调度、执行三段:FE 解析、分析并优化 SQL,调度器和 Coordinator 将计划分发到参与执行的后端节点,最终由 Pipeline Engine 执行计划。
大大大大晴天️2 个月前
大数据·starrocks
浅析StarRocks 表设计:表类型、分布策略与索引StarRocks 的表设计不是一个孤立的 DDL 选择题,而是围绕数据特征、写入方式、查询收益建立的一套物理设计方法。
大大大大晴天️2 个月前
大数据·starrocks·olap
读懂 StarRocks 架构:FE、BE、CN 与 MPP 查询链路协同StarRocks 整体架构极为精简,仅由 FE 和 BE(或 CN)两类进程构成,不依赖任何外部组件(如 ZooKeeper、HDFS 等),极大降低了部署和运维复杂度。
大大大大晴天️2 个月前
大数据·starrocks·hudi
Hudi + StarRocks 查询加速:原理与实践Hudi 作为主流的数据湖表格式之一,凭借其增量处理能力和ACID 事务支持成为企业数据平台的核心组件。然而,直接通过 Spark/Trino 查询 Hudi 表往往面临以下痛点:
吉甫作诵3 个月前
大数据·starrocks·备份恢复
StarRocks 备份与恢复实战:基于 MinIO 的 S3 存储方案StarRocks 作为一款 OLAP 分析型数据库,承载着大量业务报表和数据分析结果。虽然数据通常有上游数据源可以重跑,但以下场景备份依然必不可少: