大数据

明月_清风1 小时前
大数据·后端·数据分析
数据进入平台后怎么处理?一文搞懂 ETL上一篇我们介绍了数据平台如何通过全量同步、增量同步、CDC 等方式,把业务系统中的数据采集到平台。但数据进入平台并不意味着可以直接使用。
明月_清风1 小时前
大数据·后端·数据分析
数据处理完放在哪里?一文搞懂数据仓库与数据湖上一篇我们介绍了 ETL。数据从业务系统进入数据平台之后,需要经过清洗、转换、关联和聚合,才能真正变成可以分析的数据。
大大大大晴天1 小时前
大数据
每天认识一个组件:向量化计算加速Apache AuronSpark 已经是大数据批处理和 SQL 分析的事实标准之一,但在数据规模继续增长后,传统逐行处理方式容易带来较高 CPU 延迟,并逐渐成为查询性能瓶颈,因此需要通过 vectorized execution 改善执行效率。
明月_清风1 小时前
大数据·后端·数据分析
数据平台到底是什么?一篇文章搞懂数据平台开发平时我们写业务系统,接触最多的可能是 MySQL、Redis、接口、前端页面。但当一家公司的业务越来越大,系统越来越多之后,一个问题就会慢慢出现:公司的数据越来越多,但是这些数据到底怎么统一管理、处理和分析?这时候,数据平台就出现了。
明月_清风1 小时前
大数据·后端·数据分析
数据是怎么进入数据平台的?一文搞懂数据采集与数据同步上一篇我们介绍了数据平台到底是什么。简单来说,数据平台就是把分散在各种业务系统中的数据采集过来,经过处理和存储,最终提供给数据分析和业务使用。
Databend2 小时前
大数据·数据分析·agent
同样 PASS,路径为何不同|用 Jev 逐 Span 评估 Agent Trace导读:两个 Agent 跑过同一批测试,最后生成的 patch 甚至逐字节相同。只看 PASS 率,它们几乎没有区别。展开 Trace,也就是一次任务中模型请求、工具调用和验证过程的完整记录,一个可能很快找到问题,另一个可能经历多次重复扫描和无效重试。 本文介绍一套逐 span 评估 Agent Trace 的方法。Databend 保存并分析海量 Trace,普通代码处理可以直接确定的事实,Jev 判断每一步是否相关、是否带来新进展。判定结果写回同一个湖仓以后,团队可以继续用 SQL 比较模型和 har
Likeadust2 小时前
大数据·音视频·easydss
上传即转码、分类、嵌入:本地点播/网络点播EasyDSS点播如何撑起企业视频知识库直播负责“实时发生”,点播负责“长期沉淀”。对企业来说,培训课件、产品宣传片、客户案例、操作录屏这些视频内容,真正的价值不在播出的那一刻,而在“随时能被找到、被看懂、被复用”。互联网直播点播平台EasyDSS视频点播把内容管理做成了一套完整的体系:从上传、分类、转码、审批到播放、统计、嵌入,覆盖了视频资产从进来到出去的全生命周期。
Leo.yuan2 小时前
大数据
FineDataLink 5.0 正式发布:实时计算与数据质量两大能力升级,构建可信、实时的数据底座数据集成与治理,正在成为企业数据基础设施中最关键、也最容易被低估的一环。分析平台再先进,业务系统再智能,如果底层的供给能力跟不上,数据接不进来、接进来不实时、接进来不可信,那么上层的一切能力都会失去根基。
大大大大晴天2 小时前
大数据
数据血缘与影响分析:从字段链路到变更治理和故障定位数据质量告警经常给出的是“结果异常”,例如ads_order_daily.pay_amt环比下降 40%、某个字段空值率突增、分区产出延迟、指标口径不一致。但真正需要处理的是后续三个问题:异常从哪里来、影响到哪些报表或服务、修复或变更会不会引入新的问题。
SelectDB2 小时前
大数据·数据库·数据分析
Doris 向量检索上线踩坑记录:七个排查现场与可直接复制的命令线上攒下来的七次排查,全部围绕一个问题:索引明明建了,查询为什么还是慢。 本文是实操笔记形态,每个现场给出现象、一句原因和一条能立刻执行的命令,参数是真实默认值(max_degree 32、ef_construction 40、nlist 1024、quantizer flat、hnsw_ef_search 32,均取自 Apache Doris 官方 ANN 文档)。最后附一份排查顺序清单,出问题从上往下走一遍基本能定位。
SelectDB2 小时前
大数据·数据库·数据分析
一条大查询把集群打挂之后:Apache Doris 稳定性处置与资源隔离速查线上遇到过的场景:一个 BI 分析师拖了个大时间范围,没带过滤条件的 Join 跑起来,BE 内存一路冲高,随后全集群查询开始超时。这篇记的是当时的处置顺序和之后补齐的配置,命令可以直接复制改参数。Apache Doris 侧涉及三件事:先止血、再隔离、最后给兜底。
SelectDB2 小时前
大数据·数据库·数据分析
把 JSON 埋点表迁到 Apache Doris VARIANT:一次完整排错记录迁移当晚遇到的第一条报错长这样:一张跑了两年、把整条 JSON 塞进 STRING 列的埋点表要迁到 Apache Doris 的 VARIANT 类型,从建表到导入到查询改写到最后把这条报错解决掉,全程记下来。所有片段可以直接复制执行。
阿里云大数据AI技术2 小时前
大数据·人工智能·agent
云栖2026 | 阿里云 OpenLake 迈向 Agentic Lake,一份全模态数据驱动智能体就绪当 AI 从问题应答走向生产运行,云基础设施也在加速向 Agentic Cloud 演进。从基础设施、数据平台到应用服务,从 IaaS 到 PaaS,各层能力不仅需要支持面向人的交互,也需要支持面向 Agent 的交互,使 Agent 能够理解、调用并协同使用这些能力,推动云基础设施各层实现智能体就绪。
SelectDB2 小时前
大数据·数据库·数据分析
联邦查询慢到不能用?查湖排错的 6 个现场,附可直接复制的命令片段摘要:在 Apache Doris 上直读湖上数据的链路比查内表长,出问题的位置也更多。这篇按"现象 → 原因 → 命令片段"整理 6 个现场:Catalog 建成功但库表为空、元数据缓存导致新分区不可见(Iceberg 元数据缓存默认 TTL 86400 秒,官方 Iceberg Catalog 文档)、物化视图建完没生效、第一次慢第二次快、一个大查询拖垮其他查询、冷热分层出现数据缺口。结论很短,命令可以照抄。
用户3610588626122 小时前
大数据·flink
Flink Keyed Window 详解及代码实现:从并行计算原理到数据倾斜优化上一篇讲了 Global Window——把所有元素放进同一个窗口,触发时机完全自定义。但 Global Window 有个致命问题:所有数据都在一个窗口里,并行度只能是 1,数据量稍大就成了作业瓶颈。
SelectDB2 小时前
大数据·数据库·数据分析
Apache Doris 高性能 Open Lake Variant 读写技术解析(含对比数据)导读:Apache Doris 5.0 多模湖仓预告(5)|技术解读篇:面对日志、事件、AI 调用等不断变化的半结构化数据,如何既保留灵活结构,又实现高效查询?从 Doris 4.2 开始,Iceberg、Paimon 中的 Variant 数据可以直接高效读写,并通过按需读取、拆列优化和向量化计算提升查询效率。本轮测试中,相比 Spark,Doris 冷跑综合加速 15.10×、热跑 19.14×;拆列场景热跑综合加速达 58.64×,部分 Paimon 测试超过 106×。本文将介绍这些性能提升背后的
阿里云大数据AI技术2 小时前
大数据·人工智能·elasticsearch
云栖2026|从“找到答案”到“完成任务”:阿里云以 Agentic Search 重塑 AI 搜索阿里云在2026云栖大会分享 AI 搜索新范式与新引擎,推动企业搜索从信息获取迈向可规划、可执行、可进化的 Agent 基础设施。
SelectDB2 小时前
大数据·数据库·数据分析
多表 Join 与实时更新:Apache Doris 建表、调优与验证全流程(附 ClickHouse 对照)摘要:多表关联到底该怎么建表、更新为什么要写成 Merge-on-Write、调优后拿什么指标证明有效——这三件事决定了星型模型能不能在 OLAP 引擎上跑住。本文给出一套从建表语句到参数表再到验证步骤的完整路径,全部基于 Apache Doris 官方文档可核验的语法与默认值;对照数据取自官方 Benchmark(SSB sf1000 11.6s vs 82.2s、TPC-DS sf1000 173.8s vs 1913.9s)。
阿里云大数据AI技术2 小时前
大数据·人工智能·agent
云栖2026|湖生万物,助力 AI — 面向 Agent 的全模态数据平台近日,在 2026 云栖大会"Agent 驱动的全模态大数据计算创新"论坛上,阿里云智能集团计算平台事业部开源大数据平台负责人王峰(莫问)发表主题演讲,系统阐述了阿里云 开源大数据平台面向 Agentic AI 时代的演进新范式。阿里云以 DLF、Flink、EMR Spark/Ray/Daft、EMR StarRocks、Milvus 五大核心产品协同构建了"Agentic Lake + Agentic Streaming"技术体系,为自动驾驶、具身智能、大模型数据预处理、企业智能运营等场景提供下一代全