数据开发

梦想画家1 天前
大数据·数据开发·sqlmesh
SQLMesh 告警落地实践:SQL 模型跑挂了,如何自动发邮件并推送自建业务系统本文基于 SQLMesh 官方 Notifications guide 编写,所有示例均在 sqlmesh 0.236.3 上实际跑通验证(含邮件发信、Webhook 推送、审计失败触发)。 示例只涉及 SQL 模型,不涉及 Python 模型;自定义 Webhook 目标所需的少量 Python 代码放在 配置文件 里,与建模语言无关。
梦想画家1 天前
大数据·数据开发·sqlmesh
SQLMesh 宏实现循环完全指南:@EACH、Python 宏与 SQLGlot 表达式实战在数据工程中,"把同样的逻辑对 30 个列各写一遍"是重复代码的重灾区。SQLMesh 提供了多种在 SQL 模型中实现"循环"的手段:内置的 @EACH 宏操作符、Python @macro() 函数中的原生 for 循环,以及 Jinja 模板的 {% for %} 语法。本文重点讲解前两者——SQLMesh 原生宏与 Python 宏,并深入介绍如何用 SQLGlot 表达式以"语义感知"的方式安全地拼接 SQL;Jinja 宏仅作简要提及。全文配有 8 个可落地的实战案例(PIVOT 指示列、Sc
梦想画家1 天前
大数据·数据开发·sqlmesh
SQLMesh 配置:为什么值得用 Python,而不是 YAMLSQLMesh 的配置文件有两种:config.yaml 与 config.py。官方的说法很直接:YAML 更简单,推荐大多数项目使用;Python 更复杂,但提供了 YAML 不支持的能力——config.py 会被 Python 解释器真正执行,因此配置里可以有判断、函数、第三方 SDK,以及"当前在什么环境、由谁运行"的信息。
梦想画家2 天前
大数据·数据开发·sqlmesh
SQLMesh 告警实战:只用 YAML 配置和 SQL 模型,搭一套数据管道告警这一篇不写一行 Python。全程只用两样东西:config.yml 配置文件,和 .sql 模型文件。
梦想画家6 天前
数据库·数据开发·sqlmesh
SQLMesh 模型类型详解(三):MANAGED——把数据刷新外包给引擎本系列基于 SQLMesh 官方文档整理,讲三种"不走常规计算路径"的模型类型,每篇一种:主要参考:常规表需要你自己负责数据更新。但有些引擎支持一种"引擎自己保证表内数据是最新的"的表:它基于一个读取其他表的查询构建,一旦被读的基表发生变化,数据库就自动让这张托管表反映这些变化,用户不需要做任何额外操作(尤其不需要手动发 REFRESH)。
阿坤带你走近大数据2 个月前
数据开发·基金
基金对口简历包装好,信息够了 👍 你给的这些已经足够我帮你搭出一个经得住技术深挖的面试素材。我来帮你做三件事:基金核心业务数据平台 ETL 开发(XX 资管 / 基金公司)
Irene19913 个月前
面试·数据开发·证券业
证券业数据开发面试资料分享:风控与合规、反洗钱:KYC流程、大额交易报告(≥50万)、可疑交易识别记住,面试官不指望你精通业务,但希望看到你对行业数据敏感度 。面试被问业务场景,基本围绕这俩 :客户与账户表:核心是 “一码通”(底层唯一识别)、资金账户(买股票的钱放哪)、证券账户(股票持仓在哪)。搞懂它们的关系是基础 。
Irene19914 个月前
数据开发
数据表健康查看与数据质量核验(完整性、准确性、一致性、唯一性、规范性、及时性)要点总结数据表健康状况主要从空间占用、碎片率、统计信息和索引有效性四方面评估。空间膨胀需重建表释放冗余;碎片率超20%需OPTIMIZE或重建;
千桐科技5 个月前
开源·数据治理·数据集成·数据开发·数据中台·元数据管理·qdata
qData 数据中台社区开源版 v1.4.0 发布:元数据管理核心模块正式上线近日,qData 数据中台社区开源版 v1.4.0 正式发布。qData 数据中台是一套面向企业数据治理与数据研发场景的开源数据中台,围绕 ETL 数据集成、数据开发、数据建模、元数据管理、数据质量、数据资产、API 数据服务与 AI 智能问数 等核心能力,支持 MySQL、DM8、Oracle、SQL Server、Kingbase8、Doris 等常用数据库接入,帮助企业快速完成数据接入、清洗转换、资产编目、质量检查、接口开放和 Text2SQL 分析。
千桐科技6 个月前
开源软件·数据治理·数据建模·数据集成·数据开发·数据中台·qdata
qData 数据中台开源版 v1.2.0 正式发布:重构数据建模体系,重塑开发体验!在数字化转型的深水区,你是否也面临着这样的尴尬:为了解决这些痛点,我们很高兴地宣布:qData 数据中台开源版 v1.2.0 正式上线!
ha_lydms9 个月前
大数据·c语言·hive·spark·时序数据库·dataworks·数据开发
2、Spark 函数_a/b/cabs(expr) - Returns the absolute value of the numeric or interval value.
涤生大数据10 个月前
大数据·数据仓库·flink·大数据开发·flink cdc·数据开发·实时数据
放弃Canal后,我们用Flink CDC实现了99.99%的数据一致性对数据的实时性要求越来越高。传统的离线数仓(T+1)已无法满足业务对秒级响应的需求,而实时数仓和数据湖(Data Lake)架构正成为主流。然而,如何将业务数据库中的变更数据(Insert/Update/Delete)低延迟、高可靠、无侵入地同步到下游系统,一直是构建实时链路的关键挑战。
大数据CLUB1 年前
大数据·hadoop·分布式·数据分析·spark·数据开发
基于spark的澳洲光伏发电站选址预测基于spark的澳洲光伏发电站选址预测[👇👇👇👇👇👇👇👇] 点这里,查看所有项目 [👆👆👆👆👆👆👆👆]
linweidong1 年前
大数据·分布式·spark·spark sql·数据开发·shuffle·数据倾斜
深入剖析 Spark Shuffle 机制:从原理到实战优化Spark 的核心魅力在于它的分布式计算能力,而 Shuffle 作为 Spark 分布式计算的“幕后英雄”,却是最容易被忽视又最容易翻车的环节。简单来说,Shuffle 是 Spark 在处理数据时,将数据从一个节点“洗牌”到另一个节点的过程。
涤生大数据1 年前
数据分析·spark·apache·数据开发
Apache Spark 4.0:将大数据分析提升到新的水平Apache Spark 4.0 带来了 PySpark 画图、多态 UDTF、改进的 SQL 脚本和 Python API 更新,以增强实时分析和可用性。 Apache Spark 4.0 于 2025 年发布,它通过增强性能、可访问性和开发者生产力的创新,重新定义了大数据处理。在 Databricks、Apple 和 NVIDIA 等机构的 400 多位开发者的贡献下,Spark 4.0 解决了数千个 JIRA 问题,并引入了诸多变革性功能:PySpark 原生画图、Python 数据源 API、多态
袋鼠云数栈1 年前
大数据·数据库·数据仓库·sql·数据开发·数据中台·袋鼠云
3节点开启大数据时代:EasyMR助力中小企业轻装上阵、国产转型在数字化浪潮中, 数据已成为中小企业竞争力的核心要素。然而,受限于预算、技术和运维能力,众多中小企业在建设大数据平台时常陷入“建不起、用不好”的困境。
涤生大数据1 年前
数据仓库·数据治理·数仓·数据开发·及时性
数据质量问题中,数据及时性怎么保证?如何有深度体系化回答!数据治理,数据质量这快是中大厂,高阶大数据开发面试必备技能,企业基于大数据底座去做数仓,那么首先需要保障的就是数据质量。
小Tomkk2 年前
大数据·数据分析·数据开发·数据运营·数据产品经理
大数据相关职位介绍之一(数据分析,数据开发,数据产品经理,数据运营)随着大数据、人工智能(AI)和机器学习的快速发展,数据分析与管理已经成为各行各业的重要组成部分。从互联网公司到传统行业的数字转型,数据相关职位在中国日益成为推动企业创新和提升竞争力的关键力量。以下是中国市场中常见的数据相关职位的介绍,包括其职责、技能要求以及职位之间的差异。
锵锵锵锵~蒋2 年前
flink·数据开发·实时数据开发
实时数据开发|简单理解Flink流计算中解决乱序的机制--水位线今天继续学习Flink的关键机制–水位线,虽然看文字有种浮于表面、难以理解的感觉,但是我觉得等开发中使用到的时候就会融会贯通了。
知识分享小能手2 年前
大数据·开发语言·数据库·sql·学习·mysql·数据开发
mysql学习教程,从入门到精通,SQL 删除数据(DELETE 语句)(19)在SQL中,TRUNCATE TABLE 语句用于删除表中的所有行,但不删除表本身。这个操作通常比使用 DELETE 语句删除所有行要快,因为它不记录每一行的删除操作到事务日志中,而是直接重新创建表。但请注意,使用 TRUNCATE TABLE 时需要谨慎,因为它无法撤销(即一旦执行,被删除的数据就无法恢复)。