big data

韩风6665 小时前
big data
大数据概念数据湖一个现代数据湖(湖仓一体)的架构,通常包含以下几个关键层次:存储层 (Storage):负责存储原始数据文件,如HDFS、S3、OSS、MinIO等。
shirsl2 天前
大数据·数据库·sql·big data
数据开发每日面试题 Day 5来源:近期公开面经|字节跳动|数据开发与数据分析岗|面试时间 2026-03-31|难度:★★★★☆牛客近期收录的这场面试明确记录了“Spark 参数怎么调”,随后继续追问 Hive、Spark、数据湖等分布式架构共有的性能瓶颈。
喻师傅3 天前
大数据·数据仓库·big data
Apache Hudi 概述:从 Parquet 更新难题到数据湖 Upsert在数据仓库和数据湖场景中,Parquet 应该是大家非常熟悉的一种文件格式。列式存储、压缩率高、对分析类查询友好,这些特点让它非常适合承载海量明细数据。因此在实际的大数据系统中,我们经常会把数据以 Parquet 的形式存放在 HDFS、S3、OSS 等存储系统上。
shirsl8 天前
数据库·sql·big data
数据开发实时项目问题整理Flink 通过 checkpoint 保存状态,通过 JobManager HA 保存任务元数据,故障后可以根据 checkpoint 恢复任务状态和 Kafka offset,从而继续处理。
shirsl9 天前
大数据·数据库·sql·big data
数据开发每日面试题 Day 1同一用户一天可能登录多次。求每个用户最长连续登录天数。核心考察点: 去重、窗口函数、row_number()、连续区间问题。
weixin_3077791320 天前
python·spark·云计算·big data
PySpark根据输入的表名和过滤条件生成 INSERT 语句以下是一个完整的 PySpark 解决方案,用于根据输入的表名和过滤条件生成 INSERT 语句。代码考虑了不同数据类型的格式化、NULL 处理、单引号转义以及列名的安全引用,并提供了两种使用方式(收集到驱动端和分布式写入文件)。
迅易科技1 个月前
大数据·制造·big data
从数据可视化到运营闭环,制造企业如何构建卓越运营数字化体系?在上一篇文章《为什么上了MES和BI,制造企业的问题还是在重复发生?》中我们讨论过一个现象:很多企业已经完成了ERP、MES、WMS、BI的建设,但依旧存在问题,指标持续波动找不到根因,改善活动难以跟踪,各部门各看各的数据。
开开心心就好2 个月前
java·开发语言·elasticsearch·ocr·excel·音视频·big data
内存清理工具定时自动清理开机自启动软件介绍MyClearMem,这应该是今天推荐的几款内存清理工具里最小的一个——只有224KB。绿色单文件,双击就能用,不占空间。
迅易科技2 个月前
微软·big data·powerbi
Power BI 新功能解读:重构 AI 时代的企业数据建设内核过去一年,从Copilot智能助手、各类大模型,到企业数字员工、智能Agent,AI不再是行业热词,而是实打实的落地刚需。
真上帝的左手2 个月前
大数据·big data
19. 大数据-概念大数据(Big Data)通常被定义为具有以下三大核心特征(即“3V”模型,图中展示了其中三个关键维度):
陆水A2 个月前
大数据·数据库·自然语言处理·big data·etl工程师
【问数系统】SQL跑对了图表却空了?打通问数系统最后1公里的3个API坑这是【问数系统拆解】系列第7篇。上篇讲流式续流——用户断网了对话怎么不丢。这篇讲一个被所有人忽略的环节:SQL跑出来了,结果也返回了,但用户还是看不懂。
真上帝的左手3 个月前
大数据·big data
19. 大数据-技术生态大数据(Big Data)‌大数据(Big Data)是指无法用传统数据处理工具处理的大规模数据集合,具有数据量大、数据类型多、数据生成速度快、数据价值密度低等特点。 大数据的处理技术包括分布式存储和计算、数据清洗和转换、数据分析和可视化等。 分布式存储和计算是通过多台计算机协同工作来处理大规模数据,如Hadoop、Spark等; 数据清洗和转换是对大数据进行预处理,如数据去重、数据转换等; 数据分析和可视化是对大数据进行分析和展示,如机器学习、数据可视化等。 大数据的设计和实现需要考虑数据源、数据质量、
明明跟你说过4 个月前
大数据·elk·elasticsearch·kafka·big data·bigdata
Kafka 与 Elasticsearch 的集成应用案例深度解析🐇明明跟你说过:个人主页🏅个人专栏:《大数据前沿:技术与应用并进》🏅🔖行路有良友,便是天堂🔖
李白的天不白5 个月前
big data
删除文件方法在 Windows 系统中,遇到文件“删不掉”通常是因为文件被后台程序占用、权限不足或文件名异常。为了帮你解决这个问题,我整理了从最简单到最暴力的几种解决方案,你可以根据实际情况按顺序尝试。
zhixingheyi_tian5 个月前
big data
KunPeng 之 BoostKithttps://www.hikunpeng.com/document/detail/zh/kunpengbds/appAccelFeatures/sqlqueryaccelf/kunpengbds_omniruntime_20_0205.html
开开心心就好6 个月前
人工智能·pdf·音视频·语音识别·big data·媒体·consul
禁止指定软件运行的小工具仅1M软件介绍今天要说的这款工具叫“禁止软件运行”,它是一款只有1MB大小的小工具。作者做它的初衷,是为了阻止他们学校老师远程操作某些软件。
yumgpkpm6 个月前
人工智能·hadoop·elasticsearch·flink·kafka·企业微信·big data
华为昇腾910B 开源软件GPUStack的介绍(Cloudera CDH、CDP)开源软件GPUStack的介绍GPUStack 是一个开源的、轻量级的大模型(LLM)推理与管理平台。它的核心目标是让用户能够极其简单地在本地服务器、边缘设备或集群上部署、管理和运行各种开源大语言模型(如 Llama 3, Qwen, DeepSeek 等),并提供统一的 API 接口供应用调用。
网络工程小王6 个月前
大数据·hadoop·hdfs·big data
【大数据技术详解】——HBase技术(学习笔记)目录HBase 技术深度解析一、核心定位与适用场景✅ 典型用途🎯 适用场景(CAP 理论:CP 系统)
网络工程小王6 个月前
hadoop·hdfs·big data
【大数据技术详解】——HDFS技术(学习笔记)HDFS(Hadoop Distributed File System)是 Hadoop 的核心组件之一,设计用于存储超大规模数据集,并运行在廉价硬件上。其核心特点包括: