hdfs

程序员梅雨7 天前
大数据·hdfs
大数据修炼之路(二):HDFS 核心架构与面试详解引言:什么是大数据思维? 在进入 HDFS 之前,先建立一个核心思维:分而治之(Divide and Conquer)。 当你面对 1TB 的数据,单机内存(1GB)根本装不下时,不要尝试搞什么复杂的算法。直接用最朴素的思想:* 查重:根据 HashCode 对 1000 取模,把大文件拆成 1000 个小文件,保证相同的数据落在一个文件,再逐个用 HashSet 查重。* 排序:切分成多个小文件,内部排好序,最后采用归并排序合并。 这就是 HDFS 底层最朴素的生存逻辑。
爱吃火鸡面呀11 天前
hadoop·hdfs·架构
HDFS 架构深度解析:从核心组件到数据读写全流程HDFS(Hadoop Distributed File System,Hadoop 分布式文件系统)是 Hadoop 生态系统的核心组件之一,它采用主从架构(Master/Slave Architecture),专门设计用于在廉价商用服务器上存储大规模数据集。HDFS 的设计理念源于 Google 的 GFS(Google File System),其核心目标是实现高容错性、高吞吐量,适合处理海量数据的批处理任务。
爱吃火鸡面呀12 天前
大数据·hadoop·hdfs
HDFS 文件读取流程深度解析:从客户端请求到数据落地的完整链路HDFS(Hadoop Distributed File System)是 Hadoop 生态系统的核心分布式存储组件,其设计目标是支持海量数据的可靠存储与高效访问。在 HDFS 的日常使用中,文件读取是最频繁、最基础的操作之一。无论是运行 MapReduce 作业、Spark 任务,还是通过 Hive、HBase 等上层组件访问数据,底层都离不开 HDFS 的文件读取流程。
崖边看雾13 天前
大数据·hadoop·hdfs
Hadoop —— HDFS 写数据流程HDFS ClientHDFS 客户端,属于一套代码库,不是独立进程。命令行、Java 代码上传文件本质就是加载这套客户端库。
崖边看雾13 天前
大数据·hadoop·hdfs
Hadoop —— HDFS 读流程先记住最核心的一句话:NameNode 只管「目录、文件信息、数据块在哪」;真正的文件内容,全部存在 DataNode 上。读文件时 NameNode 不给你传文件内容,只告诉你去哪找,客户端直接去找 DataNode 拿数据。
磁场转动100万匹13 天前
hadoop·hdfs·mapreduce
HDFS 与 MapReduce 核心原理详解HDFS Shell 命令是操作 Hadoop 分布式文件系统最基础、最常用的方式。它通过 hdfs dfs 或 hadoop fs 前缀调用,两者在大多数场景下等价。下面按功能分类介绍常用命令。
ha_lydms17 天前
大数据·hadoop·hdfs·yarn·调度·aliyun·计算
HDFS 简介随着数据量越来越大,一个操作系统已经存不下所有的数据,那么就分配到更多的操作系统管理的磁盘中,但是不方便管理和维护,这时候迫切需要一种系统来管理多台机器上的文件,这就是分布式文件管理系统。HDFS只是分布式文件管理系统中的一种。
ha_lydms17 天前
大数据·hadoop·hdfs·mapreduce·yarn·maxcompute·odps
HDFS的读写流程在HDFS写数据的过程中,NameNode会选择距离待上传数据最近距离的DataNode接收数据。那么这个最近距离怎么计算呢? 节点距离:两个节点到达最近的共同祖先的距离总和。
2601_9620725023 天前
大数据·mysql·hdfs
大数据-234 离线数仓 - 异构数据源 DataX 将数据 从 HDFS 到 MySQL点一下关注吧!!!非常感谢!!持续更新!!!----------------------Java篇开始了!---------目前开始更新 MyBatis,一起深入浅出!目前已经更新到了:---------* Hadoop(已更完)* HDFS(已更完)* MapReduce(已更完)* Hive(已更完)* Flume(已更完)* Sqoop(已更完)* Zookeeper(已更完)* HBase(已更完)* Redis (已更完)* Kafka(已更完)* Spark(已更完)* Flink(已更完)*
-今昭-1 个月前
运维·hadoop·hdfs·负载均衡
Hadoop HDFS 高可用实战指南目录ZooKeeper 集群部署指南1. 环境准备与规划2. 软件安装与配置3. 集群节点配置4. 启动集群与状态验证
Waay1 个月前
大数据·数据库·hive·hadoop·hdfs·hbase
什么是HBase?它和Hive有什么区别?Hive:离线大数据仓库,存日志、订单批量数据,只能做批量统计查询,不能实时根据某一条 ID 快速查数据;
我要用代码向我喜欢的女孩表白1 个月前
大数据·hadoop·hdfs
hdfs获取所有路径大小的脚本AI提示词 帮我写个shell脚本,我会给你一个hdfs路径的txt, 你帮我拼接一下 txt路径如下: /user/hive/warehouse/ods_s.db/rt_ppdai_pfl_transfour_tb_order /user/hive/warehouse/ods_s.db/rt_ppdai_pfl_transfour_tb_orde1 /user/hive/warehouse/ods_s.db/rt_ppdai_pfl_transfour_tb_orde2 读取txt, hdfs dfs
我登哥MVP2 个月前
java·hadoop·hdfs·云原生·云计算
HDFS硬核拆解-读写Pipeline与Java实战你有一个 10TB 的文件,单机存不下怎么办?答案是:把它切成小块,分散存储在多台机器上。但这又带来了新问题——如何保证数据不丢?如何找到我需要的数据?HDFS 就是为此而生的。
ljs6482739512 个月前
大数据·hadoop·hdfs
VMware 中部署 HDFS 集群环境(Hadoop 3.4.3)完整指南本文详细记录从零开始在 VMware 虚拟机中搭建 3 节点 Hadoop HDFS 分布式文件系统集群的全过程,基于 CentOS 系统,Hadoop 版本 3.4.3。
李昊哲小课3 个月前
大数据·hadoop·分布式·ubuntu·hdfs·mapreduce
Ubuntu26.04 搭建 Hadoop3.5.0 完全分布式nodejs python scala maven 是为 其他集群和开发环境准备的 如果只是搭建hadoop集群可以忽略
makise-3 个月前
大数据·hdfs·架构
破译大数据底层密码:从 HDFS 存储基石到现代分布式计算引擎的架构演进在互联网业务呈爆发式增长的今天,企业每天产生的数据量已经从 GB 级跃升到了 TB 级甚至 PB 级。传统的单机存储与集中式数据库,在面对如此海量的数据时,无论是从磁盘容量、I/O 读写速度还是计算能力上,都早已触及了物理瓶颈。
abcy0712133 个月前
python·hdfs·flask
flask celery hdfs 异步上传在Flask和Celery环境下实现异步上传文件到HDFS(Hadoop Distributed File System)的功能,可以大大提高Web应用的性能和用户体验。以下是一个详细的步骤和代码示例,帮助你实现这一功能。
abcy0712133 个月前
python·hdfs·fastapi
python fastapi celery hdfs 异步上传在Python中使用FastAPI和Celery结合HDFS(Hadoop Distributed File System)进行异步上传图文教程,可以分为以下几个步骤来实现:
abcy0712133 个月前
python·hdfs
python InsecureClient 上传下载查看删除实例使用 hdfs 库中的 InsecureClient 操作 HDFS,需先安装依赖:pip install hdfs。以下实例涵盖连接、上传、下载、查看(列表/状态/内容)及删除操作 。‌‌
知识分享小能手3 个月前
hadoop·学习·hdfs
Hadoop学习教程,从入门到精通, HDFS分布式文件系统 — 完整知识点与案例代码(3)HDFS(Hadoop Distributed File System)是 Apache Hadoop 项目的核心子项目,是一个分布式、可扩展、高容错的文件系统。