技术栈
hadoop
IT毕设梦工厂
7 小时前
大数据
·
hadoop
·
python
·
信息可视化
·
spark
·
课程设计
·
大数据毕设项目
计算机毕业设计选题推荐:基于大数据的印度上市公司财务指标数据可视化分析|毕业设计选题|计算机毕设|选题推荐|毕设指导|项目定制|源码|高质量项目
✨作者主页:IT毕设梦工厂✨ 个人简介:曾从事计算机专业培训教学,擅长Java、Python、PHP、.NET、Node.js、GO、微信小程序、安卓Android等项目实战。接项目定制开发、代码讲解、答辩教学、文档编写、降重等。 ☑文末获取源码☑ 精彩专栏推荐⬇⬇⬇ Java项目 Python项目 安卓项目 微信小程序项目
爱吃火鸡面呀
12 小时前
大数据
·
hadoop
·
hdfs
HDFS 文件读取流程深度解析:从客户端请求到数据落地的完整链路
HDFS(Hadoop Distributed File System)是 Hadoop 生态系统的核心分布式存储组件,其设计目标是支持海量数据的可靠存储与高效访问。在 HDFS 的日常使用中,文件读取是最频繁、最基础的操作之一。无论是运行 MapReduce 作业、Spark 任务,还是通过 Hive、HBase 等上层组件访问数据,底层都离不开 HDFS 的文件读取流程。
kaoa000
13 小时前
大数据
·
linux
·
hadoop
·
分布式
Linux入门攻坚——89、Hadoop-1-架构及概念
大数据:Bigdata 大数据时代:大数据、云计算、物联网 大数据:技术方面,存储、计算、网络的发展,解决了海量数据的存储、处理、传输问题;数据产生方式方面:运营式系统产生(销售系统、ERP系统等)、用户原创(博客、微博、论坛等)产生、感知式系统产生(主要是物联网),特别是物联网的出现,如各种监控系统,数据无时无刻都在不停产生,并且数量巨大。
BYSJMG
13 小时前
大数据
·
hadoop
·
信息可视化
·
数据分析
·
spark
·
kmeans
·
课程设计
计算机毕业设计选题推荐:基于大数据的水质多指标关联分析与可视化的设计与实现,Spark 加 K-Means 做水质分群
精彩专栏推荐订阅:在下方主页👇🏻👇🏻👇🏻👇🏻💖🔥作者主页:计算机毕设木哥🔥 💖
计算机源码社
14 小时前
大数据
·
hadoop
·
python
·
数据挖掘
·
spark
·
毕业设计
·
课程设计
【大数据项目实战】基于Python数据挖掘的新能源车充电行为关联风险分析研究-基于Hadoop+Spark的电动汽车故障多维数据可视化
💕💕作者:计算机源码社 💕💕个人简介:本人八年开发经验,擅长Java、Python、PHP、.NET、Node.js、Spark、hadoop、Android、微信小程序、爬虫、大数据、机器学习等,大家有这一块的问题可以一起交流! 💕💕学习资料、程序开发、技术解答、文档报告 💕💕如需要源码,可以扫取文章下方二维码联系咨询
磁场转动100万匹
2 天前
大数据
·
hadoop
·
mapreduce
大数据入门:Hadoop 与 MapReduce 学习路线
大数据是指无法用传统工具处理的海量数据集合,其核心特征通常概括为 4V:Volume(数据量大)、Velocity(处理速度快)、Variety(数据类型多样)、Value(价值密度低)。学习大数据技术,首先需要理解分布式存储和分布式计算的基本思想。
崖边看雾
2 天前
大数据
·
hadoop
·
hdfs
Hadoop —— HDFS 写数据流程
HDFS ClientHDFS 客户端,属于一套代码库,不是独立进程。命令行、Java 代码上传文件本质就是加载这套客户端库。
陈年老古董
2 天前
开发语言
·
hadoop
·
笔记
·
python
·
学习
Python模拟MapReduce分治思想 | 从单文件统计到大文件拆分聚合 学习笔记
最近啃大数据的 MapReduce,光看概念总觉得虚,索性用 Python 纯手写了一遍完整流程。从最基础的单文件统计,到大文件拆分、Map 局部计算、Reduce 汇总,不用搭任何大数据框架,就能把分治的核心逻辑摸得明明白白。
崖边看雾
2 天前
大数据
·
hadoop
·
hdfs
Hadoop —— HDFS 读流程
先记住最核心的一句话:NameNode 只管「目录、文件信息、数据块在哪」;真正的文件内容,全部存在 DataNode 上。读文件时 NameNode 不给你传文件内容,只告诉你去哪找,客户端直接去找 DataNode 拿数据。
磁场转动100万匹
2 天前
hadoop
·
hdfs
·
mapreduce
HDFS 与 MapReduce 核心原理详解
HDFS Shell 命令是操作 Hadoop 分布式文件系统最基础、最常用的方式。它通过 hdfs dfs 或 hadoop fs 前缀调用,两者在大多数场景下等价。下面按功能分类介绍常用命令。
BYSJMG
2 天前
大数据
·
hadoop
·
信息可视化
·
数据分析
·
spark
·
kmeans
·
课程设计
计算机毕设选题推荐:基于大数据的公共交通运营数据分析与可视化,Spark+K-Means聚类城市运营模式
精彩专栏推荐订阅:在下方主页👇🏻👇🏻👇🏻👇🏻💖🔥作者主页:计算机毕设木哥🔥 💖
Gl�ria
3 天前
hive
·
hadoop
·
mapreduce
Hadoop MapReduce/Hive 数据倾斜完整排查
数据倾斜本质:Shuffle 阶段,某一个 / 某几个 Reduce 接收的数据量远大于其他 Reduce,任务长时间卡在这几个 Reduce,出现长尾任务,严重时 OOM。
Gl�ria
3 天前
数据仓库
·
hive
·
hadoop
Hadoop Hive 和 YARN 的关系
一句话总结:Hive 是数仓 SQL 工具,本身不做计算;YARN 是 Hadoop 的资源调度管理器,给 Hive 的计算任务分配服务器资源,运行 MapReduce/Tez/Spark 计算程序;
pjj19854
4 天前
大数据
·
hadoop
·
python
Hadoop-python中使用大数据
一、写在前面:为什么先从 Python 学 Hadoop最近开始系统学习大数据,第一站就是 Hadoop。很多教程一上来就抛出一堆概念:HDFS、NameNode、DataNode、YARN……听得云里雾里,很容易劝退。其实 Hadoop 的核心计算思想 MapReduce 并不神秘,它的精髓用一段 Python 代码就能模拟出来。这篇学习笔记记录了我是如何用 Python 从“单机统计”一路走到“分而治之”,逐步理解 MapReduce 思想的完整过程。
计算机源码社
5 天前
大数据
·
hadoop
·
python
·
机器学习
·
数据挖掘
·
spark
·
毕业设计
分享一个基于大数据的跨平台内容生态画像与互动等级分析系统,基于Hadoop+Spark的社交媒体互动数据可视化大屏分析
💕💕作者:计算机源码社 💕💕个人简介:本人八年开发经验,擅长Java、Python、PHP、.NET、Node.js、Spark、hadoop、Android、微信小程序、爬虫、大数据、机器学习等,大家有这一块的问题可以一起交流! 💕💕学习资料、程序开发、技术解答、文档报告 💕💕如需要源码,可以扫取文章下方二维码联系咨询
BYSJMG
5 天前
大数据
·
人工智能
·
hadoop
·
数据分析
·
spark
·
课程设计
计算机毕设选题做什么好?基于大数据的用户健身行为数据分析与可视化系统,Hadoop+Spark处理
精彩专栏推荐订阅:在下方主页👇🏻👇🏻👇🏻👇🏻💖🔥作者主页:计算机毕设木哥🔥 💖
ha_lydms
5 天前
大数据
·
hadoop
·
hdfs
·
yarn
·
调度
·
aliyun
·
计算
HDFS 简介
随着数据量越来越大,一个操作系统已经存不下所有的数据,那么就分配到更多的操作系统管理的磁盘中,但是不方便管理和维护,这时候迫切需要一种系统来管理多台机器上的文件,这就是分布式文件管理系统。HDFS只是分布式文件管理系统中的一种。
2601_96229809
5 天前
hadoop
·
python
·
spark
·
实战
·
大数据分析
零基础学大数据分析全栈
没有基础, 要是想要去学习“大数据分析全栈”, 首先得明确一个概念, 在大数据所涉及的范围里, 所谓的那种“全栈”, 通常说的是“技术小全栈”。也就是说, 要能够理解数据从产生开始, 一直到产生价值的整个的生命周期, 并且还要能够动手去操作, 这个生命周期包括从数据采集开始, 接着是存储, 然后是计算, 最后到应用。
ha_lydms
6 天前
大数据
·
hadoop
·
hdfs
·
mapreduce
·
yarn
·
maxcompute
·
odps
HDFS的读写流程
在HDFS写数据的过程中,NameNode会选择距离待上传数据最近距离的DataNode接收数据。那么这个最近距离怎么计算呢? 节点距离:两个节点到达最近的共同祖先的距离总和。
BYSJMG
7 天前
大数据
·
hadoop
·
分布式
·
信息可视化
·
spark
·
kmeans
·
课程设计
大数据毕业设计选题推荐:基于大数据的全球气温历史演变分析与可视化,用Hadoop+Spark处理
精彩专栏推荐订阅:在下方主页👇🏻👇🏻👇🏻👇🏻💖🔥作者主页:计算机毕设木哥🔥 💖