技术栈
hadoop
磁场转动100万匹
14 小时前
大数据
·
hadoop
·
mapreduce
大数据入门:Hadoop 与 MapReduce 学习路线
大数据是指无法用传统工具处理的海量数据集合,其核心特征通常概括为 4V:Volume(数据量大)、Velocity(处理速度快)、Variety(数据类型多样)、Value(价值密度低)。学习大数据技术,首先需要理解分布式存储和分布式计算的基本思想。
崖边看雾
14 小时前
大数据
·
hadoop
·
hdfs
Hadoop —— HDFS 写数据流程
HDFS ClientHDFS 客户端,属于一套代码库,不是独立进程。命令行、Java 代码上传文件本质就是加载这套客户端库。
陈年老古董
14 小时前
开发语言
·
hadoop
·
笔记
·
python
·
学习
Python模拟MapReduce分治思想 | 从单文件统计到大文件拆分聚合 学习笔记
最近啃大数据的 MapReduce,光看概念总觉得虚,索性用 Python 纯手写了一遍完整流程。从最基础的单文件统计,到大文件拆分、Map 局部计算、Reduce 汇总,不用搭任何大数据框架,就能把分治的核心逻辑摸得明明白白。
崖边看雾
15 小时前
大数据
·
hadoop
·
hdfs
Hadoop —— HDFS 读流程
先记住最核心的一句话:NameNode 只管「目录、文件信息、数据块在哪」;真正的文件内容,全部存在 DataNode 上。读文件时 NameNode 不给你传文件内容,只告诉你去哪找,客户端直接去找 DataNode 拿数据。
磁场转动100万匹
15 小时前
hadoop
·
hdfs
·
mapreduce
HDFS 与 MapReduce 核心原理详解
HDFS Shell 命令是操作 Hadoop 分布式文件系统最基础、最常用的方式。它通过 hdfs dfs 或 hadoop fs 前缀调用,两者在大多数场景下等价。下面按功能分类介绍常用命令。
BYSJMG
1 天前
大数据
·
hadoop
·
信息可视化
·
数据分析
·
spark
·
kmeans
·
课程设计
计算机毕设选题推荐:基于大数据的公共交通运营数据分析与可视化,Spark+K-Means聚类城市运营模式
精彩专栏推荐订阅:在下方主页👇🏻👇🏻👇🏻👇🏻💖🔥作者主页:计算机毕设木哥🔥 💖
Gl�ria
2 天前
hive
·
hadoop
·
mapreduce
Hadoop MapReduce/Hive 数据倾斜完整排查
数据倾斜本质:Shuffle 阶段,某一个 / 某几个 Reduce 接收的数据量远大于其他 Reduce,任务长时间卡在这几个 Reduce,出现长尾任务,严重时 OOM。
Gl�ria
2 天前
数据仓库
·
hive
·
hadoop
Hadoop Hive 和 YARN 的关系
一句话总结:Hive 是数仓 SQL 工具,本身不做计算;YARN 是 Hadoop 的资源调度管理器,给 Hive 的计算任务分配服务器资源,运行 MapReduce/Tez/Spark 计算程序;
pjj19854
3 天前
大数据
·
hadoop
·
python
Hadoop-python中使用大数据
一、写在前面:为什么先从 Python 学 Hadoop最近开始系统学习大数据,第一站就是 Hadoop。很多教程一上来就抛出一堆概念:HDFS、NameNode、DataNode、YARN……听得云里雾里,很容易劝退。其实 Hadoop 的核心计算思想 MapReduce 并不神秘,它的精髓用一段 Python 代码就能模拟出来。这篇学习笔记记录了我是如何用 Python 从“单机统计”一路走到“分而治之”,逐步理解 MapReduce 思想的完整过程。
计算机源码社
4 天前
大数据
·
hadoop
·
python
·
机器学习
·
数据挖掘
·
spark
·
毕业设计
分享一个基于大数据的跨平台内容生态画像与互动等级分析系统,基于Hadoop+Spark的社交媒体互动数据可视化大屏分析
💕💕作者:计算机源码社 💕💕个人简介:本人八年开发经验,擅长Java、Python、PHP、.NET、Node.js、Spark、hadoop、Android、微信小程序、爬虫、大数据、机器学习等,大家有这一块的问题可以一起交流! 💕💕学习资料、程序开发、技术解答、文档报告 💕💕如需要源码,可以扫取文章下方二维码联系咨询
BYSJMG
4 天前
大数据
·
人工智能
·
hadoop
·
数据分析
·
spark
·
课程设计
计算机毕设选题做什么好?基于大数据的用户健身行为数据分析与可视化系统,Hadoop+Spark处理
精彩专栏推荐订阅:在下方主页👇🏻👇🏻👇🏻👇🏻💖🔥作者主页:计算机毕设木哥🔥 💖
ha_lydms
4 天前
大数据
·
hadoop
·
hdfs
·
yarn
·
调度
·
aliyun
·
计算
HDFS 简介
随着数据量越来越大,一个操作系统已经存不下所有的数据,那么就分配到更多的操作系统管理的磁盘中,但是不方便管理和维护,这时候迫切需要一种系统来管理多台机器上的文件,这就是分布式文件管理系统。HDFS只是分布式文件管理系统中的一种。
2601_96229809
4 天前
hadoop
·
python
·
spark
·
实战
·
大数据分析
零基础学大数据分析全栈
没有基础, 要是想要去学习“大数据分析全栈”, 首先得明确一个概念, 在大数据所涉及的范围里, 所谓的那种“全栈”, 通常说的是“技术小全栈”。也就是说, 要能够理解数据从产生开始, 一直到产生价值的整个的生命周期, 并且还要能够动手去操作, 这个生命周期包括从数据采集开始, 接着是存储, 然后是计算, 最后到应用。
ha_lydms
5 天前
大数据
·
hadoop
·
hdfs
·
mapreduce
·
yarn
·
maxcompute
·
odps
HDFS的读写流程
在HDFS写数据的过程中,NameNode会选择距离待上传数据最近距离的DataNode接收数据。那么这个最近距离怎么计算呢? 节点距离:两个节点到达最近的共同祖先的距离总和。
BYSJMG
6 天前
大数据
·
hadoop
·
分布式
·
信息可视化
·
spark
·
kmeans
·
课程设计
大数据毕业设计选题推荐:基于大数据的全球气温历史演变分析与可视化,用Hadoop+Spark处理
精彩专栏推荐订阅:在下方主页👇🏻👇🏻👇🏻👇🏻💖🔥作者主页:计算机毕设木哥🔥 💖
fastjson_
6 天前
数据仓库
·
hive
·
hadoop
Hive 自定义函数
hive的内置函数满足不了所有的业务需求。hive提供很多的模块可以自定义功能,比如:自定义函数、serde、输入输出格式等。而自定义函数可以分为以下三类: UDF: user defined function:用户自定义函数,一对一的输入输出 (最常用的)。比如abs() UDAF: user defined aggregation function:用户自定义聚合函数,多对一的输入输出,比如:count sum max。 UDTF: user defined table-generate functi
张工在路上
7 天前
大数据
·
hadoop
·
wpf
WPF 布局基础概述
深入了解 WPF 布局基础,并要求详细讲解、代码示例、测试代码、适用场景及使用方法。结合之前的上下文(MVVM 模式、Prism 框架、动态模块加载、模块热加载、模块卸载等),我将提供一个全面的指南,涵盖 WPF 所有主要布局控件的详细讲解,包含代码示例、测试代码、适用场景和使用方法,确保与 Prism 框架和实时消息查看器示例无缝衔接。以下内容将结构化、简洁且详尽,适用于从初学者到高级开发者的需求。
BYSJMG
8 天前
大数据
·
hadoop
·
信息可视化
·
django
·
自动驾驶
·
kmeans
·
课程设计
计算机毕设选题|基于大数据与文本挖掘的自动驾驶事故成因分析及可视化研究|Hadoop+PySpark+Django+Vue
精彩专栏推荐订阅:在下方主页👇🏻👇🏻👇🏻👇🏻💖🔥作者主页:计算机毕设木哥🔥 💖
BI专家之路
9 天前
linux
·
hive
·
hadoop
安装linux/hadoop/jdk/hive
如果内存只有 8G:只搭建伪分布式(单节点),不要做 3 台完全分布式集群,否则电脑巨卡CentOS7 ISO 镜像,选择 Minimal 最小化安装(节省资源) 备选:Ubuntu 20.04(文档多,新版推荐)
2601_96207397
10 天前
大数据
·
hadoop
·
架构
大数据-258 离线数仓 - Griffin架构 配置安装 Livy 架构设计 解压配置 Hadoop Hive
点一下关注吧!!!非常感谢!!持续更新!!!----------------------Java篇开始了!---------目前开始更新 MyBatis,一起深入浅出!目前已经更新到了:---------* Hadoop(已更完)* HDFS(已更完)* MapReduce(已更完)* Hive(已更完)* Flume(已更完)* Sqoop(已更完)* Zookeeper(已更完)* HBase(已更完)* Redis (已更完)* Kafka(已更完)* Spark(已更完)* Flink(已更完)*