hadoop

牛奶咖啡1318 小时前
大数据·hadoop·hadoop集群操作系统调优·hadoop集群运维问题汇总·hadoop集群硬件规划·大数据平台网络规划·大数据平台硬件存储选型
大数据Hadoop运维应用实践——Hadoop平台常见问题与故障汇总、系统调优、网络规划与硬件存储选型大数据Hadoop运维应用实践——Hadoop资源调度与权限管理文章浏览阅读10次。本文详细介绍了Hadoop YARN资源调度策略与HDFS权限管理两大核心功能。1、在YARN部分,重点对比了三种调度器(FIFO、Capacity、Fair)的特点、适用场景、与详细的配置与操作示例。2、HDFS权限管理部分阐述了POSIX权限模型和ACL扩展访问控制机制,介绍了如何通过setfacl/getfacl命令实现精细化权限控制。全文包含大量实战配置代码和参数说明,为Hadoop集群资源管理和权限控制提供了全面
雨晨源码(同名B站)18 小时前
开发语言·hadoop·爬虫·python·信息可视化·毕业设计
基于Python的网易云音乐评论数据情感化分析系统 音乐爬虫信息可视化 |SnowNLP评论情感分析🔥作者:雨晨源码🔥 💖简介:java、微信小程序、安卓;定制开发,远程调试 代码讲解,文档指导,ppt制作💖 精彩专栏推荐订阅:在下方专栏👇🏻👇🏻👇🏻👇🏻 Java精彩实战毕设项目案例 小程序精彩项目案例 Python大数据项目案例
赤土 炙焱1 天前
hive·hadoop
hiveserver2启动失败,磁盘满了hiveserver2 连接失败,查看日志,磁盘满了查看磁盘情况查看内存占用大小du -sh /var/* | sort -h
Waay5 天前
大数据·数据库·hive·hadoop·hdfs·hbase
什么是HBase?它和Hive有什么区别?Hive:离线大数据仓库,存日志、订单批量数据,只能做批量统计查询,不能实时根据某一条 ID 快速查数据;
Francek Chen2 天前
大数据·数据仓库·hive·hadoop·分布式·数据分析
【大数据处理与分析】数据仓库Hive:02 数据湖【作者主页】Francek Chen 【专栏介绍】 ⌈ ⌈ ⌈大数据技术原理与应用 ⌋ ⌋ ⌋专栏系统介绍大数据的相关知识,分为大数据基础篇、大数据存储与管理篇、大数据处理与分析篇、大数据应用篇。内容包含大数据概述、大数据处理架构Hadoop、分布式文件系统HDFS、分布式数据库HBase、NoSQL数据库、云数据库、MapReduce、Hadoop再探讨、数据仓库Hive、Spark、流计算、Flink、图计算、数据可视化,以及大数据在互联网领域、生物医学领域的应用和大数据的其他应用。 【GitCode
Blossom i4 天前
大数据·hadoop·spark
Python+spark2.0+Hadoop机器学习与大数据实战第十一章:Python Spark的集成开发环境虚拟机安装JDK1.8 JDK的下载,可以官网下载(可以选着版本),也可以从下面百度网盘链接下载(版本固定)
我要用代码向我喜欢的女孩表白5 天前
大数据·hadoop·hdfs
hdfs获取所有路径大小的脚本AI提示词 帮我写个shell脚本,我会给你一个hdfs路径的txt, 你帮我拼接一下 txt路径如下: /user/hive/warehouse/ods_s.db/rt_ppdai_pfl_transfour_tb_order /user/hive/warehouse/ods_s.db/rt_ppdai_pfl_transfour_tb_orde1 /user/hive/warehouse/ods_s.db/rt_ppdai_pfl_transfour_tb_orde2 读取txt, hdfs dfs
fastjson_6 天前
大数据·hadoop·npm
Hadoop之YarnHadoop三大件:HDFS、MapReduce、Yarn1、底层:HDFS 分布式文件系统 大数据存储底座,所有框架(MR/Spark/Flink/Hive/HBase)的数据最终都存在 HDFS 上,是整个集群的存储基石。
fastjson_6 天前
数据仓库·hive·hadoop
Hive的介绍和使用Hive 是一个框架,可以通过编写sql的方式,自动的编译为MR任务的一个工具。 在这个世界上,会写SQL的人远远大于会写java代码的人,所以假如可以将MR通过sql实现,这个将是一个巨大的市场,FaceBook就这么干。(脸书)
光电的一只菜鸡7 天前
hadoop·microsoft·prompt
小白从零开始学agent(二)——如何高效编写 Prompt 与 Skill提示词 工程( Prompt Engineering ) 是指通过精心设计和优化输入给大语言模型(LLM)的指令文本,使模型输出更准确、更符合预期的系统方法论。简单来说,你给模型的每一段文字——无论是一句提问、一段上下文、还是一整套结构化指令——都是"提示词"(Prompt)。提示词工程则是让这些文字更高效地"驱动"模型完成任务的技术与实践。 大语言模型的输出具有非确定性,同一个问题在不同措辞下可能得到截然不同的结果。提示词工程的核心价值就在于:将这种不确定性降到最低,让模型的行为可控、可预测、可复现。
ha_lydms11 天前
大数据·hadoop·阿里云·mapreduce·yarn·dataworks·hologres
Hologres 简介Hologres是阿里巴巴自主研发的一站式实时数仓引擎(Real-Time Data Warehouse),支持海量数据实时写入、实时更新、实时加工、实时分析,支持标准SQL(兼容PostgreSQL协议和语法,支持大部分PostgreSQL函数),支持PB级数据多维分析(OLAP)与即席分析(Ad Hoc),支持高并发低延迟的在线数据服务(Serving),支持多种负载的细粒度隔离与企业级安全能力,与MaxCompute、Flink、DataWorks深度融合,提供企业级离在线一体化全栈数仓解决方案。
Francek Chen14 天前
大数据·hadoop·分布式·mapreduce
【大数据处理与分析】实验5:MapReduce初级编程实践【作者主页】Francek Chen 【专栏介绍】 ⌈ ⌈ ⌈大数据技术原理与应用 ⌋ ⌋ ⌋专栏系统介绍大数据的相关知识,分为大数据基础篇、大数据存储与管理篇、大数据处理与分析篇、大数据应用篇。内容包含大数据概述、大数据处理架构Hadoop、分布式文件系统HDFS、分布式数据库HBase、NoSQL数据库、云数据库、MapReduce、Hadoop再探讨、数据仓库Hive、Spark、流计算、Flink、图计算、数据可视化,以及大数据在互联网领域、生物医学领域的应用和大数据的其他应用。 【GitCode
还有你Y20 天前
hadoop·架构·软件工程
软件工程架构【后端架构基础:如何设计可扩展的软件系统 | 负载均衡 / 微服务 / 缓存策略 / 系统扩展】软件工程这两年变化真的太快了,尤其是最近这几个月。我觉得现在是时候停下来,好好想想到底发生了什么。
Zhu75819 天前
hadoop·kubernetes
在k8s集群环境部署高可用的Apache Hadoop3.1.1定制版集群版本:v4(NameNode HA + YARN HA + 全栈生产验证) 日期:2026-07-24 开发者:腾讯workbuddy+腾讯hy3大模型 实际部署命名空间:hadoop(本文命令统一用 -n hadoop;要部署到其他命名空间,必须改 configmap 里的 FQDN + web-ui-access 的 namespace 字段,详见 §16,不能只改 -n) 架构:NN HA(Active/Standby + JournalNode + ZooKeeper + ZKFC) + YARN
曾阿伦24 天前
hadoop·windows·aws
Windows 下运行 Hadoop 并部署到 AWS EMR 指南本文详细介绍如何在 Windows 10 环境下开发和运行 Hadoop MapReduce 程序,并将其部署到 AWS EMR 集群进行分布式计算。包含完整的实操步骤、代码示例和故障排除指南。
极光代码工作室25 天前
大数据·hadoop·python·spark·数据可视化
基于Spark的日志监控与分析平台随着企业IT基础设施规模持续扩大,分布式系统产生的日志数据呈爆炸式增长。传统基于单机ELK(Elasticsearch+Logstash+Kibana)栈的日志处理方案在高吞吐、低延迟、复杂关联分析等场景下逐渐暴露出扩展性差、实时性弱、计算能力受限等问题。本文设计并实现了一个基于Apache Spark的分布式日志监控与分析平台,融合批流一体处理能力,支持TB级日志的秒级接入、毫秒级异常检测、多维关联分析及可视化告警。平台采用Lambda架构演进形态,以Spark Structured Streaming
liuxiaowei31 个月前
大数据·hadoop·wpf
Winform+WPF双框架实战:喷涂工艺SCADA上位机从0到1搭建(附采集监控源码+车间踩坑实录)高效知识吸收方法论:快速消化Winform/WPF工业SCADA海量实操内容 工业SCADA(监控与数据采集)系统的开发是工业自动化的核心领域,而Winform和WPF作为桌面端开发的主流框架,承载着大量SCADA人机交互界面的实现任务。这一领域的学习内容极其庞大,涵盖界面设计、通信协议、数据采集、实时监控、报警管理、历史趋势、报表生成等数十个功能模块,每项功能背后都有大量的实操细节。与此同时,不同工业场景下的需求差异又让知识体系进一步膨胀。面对如此海量的实操内容,传统“逐章跟练”的学习方式必然导致战线过
hkNaruto1 个月前
大数据·hadoop·分布式
【大数据】《传统Hadoop大数据技术入门:补充与进阶——从数据格式到智能决策的问答实录》——写给已读《传统Hadoop大数据技术入门:从数据源到用户界面的全链路实践指南》的读者第一本书带你走完了“从数据源到用户界面”的全链路。但真正的生产环境,远不止一条笔直的管道。
牛奶咖啡131 个月前
大数据·hadoop·hadoop集群配置文件解析·hadoop高可用集群安装部署·配置指定多台服务器相互免密·配置hadoop服务开机自启·ansible部署hadoop
大数据Hadoop运维应用实践——双NameNode高可用Hadoop集群架构(下)大数据Hadoop运维应用实践——双NameNode高可用Hadoop集群架构(上) https://blog.csdn.net/xiaochenXIHUA/article/details/162849636
李昊哲小课1 个月前
大数据·hadoop·zookeeper·spark
spark4 集群安装Spark 4.1.2 要求 JDK 17 或 21,不支持 JDK 25。解压后目录名通常为 jdk-21.0.x,重命名为统一名称: