hadoop

赤土 炙焱11 小时前
hive·hadoop
hiveserver2启动失败,磁盘满了hiveserver2 连接失败,查看日志,磁盘满了查看磁盘情况查看内存占用大小du -sh /var/* | sort -h
Waay4 天前
大数据·数据库·hive·hadoop·hdfs·hbase
什么是HBase?它和Hive有什么区别?Hive:离线大数据仓库,存日志、订单批量数据,只能做批量统计查询,不能实时根据某一条 ID 快速查数据;
Francek Chen1 天前
大数据·数据仓库·hive·hadoop·分布式·数据分析
【大数据处理与分析】数据仓库Hive:02 数据湖【作者主页】Francek Chen 【专栏介绍】 ⌈ ⌈ ⌈大数据技术原理与应用 ⌋ ⌋ ⌋专栏系统介绍大数据的相关知识,分为大数据基础篇、大数据存储与管理篇、大数据处理与分析篇、大数据应用篇。内容包含大数据概述、大数据处理架构Hadoop、分布式文件系统HDFS、分布式数据库HBase、NoSQL数据库、云数据库、MapReduce、Hadoop再探讨、数据仓库Hive、Spark、流计算、Flink、图计算、数据可视化,以及大数据在互联网领域、生物医学领域的应用和大数据的其他应用。 【GitCode
Blossom i3 天前
大数据·hadoop·spark
Python+spark2.0+Hadoop机器学习与大数据实战第十一章:Python Spark的集成开发环境虚拟机安装JDK1.8 JDK的下载,可以官网下载(可以选着版本),也可以从下面百度网盘链接下载(版本固定)
我要用代码向我喜欢的女孩表白4 天前
大数据·hadoop·hdfs
hdfs获取所有路径大小的脚本AI提示词 帮我写个shell脚本,我会给你一个hdfs路径的txt, 你帮我拼接一下 txt路径如下: /user/hive/warehouse/ods_s.db/rt_ppdai_pfl_transfour_tb_order /user/hive/warehouse/ods_s.db/rt_ppdai_pfl_transfour_tb_orde1 /user/hive/warehouse/ods_s.db/rt_ppdai_pfl_transfour_tb_orde2 读取txt, hdfs dfs
fastjson_5 天前
大数据·hadoop·npm
Hadoop之YarnHadoop三大件:HDFS、MapReduce、Yarn1、底层:HDFS 分布式文件系统 大数据存储底座,所有框架(MR/Spark/Flink/Hive/HBase)的数据最终都存在 HDFS 上,是整个集群的存储基石。
fastjson_5 天前
数据仓库·hive·hadoop
Hive的介绍和使用Hive 是一个框架,可以通过编写sql的方式,自动的编译为MR任务的一个工具。 在这个世界上,会写SQL的人远远大于会写java代码的人,所以假如可以将MR通过sql实现,这个将是一个巨大的市场,FaceBook就这么干。(脸书)
光电的一只菜鸡6 天前
hadoop·microsoft·prompt
小白从零开始学agent(二)——如何高效编写 Prompt 与 Skill提示词 工程( Prompt Engineering ) 是指通过精心设计和优化输入给大语言模型(LLM)的指令文本,使模型输出更准确、更符合预期的系统方法论。简单来说,你给模型的每一段文字——无论是一句提问、一段上下文、还是一整套结构化指令——都是"提示词"(Prompt)。提示词工程则是让这些文字更高效地"驱动"模型完成任务的技术与实践。 大语言模型的输出具有非确定性,同一个问题在不同措辞下可能得到截然不同的结果。提示词工程的核心价值就在于:将这种不确定性降到最低,让模型的行为可控、可预测、可复现。
ha_lydms10 天前
大数据·hadoop·阿里云·mapreduce·yarn·dataworks·hologres
Hologres 简介Hologres是阿里巴巴自主研发的一站式实时数仓引擎(Real-Time Data Warehouse),支持海量数据实时写入、实时更新、实时加工、实时分析,支持标准SQL(兼容PostgreSQL协议和语法,支持大部分PostgreSQL函数),支持PB级数据多维分析(OLAP)与即席分析(Ad Hoc),支持高并发低延迟的在线数据服务(Serving),支持多种负载的细粒度隔离与企业级安全能力,与MaxCompute、Flink、DataWorks深度融合,提供企业级离在线一体化全栈数仓解决方案。
Francek Chen13 天前
大数据·hadoop·分布式·mapreduce
【大数据处理与分析】实验5:MapReduce初级编程实践【作者主页】Francek Chen 【专栏介绍】 ⌈ ⌈ ⌈大数据技术原理与应用 ⌋ ⌋ ⌋专栏系统介绍大数据的相关知识,分为大数据基础篇、大数据存储与管理篇、大数据处理与分析篇、大数据应用篇。内容包含大数据概述、大数据处理架构Hadoop、分布式文件系统HDFS、分布式数据库HBase、NoSQL数据库、云数据库、MapReduce、Hadoop再探讨、数据仓库Hive、Spark、流计算、Flink、图计算、数据可视化,以及大数据在互联网领域、生物医学领域的应用和大数据的其他应用。 【GitCode
还有你Y19 天前
hadoop·架构·软件工程
软件工程架构【后端架构基础:如何设计可扩展的软件系统 | 负载均衡 / 微服务 / 缓存策略 / 系统扩展】软件工程这两年变化真的太快了,尤其是最近这几个月。我觉得现在是时候停下来,好好想想到底发生了什么。
Zhu75818 天前
hadoop·kubernetes
在k8s集群环境部署高可用的Apache Hadoop3.1.1定制版集群版本:v4(NameNode HA + YARN HA + 全栈生产验证) 日期:2026-07-24 开发者:腾讯workbuddy+腾讯hy3大模型 实际部署命名空间:hadoop(本文命令统一用 -n hadoop;要部署到其他命名空间,必须改 configmap 里的 FQDN + web-ui-access 的 namespace 字段,详见 §16,不能只改 -n) 架构:NN HA(Active/Standby + JournalNode + ZooKeeper + ZKFC) + YARN
曾阿伦23 天前
hadoop·windows·aws
Windows 下运行 Hadoop 并部署到 AWS EMR 指南本文详细介绍如何在 Windows 10 环境下开发和运行 Hadoop MapReduce 程序,并将其部署到 AWS EMR 集群进行分布式计算。包含完整的实操步骤、代码示例和故障排除指南。
极光代码工作室24 天前
大数据·hadoop·python·spark·数据可视化
基于Spark的日志监控与分析平台随着企业IT基础设施规模持续扩大,分布式系统产生的日志数据呈爆炸式增长。传统基于单机ELK(Elasticsearch+Logstash+Kibana)栈的日志处理方案在高吞吐、低延迟、复杂关联分析等场景下逐渐暴露出扩展性差、实时性弱、计算能力受限等问题。本文设计并实现了一个基于Apache Spark的分布式日志监控与分析平台,融合批流一体处理能力,支持TB级日志的秒级接入、毫秒级异常检测、多维关联分析及可视化告警。平台采用Lambda架构演进形态,以Spark Structured Streaming
liuxiaowei325 天前
大数据·hadoop·wpf
Winform+WPF双框架实战:喷涂工艺SCADA上位机从0到1搭建(附采集监控源码+车间踩坑实录)高效知识吸收方法论:快速消化Winform/WPF工业SCADA海量实操内容 工业SCADA(监控与数据采集)系统的开发是工业自动化的核心领域,而Winform和WPF作为桌面端开发的主流框架,承载着大量SCADA人机交互界面的实现任务。这一领域的学习内容极其庞大,涵盖界面设计、通信协议、数据采集、实时监控、报警管理、历史趋势、报表生成等数十个功能模块,每项功能背后都有大量的实操细节。与此同时,不同工业场景下的需求差异又让知识体系进一步膨胀。面对如此海量的实操内容,传统“逐章跟练”的学习方式必然导致战线过
hkNaruto1 个月前
大数据·hadoop·分布式
【大数据】《传统Hadoop大数据技术入门:补充与进阶——从数据格式到智能决策的问答实录》——写给已读《传统Hadoop大数据技术入门:从数据源到用户界面的全链路实践指南》的读者第一本书带你走完了“从数据源到用户界面”的全链路。但真正的生产环境,远不止一条笔直的管道。
牛奶咖啡131 个月前
大数据·hadoop·hadoop集群配置文件解析·hadoop高可用集群安装部署·配置指定多台服务器相互免密·配置hadoop服务开机自启·ansible部署hadoop
大数据Hadoop运维应用实践——双NameNode高可用Hadoop集群架构(下)大数据Hadoop运维应用实践——双NameNode高可用Hadoop集群架构(上) https://blog.csdn.net/xiaochenXIHUA/article/details/162849636
李昊哲小课1 个月前
大数据·hadoop·zookeeper·spark
spark4 集群安装Spark 4.1.2 要求 JDK 17 或 21,不支持 JDK 25。解压后目录名通常为 jdk-21.0.x,重命名为统一名称:
buligbulig1 个月前
大数据·hadoop·分布式
Hadoop环境安装和集群创建本文提供基于VMware安装CentOS 7及配置Hadoop伪分布式/集群的简要步骤。 一、环境准备 下载VMware并安装,CentOS 7标准版ISO可从官网获取。 主机网络配置:编辑Windows hosts文件,映射主机名与IP(如192.168.1.76 master)。 关闭防火墙:systemctl stop firewalld并禁用自启,使用Xshell连接主机(支持rz/sz传文件)。 二、JDK安装 解压JDK至指定目录,配置/etc/profile环境变量(JAVA_HOME、CL
香山上的麻雀10081 个月前
数据仓库·hive·hadoop
Hive内部表(MANAGED_TABLE)的“批量删除分区”特性详解在生产环境中,我们时常遇到这样一个令人困惑的场景:明明执行的是 DROP 操作,为什么数据文件没有被删除?这不是 Bug,而是 Hive 内部表(MANAGED_TABLE) 在特定场景下的设计特性。