Spark—shell,Hbase—shell

Spark:

SPARK SQL

results = spark.sql( "SELECT * FROM people")

//读取JSON文件

val userScoreDF = spark.read.json("hdfs://master:9000/people.json")

Spark内置函数的使用

除select()外,还可以使用filter()、groupBy()等方法对DataFrame数据进行过滤和分组,比如:

df.select("name").show()

df.select("name","age"+1).show() //age列值增1

df.filter($"age">20).show()

df.groupBy("age").count().show()

使用spark处理数据之后写入hive表:

使用saveAsTable()方法可以将一个DataFrame写入到指定的Hive表中。例如,加载students表的数据并转为DataFrame,然后将DataFrame写入Hive表hive_records中,代码:

//加载students表的数据为

DataFrame val studentsDF = spark.table("students")

//将DataFrame写入表hive_records中 studentsDF.write.mode(SaveMode.Overwrite).saveAsTable("hive_records")

//查询hive_records表数据并显示到控制

spark.sql("SELECT * FROM hive_records").show()

Hbase:

新建:

#新建表table_name,并且设置三个列组

create 'table_name','f1','f2','f3'

增 :

#在表table_name的r1行f1:c1列中添加数据

put 'table_name' ,'f1:c1', 'hello world'

删:

先使表无效,然后删除表

endable/disenable #使表有效或无效

#删除表

drop 'table_name'

改:

#将第一行cf列组中的score数值改为99

put 'course','001','cf:score','99'

查:

#查看表结构

describe 'table_name'

列出所有建立的表的名字

list

#列出表所有相关内容

scan 'table_name'

#查看第r1行,f1列组,c1的值

get 'table_name' ,'r1','f1:c1'

#查看第r1行,f1列组,c1的值

get 'table_name','r1','f1:c3'

相关推荐
D202020201 小时前
TikTok达人履约乱象?达秘带你拆解供需权力关系错位的本质
大数据·人工智能
wuhanzhanhui1 小时前
从精密齿轮到智慧流体:2026武汉动力传动展览会,重构未来工业动力
大数据·人工智能
普马萨特2 小时前
代际更替与结构优化:中国2G/3G/4G/5G基站总量趋势深度研究
大数据
八月瓜科技3 小时前
八月瓜科技案例入选“教育部2025年教育信息技术应用创新优秀案例集”
大数据·人工智能·科技
网络工程小王3 小时前
【HCIE-AI】12.deepspeed分布式并行训练进阶版
人工智能·pytorch·分布式·学习·昇腾·deepspeed
微石科技4 小时前
慢病居家长期服务方案怎么选?宁波微石科技星梦云康打通居家慢病服务闭环
大数据·人工智能
无忧智库4 小时前
产业数字化平台建设方案:从单点工厂改造到城市产业生态的全景落地指南(PPT)
大数据·人工智能
wuhanzhanhui4 小时前
轻盈的力量:2026 武汉国际发泡材料技术工业展览会,重构未来工业的“呼吸感”
大数据·人工智能
冻感糕人~4 小时前
大模型学习指南:收藏这份AI Agent四层工程地图(小白程序员必备)
java·大数据·人工智能·学习·大模型·agent·大模型学习
问商十三载4 小时前
2026工业制造AI引擎生成式优化怎么做?3层适配法避通用坑,零成本提31%抓取权重附校验清单
大数据·人工智能·制造