spark

BD_Marathon1 天前
大数据·ajax·spark
Spark数据源可以在Spark中使用的各种其他数据源以及来自社区构建的各种其他数据源Spark包含六大核心数据源以及由社区生成的许多外部数据源,提供对各种数据源的读写能力支持,以下是Spark的核心数据源:
BD_Marathon1 天前
spark
DatasetDataset是结构化API的基本类型,我们已经使用了DataFrame,它是Row类型的Dataset,在Spark各种语言中都得到了支持。Dataset具有严格的Java虚拟机(JVM)语言特性,仅与Scala和Java一起使用。你可以定义Dataset中每一行所包含的对象。在Scala中就是一个case类对象,它实质上定义了一种模式schema,而在Java中就是Java Bean。经验丰富的用户经常将Dataset称为Spark中的“类型化的API”(Dataset在编译时检查类型,DataFra
java1234_小锋3 天前
java·spark·kafka·实时电商用户行为分析与预测系统
【免费】基于Spark实时电商用户行为分析与预测(Java版本+可视化大屏+Kafka+SpringBoot+Vue3) 锋哥原创出品,必属精品大家好,我是Java1234_小锋老师,分享一套锋哥原创的基于Spark实时电商用户行为分析与预测(Java版本+可视化大屏+Kafka+SpringBoot+Vue3)
abcy0712135 天前
flink·spark
spark核心组件负责运行用户的 main 方法,创建 SparkContext,协调整个应用的执行,负责任务划分和调度。
极光代码工作室7 天前
大数据·hadoop·python·spark·数据可视化
基于Spark的日志监控与分析平台随着企业IT基础设施规模持续扩大,分布式系统产生的日志数据呈爆炸式增长。传统基于单机ELK(Elasticsearch+Logstash+Kibana)栈的日志处理方案在高吞吐、低延迟、复杂关联分析等场景下逐渐暴露出扩展性差、实时性弱、计算能力受限等问题。本文设计并实现了一个基于Apache Spark的分布式日志监控与分析平台,融合批流一体处理能力,支持TB级日志的秒级接入、毫秒级异常检测、多维关联分析及可视化告警。平台采用Lambda架构演进形态,以Spark Structured Streaming
Leo.yuan8 天前
大数据·分布式·spark
数据仓库建设怎么做?从源数据到分析报表全流程讲清很多企业做数据仓库,第一步就想错了。以为把数据从业务系统抽出来,建几张表,再接一个 BI 报表,就算完成了。
OneNobody9 天前
大数据·sql·spark
Spark SQL AQE工作原理源码剖析在把SparkPlan提交执行前,还需要完成若干的准备工作,对树形结构的物理计划进行全局的整合处理或者优化,通过一系列的规则序列,如AQE、EnsureRequirements等,保证SparkPlan的正确性和高效性。
humbinal9 天前
hive·python·rust·spark·开源·github·parquet
同时支持 gui & cli 的 parquet 文件查看工具,高性能小清新!手里拿到一个 .parquet 文件,想快速确认里面有什么:字段是什么、多少行、压缩方式、前几条数据长什么样……却不得不打开 Notebook,临时写一段 pandas / pyarrow 代码?
阿里云大数据AI技术9 天前
人工智能·spark
阿里云 EMR Serverless Spark 全托管 Ray 再进化:加速构建全模态数据处理新基建阿里云 EMR Serverless Spark 自今年4月推出全托管 Ray 以来,能力持续升级:在同一工作空间内深度集成 Spark 与 Ray,以统一湖仓存储、统一 CPU & GPU 资源池、统一安全和运维体系,承载从结构化数据处理到 AI 训练数据预处理、后训练、推理与服务的完整链路。目前,该能力已在具身智能、智能制造、自动驾驶等行业实现生产级落地,支撑企业在一套云原生平台上高效完成数据治理、样本加工、模型开发和规模化生产。
LitchiCheng9 天前
大数据·人工智能·spark
轻量化微调 Qwen2.5 LoRA 训练全流程详解视频链接:https://www.bilibili.com/video/BV1FGKz6FEqk/?vd_source=5ba34935b7845cd15c65ef62c64ba82f
董可伦10 天前
大数据·spark
Spark 源码 | Yarn Client 模式提交流程(五)前些天发现了一个巨牛的人工智能学习网站,通俗易懂,风趣幽默,忍不住分享一下给大家。点击跳转到网站:https://www.captainai.net/dongkelun
Gent_倪11 天前
数据库·数据仓库·spark
万字详解:数据库、数据仓库、数据湖、湖仓一体核心定位:面向事务处理(OLTP)。它是业务系统的“地基”,负责高效、可靠地记录每一次业务操作,如用户下单、账户更新等。
2501_9481069111 天前
java·开发语言·spark·汽车·课程设计·旅游
计算机毕业设计之jsp-智慧旅游分享平台随着当今社会的发展,时代的进步,各行各业也在发生着变化,本系统旅游分享这一方面,利用网站旅游分享已经逐步进入人们的生活。传统的旅游攻略管理,网络以及计算机为解决当前的问题提供了新的方向新的可能。利用网络技术进行旅游推荐的实现,首先旅客可以根据智慧旅游分享平台查看旅游攻略,并根据自己的喜好,将喜欢的旅游攻略进行收藏,还能查看留言反馈,非常方便。这款智慧旅游分享平台的设计与实现将会使旅游推荐的操作更加自如。本文通过对研发背景和意义的分析,对系统的功能需求作出分析,根据需求对系统进行设计,明确各个部分的规范,来
ClickHouseDB12 天前
大数据·分布式·spark
推出 CostBench:一个用于数据仓库成本性能的开放基准本文字数:2310;估计阅读时间:6分钟作者:Tom Schreiber and Lionel Palacin
李昊哲小课13 天前
大数据·hadoop·zookeeper·spark
spark4 集群安装Spark 4.1.2 要求 JDK 17 或 21,不支持 JDK 25。解压后目录名通常为 jdk-21.0.x,重命名为统一名称:
阿里云大数据AI技术14 天前
人工智能·spark
EMR Serverless Daft 如何简化多模态数据处理:视频抽帧、清洗、标注全流程与具身智能实践引言:具身智能时代的数据工程挑战在大模型跨界多模态的浪潮下,具身智能(Embodied AI)正成为人工智能的下一个前沿高地。与传统 AI 依赖互联网静态图文不同,具身智能的训练高度依赖来自真实物理世界的多模态感知数据——包括第一人称视角(Egocentric)视频、深度传感器数据、力反馈信号等。
董可伦15 天前
大数据·分布式·spark
Spark 源码 | SparkSubmitArguments 参数解析(三)前些天发现了一个巨牛的人工智能学习网站,通俗易懂,风趣幽默,忍不住分享一下给大家。点击跳转到网站:https://www.captainai.net/dongkelun
BD_Marathon16 天前
大数据·分布式·spark
spark.sql报错报错如下:核心报错:Another instance of Derby may have already booted the database /root/metastore_db Spark 默认内置 Derby 数据库来存放 Hive 元数据(metastore_db);Derby 是单进程数据库,只允许一个进程持有数据库锁。 上一次的 spark‑shell 没有正常关闭,后台残留 Java 进程持有了metastore_db目录下的db.lck锁文件;再次启动 Spark 尝试连接同一个 Der