大数据

Waay3 天前
大数据·数据库·hive·hadoop·hdfs·hbase
什么是HBase?它和Hive有什么区别?Hive:离线大数据仓库,存日志、订单批量数据,只能做批量统计查询,不能实时根据某一条 ID 快速查数据;
m0_5270343317 分钟前
java·大数据·开发语言
异步任务审核系统设计:消息队列、超时重试与失败补偿数据说明 本文以果冻试玩移动任务平台的研发场景为背景。字段、数量、延迟和成功率均为脱敏演示或本地实验数据,用于说明设计方法,不代表线上实时指标;本文不构成收益承诺、投资建议或软件下载推广。
只说证事1 小时前
大数据·考研
大数据专业考研还是考证比较好考研还是考证,是大数据专业同学绕不开的话题。考研能加深理论功底,为进入顶尖研发团队或继续深造铺路;考证则更侧重实用技能,帮你快速对接企业用人需求。两者并非对立,但如果你还在纠结,不妨先了解在就业市场认可度较高的证书,按入门基础、职称体系、厂商技术认证、高阶能力四个梯队梳理,或许能帮你找到更清晰的路径。
用户3610588626121 小时前
大数据·spark
Spark 核心之 Spark-SortShufflebypass 原理深度剖析摘要:BypassMergeSortShuffle 是 SortShuffleManager 提供的最轻量 Shuffle Write 路径——它绕过排序、绕过聚合,直接为每个分区写独立文件最后合并,省去了 ExternalSorter 的全部开销。本文从触发条件、分区直写流程、Index File 生成、与 SortShuffleWriter/UnsafeShuffleWriter 的决策树对比四个维度,配合 2 张原创架构图 + 源码追踪,彻底拆解这一极速 Shuffle 路径的原理与适用边界。
Raas1002 小时前
大数据·人工智能·网关·网络安全·api网关·mai gateway·魔芋
MAIGateway,魔芋企业级AI网关的安全基建化设计8月12日,界面新闻发了一条消息:字节跳动成立"AI数据与安全"一级部门,与Seed、Flow、抖音平行。
Anita-lee2 小时前
大数据·产品运营·服务发现·娱乐
泛娱乐出海 APP 运营研究:用户量下滑成因与多语种客服数据化运营解决方案2026 年短剧、网络文学、互动娱乐类 APP 出海行业竞争趋于白热化,大量泛娱乐出海企业应用下载量持续上涨,依托自动化智能客服实现较高工单基础办结率。
笨鸟先飞,勤能补拙2 小时前
大数据·人工智能·python·物联网·安全·网络安全·github
AI Agent应用领域深度解析:从概念到落地的全维度审视摘要:2026年被业界广泛视为企业级AI Agent全面爆发的元年。全球AI Agent市场规模预计从2025年的76.3亿美元增长至2030年的503.1亿美元,年复合增长率(CAGR)高达45.8%。本文基于2026年最新行业报告、企业实践案例与产品评测数据,系统梳理AI Agent的核心应用领域、成熟产品竞争格局、技术架构差异及企业落地路径,力求为技术决策者提供一份逻辑严谨、数据驱动的参考指南。
Francek Chen2 小时前
大数据·数据仓库·hive·hadoop·分布式·数据分析
【大数据处理与分析】数据仓库Hive:02 数据湖【作者主页】Francek Chen 【专栏介绍】 ⌈ ⌈ ⌈大数据技术原理与应用 ⌋ ⌋ ⌋专栏系统介绍大数据的相关知识,分为大数据基础篇、大数据存储与管理篇、大数据处理与分析篇、大数据应用篇。内容包含大数据概述、大数据处理架构Hadoop、分布式文件系统HDFS、分布式数据库HBase、NoSQL数据库、云数据库、MapReduce、Hadoop再探讨、数据仓库Hive、Spark、流计算、Flink、图计算、数据可视化,以及大数据在互联网领域、生物医学领域的应用和大数据的其他应用。 【GitCode
IT小白杨2 小时前
大数据·经验分享·智能手机·重构·安全架构·指纹浏览器
从Chromium重构到真实ARM云手机:多账号隔离方案的技术演进很多做海外社媒运营、社区内容互动的朋友,一开始都会踩同一个坑:在一台电脑上开十几个浏览器窗口,或者用不同的浏览器分别登录不同账号。看起来分开了,其实从网站风控系统的视角看,这些账号可能都来自同一台设备、同一个网络出口、同一套硬件特征。
躺柒3 小时前
大数据·信息可视化·数据分析·数据可视化·视觉
读数据可视化01可视化简史1.1. 可视化发展史与测量、绘画、人类现代文明的启蒙和科技的发展一脉相承1.2. 可视化与山岳一样古老
Elastic 中国社区官方博客3 小时前
大数据·运维·elasticsearch·搜索引擎·架构·全文检索
用两行 JSON 替换你的 ILM 策略:数据流生命周期新增冻结层支持作者:来自 Elastic Jon Avezbaki在 Elasticsearch 9.5 中,数据流生命周期中的 frozen_after 会自动将索引迁移到对象存储上的可搜索快照中,同时保持索引可查询,并与降采样和保留策略协同工作。
头茬韭菜3 小时前
大数据·python·flink·fluss
第 4 篇:「Fluss + Flink 集成实战」—— Catalog、Source 与 Sink阅读本文你将了解: 如何使用 Fluss 作为 Flink 的原生 Catalog、如何读写 Fluss 表、DataStream API 集成、以及一个完整的实时订单宽表构建案例。
天天爱吃肉82183 小时前
大数据·笔记·python·嵌入式硬件·学习·汽车
【工程师硬件学习笔记:串口‑总线体系与三电试验室异构系统集成深度实战】核心定位:跳出名词科普,从硬件底层失效机理→总线选型权衡→网关硬件本质→试验室系统落地→安全约束形成完整技术链条,消除知识点堆砌,前后内容强关联;结论前置附带思维导图,全文沿着“调试工具→总线底层原理→硬件网关架构→试验室工程落地→风险与架构原则”一条主线递进。
starzy19903 小时前
大数据·分布式·spark
Spark 核心之二次排序、分组取 TopN 优化分析摘要:为什么你的分组 TopN 任务跑了 30 分钟还 OOM?答案通常是四个字——groupByKey。本文将二次排序和分组 TopN 作为两条优化主线,从反模式剖析、三种方案对比(groupByKey / reduceByKey+mapPartitions / SQL 窗口函数)、groupByKey vs reduceByKey 本质区别、完整代码实战、Spark SQL 窗口函数最佳实践五个维度,配合 1 张原创深色架构图,助你彻底攻克 TopN 优化的每一个细节。
a1122998214 小时前
大数据·人工智能·生活
GEO工具怎么选?电商、本地生活与B2B行业的选型差异很多市场团队在选购GEO(生成式引擎优化)工具时,容易陷入一个误区:只关注工具能监测多少个AI平台,或者界面报表是否精美。实际上,电商、本地生活与B2B服务这三类行业在AI搜索上的决策逻辑截然不同,如果工具的功能逻辑与业务需求错配,监测数据往往会变成“无用指标”。
2601_9648402713 小时前
大数据·人工智能·边缘计算
4G云门禁普惠化技术实践:基于边缘计算破解成本、隐私、部署三大行业瓶颈随着物联网技术在智慧出入口领域的深度渗透,智能门禁已从高端商写场景加速向老旧小区、产业园区、工地校园等下沉市场覆盖。但传统有线门禁架构存在的全周期成本高、数据隐私合规性弱、部署运维门槛高等技术痛点,始终制约着行业规模化下沉。
具身智能进化论13 小时前
大数据·人工智能·机器人·工厂方法模式
国产协作机器人品牌如何选择,企业长期使用更看重什么采购第一台协作机器人时,品牌之间的差别很容易被压缩成一张参数表。负载相近,臂展相近,重复定位精度也只差一点,报价便成了最显眼的数字。
IvorySQL14 小时前
大数据·数据库·人工智能·postgresql
PostgreSQL 日报|PG18.5 回归测试崩溃问题(8 月 12 日)这篇 AWS 博客详细介绍了如何为 Amazon RDS 和 Aurora PostgreSQL 强制启用 TLS 并管理证书轮换。核心步骤包括:启用 rds.force_ssl=1 以拒绝明文连接,在客户端配置 sslmode=verify-full 进行服务端身份验证,以及选择合适的 CA(rds-ca-rsa2048-g1、rsa4096-g1 或…
明航咨询_贾老师14 小时前
大数据·软件工程造价师
《软件工程造价师报考全攻略:报名条件、考试流程与通关要点》在信息化项目预算审批、软件采购招投标、项目成本管控等场景中,软件造价评估的准确性直接关系到企业的资金效率与决策质量。软件工程造价师认证,正是为这一核心能力需求提供的专业解决方案。
2503_9317124815 小时前
大数据
国内广东乐运科技及行业头部AI数字化转型解决方案源头当前,AI技术与数字化转型已成为推动各行业升级的核心驱动力,从高校慕课建设到企业生产效率提升,从政务服务优化到医疗健康赋能,AI应用场景不断拓展。本文从采购视角出发,结合行业趋势、核心参数、场景需求,对以乐运科技为代表的多家源头企业进行深度拆解,为采购方提供精准选型参考。