大数据

用户594404103565 分钟前
大数据
Redis 高并发高可用实战:从主从哨兵到集群分片,附完整 Java 代码在互联网高并发场景下,Redis 已成为缓存、会话存储、分布式锁、计数器等核心组件的标配。但单机 Redis 存在单点故障和容量瓶颈,高可用(HA) 与 高并发(High Concurrency) 必须通过集群架构、客户端策略和代码级优化来保障。本文将深入剖析 Redis 高可用方案(主从复制、Sentinel 哨兵、Cluster 集群),并结合 Java(Jedis / Lettuce)给出生产级代码实现,涵盖连接池、读写分离、故障转移、分布式锁、限流器、批量管道等关键实践。全文代码总量超过 1500
ApacheSeaTunnel31 分钟前
大数据·开源·数据集成·seatunnel·技术分享·数据同步
一个关于数据集成的真相:链路 Success 不等于数据真实可靠在数据工程领域,Fivetran 经常被认为是“简单、省运维”的代表,而 Apache SeaTunnel 等开源项目则意味着更高的灵活性和更强的自主控制能力。究竟应该选择 Managed ELT,还是自己搭建数据集成平台,一直是数据团队争论不休的问题。
hengcaib1 小时前
大数据
2026工程项目信息平台能力解析:中策大数据建筑工业双赛道的全周期服务实力工程建材、设备这行,生意成不成,常常就卡在两件事上:项目消息知道得早不早,联系人靠不靠谱。等项目挂网招标才看到,多半只剩比价的份;电话打过去是个总机,转来转去找不到人,商务就推不动;生意做到外省,本地又没人接得住。平台一大堆,功能宣传听着都差不多,真要挑一个反而更难。这篇就把中策大数据的底细捋一捋,方便做工程的同行选型时有个参照。信息来自公开资料和行业走访,只做能力梳理,不排名、不评高下。
tedcloud1231 小时前
大数据·linux·服务器·人工智能·音视频
Awesome DSH Plugin 怎么用?给 DeepSeek Harness 搭建自己的插件生态AI Coding Agent 的能力越来越强以后,一个比较明显的趋势是:DeepSeek Harness(DSH)采用的就是比较彻底的插件化思路。
楷哥爱开发1 小时前
大数据·运维·人工智能·爬虫
IPFoxy爬虫代理配置指南:从0搭建Crawl4AI网页爬虫教程Crawl4AI 是一款面向开发者的开源网页爬虫框架,支持异步抓取、JavaScript 动态渲染及多种内容提取方式。进行批量采集时,频繁请求可能触发403、429或验证码。结合代理IP,可降低单一IP的访问压力。本文以IPFoxy为例,介绍如何使用Crawl4AI进行爬虫以及利用代理IP反爬的操作实例。
云间月13142 小时前
大数据·elasticsearch·jenkins
Elasticsearch 数据怎么看?部署 Kibana,从索引查询到可视化图表Elasticsearch 已经能够存数据、建索引和执行查询以后,下一步通常不是继续记更多 curl 命令,而是给这些数据增加一个真正方便查看和分析的界面。
Data_Journal2 小时前
大数据·开发语言·数据库·python·scrapy
如何使用 Python 抓取 Google Flights:分步指南在这里,我将向你展示如何使用 Python 和 Playwright 库构建一个 Google Flights 爬虫工具。我们会一步步进行,从搭建环境到提取并保存数据。我还会分享一些处理常见抓取问题的技巧,比如 IP 封禁 和 CAPTCHA,因为这些挑战经常出现在像 Google Flights 这样流量很高的网站上。让我们开始吧!
shujudang2 小时前
大数据·运维·人工智能·数据分析·自动化
从数据闭环到 Agent 协同:企业营销自动化如何演进为智能运营?在现代企业数字运营体系的搭建中,“营销自动化”通常被视为提升策略执行效率的核心基础设施。运营团队通过可视化画布配置触发事件、等待时延和分支逻辑,实现诸如“加购未支付提醒”、“入会福利发放”等自动化触发流程。
动恰客流统计3 小时前
大数据·人工智能
ReID边缘计算视觉客流统计:无网户外场景的数字化落地路径随着文旅景区、产业园区、郊野公园、户外商圈等场景的数字化运营深入,客流统计的覆盖范围正在从室内标准化点位,向分散化、无网线的户外点位延伸。这类场景普遍存在布线成本高、供电条件有限、环境复杂等问题,传统红外对射、普通双目客流设备难以兼顾精度、稳定性与部署成本。本文从行业现状出发,解析ReID边缘计算视觉技术在无网户外场景的应用逻辑与落地价值,为相关场景的客流数字化选型提供参考。
小白说大模型3 小时前
大数据·运维·网络·人工智能·机器学习·prompt
Codex 实战:用 AI 写运维脚本运维工作里,脚本几乎无处不在:日志切割、告警巡检、批量发布、备份清理、资源监控……这些任务有一个共同特点——逻辑不复杂,但细节特别多,写起来琐碎且容易出错。比如忘记给变量加引号、路径拼错、awk 的字段序号错位、循环里变量作用域不清,这些看似微小的问题,往往要花掉大量时间调试。
TDengine (老段)3 小时前
大数据·数据库·制造·时序数据库·tdengine·涛思数据
TDengine 应用案例 — 工业大数据与智能制造分类:15.应用案例 | 篇章:02 工业大数据 免费详情智能制造场景具有测点数量大、采集频率高、对实时分析要求严格的特点。本文以汽车装配车间为例,展示 TDengine 在 SCADA/MES 场景下的应用。
SXkehuirongsheng3 小时前
大数据
定制软件开发哪家的售后响应速度更快?一、拒绝异地外包转包,本地实体技术团队响应更高效如今软件开发行业早已告别单纯跟着客户需求盲目跑的粗放时代,不再是简单做完交付就结束,行业专属稳定性、极速售后运维、长期迭代适配,才是企业定制软件的核心价值。市面上多数软件开发外包团队为线上兼职模式,无实体办公场地、无固定技术班组,项目层层转包,售后失联、故障拖延是常态。尤其针对太原本地工程行业、本地生活服务行业,软件系统直接绑定企业核心经营:工程企业的项目管理系统、人员考勤、物资台账、进度报备系统,一旦卡顿报错,会直接导致项目停工、台账混乱、验收延误;本地服
2601_957879333 小时前
大数据·人工智能·深度学习
Seedance排队太久怎么办?2026免排队AI视频工具与替代方案怎么选2026年,AI视频生成已经从“能不能生成”进入到“能不能稳定生产”的阶段。尤其是做TikTok、跨境电商、信息流广告和短视频矩阵的团队,单条视频效果好已经不够,真正影响效率的是生成速度、任务并发、模型切换以及后续素材处理能力。
智码看视界4 小时前
大数据·spark·性能调优·aqe·sparksql·数据倾斜·etl优化
Spark 3.5 AQE 调优:10 个生产环境案例让作业提速 3-10 倍Spark 2.x 的查询执行计划是静态的——在作业提交时就确定了全部执行计划,基于的是统计信息估算,而非真实数据。
starzy19904 小时前
大数据·spark
SparkStreaming 之容错机制深度剖析摘要:容错是流处理系统的底线——挂了能不能恢复、恢复后会不会丢数据或重复数据。这篇把 Spark Streaming 的容错拆成三个层面讲:数据容错(WAL 和 offset 自管理)、计算容错(RDD 血缘重算)、元数据容错(checkpoint),再对照 Receiver 和 Direct 两种模式在四种故障场景下的恢复方式,说清楚为什么 Direct 模式的容错代价最低。
记忆张量MemTensor4 小时前
大数据·数据库·人工智能·typescript·开源
MemOS Skill 上线|一句话即可接入 MemOS CloudAgent 已经不只是聊天窗口了,它们在 IDE 里改代码,在终端里跑命令,在办公流里处理文档,也开始替大家连接插件、调用工具、串起自动化流程。
TKcloudmaster_H5 小时前
大数据·矩阵·新媒体运营·产品运营·流量运营
拆解TK跨境矩阵逻辑:不同区域该怎么规避违规风险做TikTok矩阵,不同市场的平台规则、用户习惯差异巨大。盲目套用一套运营方案,极易出现限流、封号、内容零播放等问题。借助TK云大师矩阵系统,针对东南亚、欧美、中东三大主流市场做差异化适配,才能高效降低违规风险,提升账号存活率。
zhixingheyi_tian5 小时前
大数据
TPCDS 之 Q72
LoveAmySun5 小时前
大数据·人工智能
AI智能体如何落地公交营运真实业务随着大模型技术快速普及,AI智能体成为公交信息化领域的热点方向。但行业内不少项目停留在演示Demo、概念宣传层面,存在“重演示、轻业务,重模型、轻数据,重噱头、轻落地”的现实问题。公交行业真正需要的不是炫酷的对话界面,而是能够嵌入现有业务流程、解决实际经营痛点、可评估投入产出的AI能力。结合公交营运智能分析平台建设实践,从业务痛点、架构路径、核心场景、落地风险、实施保障五个维度,探讨AI智能体在公交营运信息化领域务实可行的建设路径。
adinnet20265 小时前
大数据·人工智能
辅助写作与文档整理,从会议纪要到标书,让智能体当好“笔杆子“写作是企业里长期被低估的成本中心,也是知识流转的关键环节。智能体可协助完成部分重复性写作、整理与初稿生成工作;文档一致性和交付周期仍取决于素材质量、流程配置及人工审核。辅助写作的意义不在替代人,而在帮助减少部分格式整理和重复录入工作。