数据挖掘

白狐_79812 小时前
数据结构·分类·数据挖掘
408数据结构第5章:树与二叉树③——公式分类速查用途:考前快速查公式。看到题型后直接定位公式。按度分类:展开:适用:默认根为第1层。高度为h:等价:从1开始编号。
HAYDENR13 小时前
人工智能·数据挖掘
数据挖掘如何实施?数据挖掘实施过程有哪些注意事项?数据挖掘项目最怕一种情况:模型离线验证效果达标,一到生产环境就频繁失效。根源往往不在算法,而是工程化流程没打通。数据口径不一致、特征穿越没拦截、调度出错无人感知——这些环节反复消耗精力,导致上线后效果快速衰减,却找不到问题在哪个节点。这篇文章会把这些痛点逐一拆解,给出一套可以直接落地的分步操作指南,把业务定义、数据集成、特征加工、建模评估和部署监控的完整链路讲透,让你能照着搭出一条稳定可迭代的数据挖掘流水线。
TAICHIFEI15 小时前
3d·分类·数据挖掘
光片显微镜海量3D图像重建/拼接软件全分类分为Fiji开源插件、独立开源命令行工具、新一代大数据框架、厂商配套商用软件、专用手动交互工具五大类,同时标注各自与BigStitcher的核心差异、适用场景、优缺点。
雪山青木17 小时前
大数据·爬虫·python·数据挖掘·数据分析·新浪微博
全国微博签到数据201912-202004微博签到数据,一种社交媒体LBS时空大数据,指用户发布微博时主动关联地点(POI),使得该微博具有时空属性。具备大样本、高时间粒度特征,能够表征人群空间活动节律、热点分布、城际流动及场所感知,广泛应用于城市功能识别、旅游地理、社会感知等领域。
HAYDENR19 小时前
人工智能·数据挖掘
数据挖掘是什么?数据挖掘在实际业务中如何落地应用?做数据分析这几年,最让我头疼的不是模型调参,而是每次要启动数据挖掘项目前的那摊数据烂账。上个月业务方急着要一份用户流失预警,需要把 CRM 客户档案、线上商城订单流水、还有客服系统的投诉工单拼到一起。我手动从三个系统导出 CSV,再切到 Excel 里做 VLOOKUP,光对齐不同来源的客户唯一标识就耗掉整整一个上午,中途还因为日期格式不一致导致几百条记录匹配错位,差点把一批高价值客户误判成流失。这种跨系统导数据的体力活,一加班就是两三天,数据挖掘的探索分析反而被挤到半夜随便跑一下,效果可想而知。
yanweijie03172 天前
数据挖掘·数据分析·pandas
Pandas 完整数据分析工作流实战(标准 5 步流程)在日常数据分析、报表开发、机器学习预处理场景中,Pandas 是 Python 最核心工具。很多初学者零散学习各种 API,缺少一套标准化分析流程。本文结合 Pandas 架构思维导图,带你落地一套通用数据分析流水线:导入库 → 加载数据 → 数据清洗 → 特征构造 → 数据分析,可直接套用在业务数据集上。
十三画者2 天前
人工智能·机器学习·数据挖掘·数据分析·数据可视化
【文献分享】CANVAS:基于细胞构架与邻域信息的组织病理学虚拟空间肿瘤分析肿瘤微环境(Tumor Microenvironment, TME)的空间异质性是影响癌症进展、治疗响应和患者预后的核心因素。近年来,以CODEX(CO-Detection by indEXing)为代表的高重空间蛋白组学技术能够同时检测数十种蛋白标志物,在单细胞分辨率下揭示TME中免疫细胞、基质细胞与肿瘤细胞的空间组织架构。然而,这类技术成本高昂、操作复杂,难以在常规临床中大规模应用。与之形成鲜明对比的是,H&E染色病理切片是癌症诊断的临床金标准,具有普遍可及性和与现有临床工作流的完美兼容性。但H&E仅
leisoo80973 天前
python·数据挖掘·数据分析
筹码分布数据分析实战:用Python构建主力建仓成本分析系统筹码分布数据分析实战:用Python构建主力建仓成本分析系统筹码分布是技术分析中一个很特别的指标,它试图展示不同价格上的持仓量分布,帮助投资者判断主力的建仓成本和持仓变化。去年我用Python实现了一个筹码分布计算系统,通过历史K线和逐笔成交数据还原主力的建仓过程。这篇文章分享系统的核心设计和代码实现。
编程风暴3 天前
java·数据挖掘·数据分析
零基础数据分析项目模板+5条避坑红线零基础准备数据分析项目,掉的第一个坑通常不是做不出项目,而是做了一个“看起来像项目但面试一问就穿”的项目。简历上写满了项目名,面试官追问两句就答不上来,比不写还尴尬。
淡忘suuda4 天前
人工智能·数据挖掘·回归
生产级 AI Agent 评测体系实战:从数据集构建到自动回归与质量门禁很多团队在开发 AI Agent 时,评测方式仍然停留在“人工问几个问题,看回答是否满意”。这种方式在 Demo 阶段可以接受,但一旦进入生产环境,就会暴露出严重问题:
数智化管理手记4 天前
大数据·人工智能·数据挖掘·云计算
元数据和业务数据有什么区别?元数据价值体现在什么地方?数据堆成山却用不起来,你分得清数据和数据的说明书吗?前阵子跟一位制造业的数据主管聊天,他说了一件事让我特别有共鸣。公司上了ERP、MES、CRM三套系统,数据量越来越大,但每次想找个具体的字段、搞清楚某个指标怎么算的,比登天还难。数据库里几百张表,没人知道哪张表存了什么、字段什么意思、数据从哪来的。
十三画者4 天前
人工智能·机器学习·数据挖掘·数据分析
【文献分享】3d-OT:面向空间多组学异质性切片对齐的深度几何感知框架空间多组学技术的飞速发展,使得研究人员能够在组织原位同时检测多种分子信息,如转录组、表观基因组和蛋白质组等,从而揭示细胞在组织中的空间异质性与功能特化。然而,如何有效地整合这些多元异构数据,并实现不同切片之间的精确对齐,尤其是在存在非刚性形变、分辨率差异和缺失对应关系的情况下,仍是计算生物学领域的重大挑战。针对这一问题,Bingjie Dai及其合作者在Nature Methods上发表了题为“3d-OT: a deep geometry-aware framework for heterogeneous
迷迭香yy4 天前
人工智能·python·数据挖掘
集合竞价数据挖掘实战:用Python构建开盘信号识别系统集合竞价数据挖掘实战:用Python构建开盘信号识别系统集合竞价是每个交易日开盘前的15分钟,很多人觉得这段时间没什么信息量,开盘价出来再操作也不迟。但我实际测试下来,集合竞价阶段的数据包含了大量有价值的信号,特别是对日内短线交易来说。这篇文章分享我用Python构建的集合竞价信号识别系统。
weixin_446260855 天前
人工智能·分类·数据挖掘
生成式与智能体AI认知能力缺陷分类体系论文原文链接:https://arxiv.org/html/2608.02553v1认知人工智能(Cognitive AI)旨在突破纯文本生成、单次任务自主执行的局限,构建具备持续推理、自适应行为、长期稳定记忆、自我调控能力的AI系统。当前生成式、智能体大模型虽然在各类短任务上表现亮眼,但底层核心认知功能碎片化、发育不完善,无法支撑长时间稳定自主运行。 本文以分类学综述形式,系统梳理限制现有AI发展的五大类核心认知缺陷:持久状态建模、目标导向自主、自我监控与控制、环境交互、学习与自适应。针对每个维度梳理前
编程风暴5 天前
大数据·数据挖掘·数据分析
数据分析实习投递渠道实操模板:回复率对比+匹配度自检表+case-by-case机制先判断你的情况适合走哪个渠道。逐行对照,选回复率上限高于5%的渠道。渠道回复率范围推荐条件不推荐情况定向内推(专业匹配)
lkx097885 天前
数据挖掘·数据分析·pandas
01-数据分析入门-Pandas实战写作日期:2026-08-04 | 来源:数据分析学习笔记(六步流程 + Pandas 实战) 关键词:Pandas、数据清洗、groupby、透视表、数据分析流程
世人万千丶5 天前
学习·机器学习·华为·数据挖掘·harmonyos·鸿蒙·聚类
鸿蒙Crash高级捕获与异常监控:全局异常兜底/崩溃栈解析/符号表还原/智能聚类/闭环修复掌握 errorManager 全局异常兜底、学会崩溃栈符号化与智能聚类、搭建"捕获→聚类→定位→修复→验证"的崩溃治理闭环
spider_xcxc6 天前
数据挖掘
[特殊字符] 空间数据挖掘中频繁并置模式挖掘的并行与分布式加速:从传统方法到异构协同新架构摘要:频繁并置模式(Frequent Co-location Pattern)挖掘是空间数据挖掘的核心任务之一,但随着空间数据规模爆炸式增长,传统串行算法在计算效率上面临严峻挑战。本文系统梳理了现有并行与分布式方案的核心瓶颈,并提出一套融合空间-语义联合分区、GNN预筛选、增量星型图与CPU-GPU异构流水线的创新架构,为大规模空间并置模式挖掘提供了全新的技术路线。
AI科技星6 天前
人工智能·线性代数·机器学习·重构·数据挖掘·回归·ai科技星
全域光速运动理论体系 (GAQ-UFT)——范式重构、核心方程与传统物理的本质分野作者:AI科技星经典狭义相对论仅在四维时空定义四维速度模长恒等于光速,属于数学推论;而全域光速理论 (GAQ-UFT) 将该结论升维为三维空间第一性本源公理,以三维螺旋正交分解作为底层几何图像:一切物质基元(有静质量粒子、无静质量光子、时空真空单元)的 全域运动矢量(宏观平动 u\boldsymbol{u}u + 内禀螺旋运动 v⊥\boldsymbol{v}_\perpv⊥)模长永恒等于真空光速 ccc ,即 u2+v⊥2=c2\mathbf{u}^2 + v_\perp^2 = c^2u2+v⊥2=c
临床数据科学和人工智能兴趣组6 天前
开发语言·数据挖掘·数据分析·r语言·r语言-4.2.1
要使用 R Markdown,首先需要安装 R 和 RStudio,接着安装 rmarkdown 包下面内容摘录自《用R探索医药数据科学》专栏文章的部分内容(原文6872字)。1篇2章8节:用R读写Excel、SPSS、SAS、Stata和Minitab等产生的数据文件(更新20250129)_rmarkdown中内容解释-CSDN博客