数据分析

SelectDB5 小时前
大数据·数据库·数据分析
Apache Doris 5.0 年度版本前瞻(一):构建统一的多模湖仓实时分析平台导读:本文主要介绍 Apache Doris 5.0 针对多模湖仓的核心演进:过去十多年,数据平台主要围绕结构化表与 SQL 建设:把数据汇聚到数仓,通过稳定的批处理和 OLAP 查询支撑报表与经营分析。
橙时数据 FineInsight6 小时前
大数据·人工智能·数据分析·指标平台·fineinsight
AI 能回答数据问题,但能解释业务原因吗?随着 AI 问数进入企业数据分析场景,获取一个经营数字正在变得越来越简单。管理者可以直接询问:AI 可以快速识别问题并返回结果。但在经营管理中,管理者真正关心的通常不是“发生了什么”,而是“为什么会发生”。
SelectDB技术团队6 小时前
数据分析·实时数仓·数据更新·主键模型·实时更新·写入更新·olap 引擎
实时主键更新选型:Doris MOW vs StarRocks 主键模型原理解析结论先行:Doris 与 StarRocks 都支持实时主键更新(UPSERT)。Doris 自 1.2 起提供 Merge-on-Write(MoW),2.1 起成为默认实现——写入即合并、查询免多版本合并;StarRocks 主键表采用 Delete+Insert 策略,同样避免读时合并。值得强调的是,同一张 Doris MOW 表还能同时承载上篇的高并发点查,读写并存场景更省一套架构。
数脉8 小时前
数据分析
从 0 设计一个列级数据血缘模型:我们踩过的坑与最终方案最近在做一个企业级 SQL 数据血缘分析平台(支持 28 种 SQL 方言),把血缘模型的设计过程整理出来分享给大家。血缘分析这个领域,说难不难——本质就是"从 A 表的 a 列,算出了 B 表的 b 列";但要做好列级(column-level)血缘,模型设计上有一堆绕不开的取舍。本文不讲如何解析 SQL(那是另一篇的量级),专注聊血缘结果的数据模型该怎么设计。
Mr数据杨10 小时前
人工智能·数据分析·kaggle竞赛
电子游戏日本市场销量预测实战 从 Kaggle 回归赛题到区域销售判断这道 Kaggle 赛题聚焦一个很典型的业务问题:已知游戏平台、发行年份、类型、厂商、评分表现以及北美和欧洲等区域销量,预测游戏在日本市场的销售规模。任务形式是结构化数据回归,业务本质却是跨区域市场迁移判断,适合用来训练从数据理解到建模验证的完整分析能力。
BioRunYiXue10 小时前
java·开发语言·javascript·人工智能·算法·数据挖掘·数据分析
科研干货 | IC50全面解读:概念解析、实验设计与数据分析要点抑制酶的活性是药物设计与研发中的核心策略之一。半数抑制浓度(Half maximal inhibitory concentration,IC50)是衡量抑制剂生物学功能有效性的关键指标,定义为将特定生物或生化功能抑制至50%水平时所需的抑制剂浓度。简言之,IC50值越低,表明抑制剂与靶标酶的相互作用效率越高,因此IC50在化合物活性排序和先导化合物筛选中具有重要的参考价值。
Mr数据杨10 小时前
人工智能·数据分析·kaggle竞赛
小样本图像分类实战 Cleaned vs Dirty V2 盘子清洁识别案例解析Cleaned vs Dirty V2 是一道体量不大但很有代表性的计算机视觉竞赛,任务目标非常明确:根据盘子图像判断其属于已清洁还是脏污状态。训练集每类仅 20 张图片,测试集却有数百张样本,问题难点因此集中在小样本条件下的泛化能力,而不是常规的大规模图像训练流程。
Mr数据杨11 小时前
人工智能·数据分析·kaggle竞赛
Arxiv论文标题生成实战 从摘要到标题的文本生成建模案例学术文本生成并不只是大模型演示场景,真正进入工程实践后,问题往往会收缩成更具体的形式。Arxiv Title Generation 这道题聚焦摘要到标题的映射,输入是论文摘要,输出是信息密度很高的学术标题,核心挑战在于术语保真、关键信息压缩和结果可评估。
BYSJMG12 小时前
大数据·python·信息可视化·数据分析·spark·kmeans·课程设计
计算机毕业设计选题推荐|【基于大数据的植被光谱特征与环境因子关联分析及可视化】Spark+K-Means精彩专栏推荐订阅:在下方主页👇🏻👇🏻👇🏻👇🏻💖🔥作者主页:计算机毕设木哥🔥 💖
千里码aicood12 小时前
数据分析·音视频·美食
B站美食视频数据分析与可视化B站美食视频数据分析与可视化项目旨在通过先进的数据挖掘技术和可视化手段,深入探索B站美食视频的传播规律和用户行为模式。项目构建了一套完整的数据分析体系,涵盖了播放量分布、UP主数据统计、视频时长分析、互动分析、视频风格分析以及内容分类聚类分析等多个维度。通过数据大屏的直观展示,用户可以实时了解B站美食视频的整体情况,包括播放量的地域分布、UP主的影响力排名、视频时长的分布特征、用户的互动行为、视频的风格特点以及内容的分类聚类结果。
Mr数据杨13 小时前
人工智能·数据分析·kaggle竞赛
乌克兰新闻来源分类实战 从文本分类到媒体识别建模新闻文本分类常见于主题识别与情感判断,这道 Kaggle 赛题的难点却在于来源识别。模型需要从标题和正文中捕捉媒体写作风格、用词偏好与叙事差异,判断一篇新闻来自哪个媒体源,而不是判断新闻讲了什么。
Mr数据杨1 天前
人工智能·数据分析·kaggle竞赛
从文本特征到回归建模 Syllable Counting Model 实战解析音节计数看似是语言学小问题,落到数据任务中却很有代表性:输入是短文本,输出是离散但可按连续值建模的数量结果。Syllable Counting Model 这类赛题适合用来练习如何把词形规律转成可计算特征,并用回归方法控制预测误差。
Mr数据杨1 天前
人工智能·数据分析·kaggle竞赛
自行车需求预测实战解析 从 Kaggle 回归赛题理解时序建模这道 Kaggle 赛题聚焦自行车需求预测,本质是一个面向运营场景的时序回归问题。题目规模不大,却覆盖了结构化预测项目中最关键的链路,包括业务抽象、时间特征构造、验证切分设计以及 RMSE 指标下的误差控制,很适合作为需求预测入门到实战过渡案例。
Mr数据杨1 天前
人工智能·数据分析·kaggle竞赛
用会计信息做GDP增速预测的时序回归实战解析GDP 增速预测并不只是宏观研究话题,在企业经营分析、投研支持和政策研判中都属于高频需求。这道 Kaggle 竞赛把问题收束为一个很具体的任务:利用会计信息预测 GDP 增长,并用 RMSE 衡量预测误差,适合拿来练习结构化时序建模的完整流程。
Mr数据杨1 天前
人工智能·数据分析·kaggle竞赛
企业年报文本变化预测实战 从文本回归到信息披露分析企业年报并不只是财务数字的载体,叙述性内容的增删、改写和措辞调整,同样承载着经营变化、风险表达和合规信号。这场 Kaggle 竞赛的价值,正在于把看似难以量化的文本变动转成可建模的连续预测问题,训练从业务语境出发理解文本回归任务的能力。
Mr数据杨1 天前
人工智能·数据分析·kaggle竞赛
钻石价格预测实战 从 Kaggle 回归赛题看结构化数据建模落地这篇案例围绕 Kaggle 上的 CEUPE Big Data Analytics 竞赛展开,任务核心是依据钻石的克拉、切工、颜色、净度与尺寸等结构化属性预测价格。题目规模不大,却完整覆盖了结构化回归项目中最常见的关键环节,包括字段理解、异常值识别、类别编码、特征构造、模型选择与误差评估。
Mr数据杨1 天前
人工智能·数据分析·kaggle竞赛
从 Kaggle 到实战的多标签文本分类案例拆解多标签文本分类的难点不在于把文本送入模型,而在于把业务语义、标签结构和评估方式真正对齐。前面的内容围绕一份 Kaggle 竞赛数据展开,重点不是停留在平台页面信息,而是还原一个可执行的文本分类项目:怎样识别文本列与标签列,怎样建立可复现基线,怎样让验证结果对上线效果有参考价值。
夜雪一千1 天前
人工智能·数据挖掘·数据分析
如何写一个数据分析 Skill在大模型应用开发中,很多人会直接把数据分析需求丢给大模型,让模型自由写SQL、处理表格、输出结论。但这种方式有明显短板:输出不稳定、格式混乱、容易编造数据、无法复用分析逻辑。
夜雪一千1 天前
人工智能·语言模型·数据挖掘·数据分析
如何编写一个数据分析 Skill:完整拆解一个案例前两篇讲了"怎么写 Skill"和"该选什么来写"。这篇不空谈了,拿数据分析当样板,从头到尾走一遍:从需求定义、流程设计、脚本与模型的职责划分,到验收标准,把一个能稳定产出报告的 Skill 是怎么"长"出来的,一步步拆给你看。数据分析恰好是绝佳的案例——它同时包含确定性部分(计算)和不确定性部分(归因),正好覆盖 Skill 设计的全部要素。