技术栈
数据挖掘
萌新小码农
3 分钟前
人工智能
·
数据挖掘
·
回归
Logistic回归为什么不用均方误差 MSE(square error)
逻辑回归:输出 y^=σ(z)=11+e−z\hat y=\sigma(z)=\frac{1}{1+e^{-z}}y^=σ(z)=1+e−z1,KaTeX parse error: Can't use function '\(' in math mode at position 1: \̲(̲z=wx+b\),y^∈(0,1)\hat y\in(0,1)y^∈(0,1),标签 y∈{0,1}y\in\{0,1\}y∈{0,1}。
小小测试开发
18 小时前
人工智能
·
数据挖掘
·
回归
LLM评测:LLM-as-Judge 想当回归门禁,先过偏差校准和双层评分这两关
LLM-as-Judge 已经是 LLM 应用语义评测的事实标准,但把它当测试断言用之前,得先回答一个问题:judge 给的分可信吗。我们踩过的坑是:judge 打分和人工评估的相关性一开始只有 0.4 左右,拿它直接卡发布,拦错了好版本,也放过了坏版本。问题不在 judge 模型不够强,在评测协议本身有偏差——自夸、位置、长度、尺度漂移,四个偏差叠在一起,分数就成了带噪声的猜测。修协议比换模型便宜得多。落地做法是双通道打分(rubric 绝对分 + 成对比较)、一致性统计兜底、人工抽检校准相关性、回归
databook
18 小时前
python
·
数据挖掘
·
数据分析
正态分布撒谎时:用柯西分布捕捉生活中的“黑天鹅”
你有没有遇到过这样的怪事?如果你用我们熟悉的正态分布(钟形曲线) 来套这些场景,它会告诉你:“堵车 2 小时的概率低到几乎不可能,简直是个错误数据。”
waoooqwe
20 小时前
数据挖掘
·
数据分析
2026年9月数据分析工具排行榜
2026年9月,数据分析工具市场进入新一轮竞争格局。开学季与秋招季叠加,让学习型用户对工具的需求快速升温;企业把AI原生能力作为选型时的核心指标;各类数据竞赛与建模赛事临近,也带动了分析工具的使用讨论。结合2026年前三季度的市场表现、用户实际反馈与权威机构研究,以下榜单梳理了9月值得重点关注的数据分析工具排名,并逐一罗列优缺点,供不同需求的人群参考。 本次榜单从六个维度进行综合评估:智能化程度,即工具内置AI辅助能力的高低;分析深度,即能否支撑从清洗、建模到统计检验的完整分析;易用性,即上手门槛与学习成
2601_95717465
21 小时前
人工智能
·
数据挖掘
·
数据分析
AI 数据分析小白入门 没基础怎么才能学好
对于零基础的小白来说,学习 AI 数据分析完全可行。当前的 AI 技术已经大幅降低了数据分析的门槛,普通人无需掌握复杂的代码或高深的算法,也能通过人机协作完成专业级的数据分析。 要学好这项技能,首先需要明确自己的发展方向。AI 数据分析主要分为“AI数据分析应用(零代码/低代码)”和“AI技术开发(编程/算法)”两条路径。对于零基础小白,强烈建议从应用路径切入,将 AI 作为你的“智能分析副驾驶”。 好课优选给您零基础入门的系统性学习指南: 一、 核心学习逻辑:人机协同工作流 在 AI 时代,数据分析的核
2601_96035638
1 天前
数据挖掘
·
数据分析
组织效能岗位需要掌握哪些数据分析、BI和HR数字化工具
教育部公布的2025届高校毕业生规模为1222万人,秋招竞争下,企业更倾向招聘能直接处理数据和业务问题的HR类应届生。
residual_fan
2 天前
人工智能
·
算法
·
数据挖掘
·
数据分析
深度渐进收缩学习(DPSL):面向强噪声与类内分散的机械复合故障诊断方法
在高端机械装备的健康监测领域,发表于《Measurement》的论文《Mechanical compound fault diagnosis via suppressing intra-class dispersions: A deep progressive shrinkage perspective》针对强噪声环境下的复合故障诊断问题展开了深入探讨。
计算机源码社
2 天前
大数据
·
hadoop
·
python
·
机器学习
·
数据挖掘
·
spark
·
毕业设计
分享一个基于大数据的跨平台内容生态画像与互动等级分析系统,基于Hadoop+Spark的社交媒体互动数据可视化大屏分析
💕💕作者:计算机源码社 💕💕个人简介:本人八年开发经验,擅长Java、Python、PHP、.NET、Node.js、Spark、hadoop、Android、微信小程序、爬虫、大数据、机器学习等,大家有这一块的问题可以一起交流! 💕💕学习资料、程序开发、技术解答、文档报告 💕💕如需要源码,可以扫取文章下方二维码联系咨询
Talordata
2 天前
大数据
·
人工智能
·
ai
·
数据挖掘
從失控的價格爬蟲到可控的數據管線:一個跨境品牌數據團隊的重構手記
我在一家消費電子品牌負責海外市場的數據團隊。我們的產品透過經銷商網絡鋪進歐美與東南亞的數十個電商平台,年營收的三分之二來自線上通路。對這類品牌而言,價格不只是數字,而是通路的秩序:經銷商擅自降價會引發連鎖性破價,廣告投放的投資報酬率會被侵蝕,消費者對品牌的價值認知也會隨之滑落。
databook
3 天前
python
·
数据挖掘
·
数据分析
Beta 分布:如何用“成功”和“失败”来预测下次尝试
想象一下这个场景:明天你要去一家新开的网红餐厅。你翻开点评软件,看到过去 10 个人里,有 7 个人给了好评。
residual_fan
3 天前
算法
·
数据挖掘
·
数据分析
数据缺失填补算法之CUR-Estimator
在复杂工业装备运行监测与多变量时间序列分析中,传感器偶发故障、工况多变以及采样频率动态调整常常导致序列数据存在非均匀间隔与数据缺失问题。
电商API_18007905247
4 天前
java
·
大数据
·
开发语言
·
前端
·
数据挖掘
电商商品价格监控工具淘宝京东商品价格抓取API项目实操分享
"item": { "num_iid": "969545298787", "title": "中古风飘窗小桌子卧室大板电脑桌实木带抽屉定制高低脚窗台书桌", "desc_short": "", "price": "500.00", "total_price": 0, "suggestive_price": 0, "orginal_price": "500.00", "nick": "岩森家居", "num": 2600, "min_num": 0, "detail_url": "https://item.
2601_96207798
4 天前
python
·
机器学习
·
数据挖掘
·
数据分析
·
编程
利用Python,四步掌握机器学习
需学习 或者R, 以此来理解以及应用机器学习技术, 这两者是和C、Java、PHP相类似的编程语言, 然而, 因 以及R都较为年轻, 并且更“远离”CPU, 故而它们显得简省一些, 相较于R仅用来处理数据, 借助像是机器学习、统计算法以及漂亮的绘图来分析数据, 的优势是它适用于诸多其他问题。因为凭借更广阔的分布, 也就是运用Jango托管网站, 涉及自然语言处理NLP, 要访问推ter等网站的API, 与此同时, 像存在更多的传统语言那般, 比如较为流行的C。
147API
4 天前
人工智能
·
深度学习
·
机器学习
·
数据挖掘
蒸馏项目什么时候该停,怎样切换到RAG、微调或模型路由
蒸馏实验连续几轮不达标时,继续补数据和调参数并不一定划算。工程团队应先确认失败发生在知识、任务行为、学生容量还是调用成本。知识频繁变化,先评估RAG;输出规则长期不稳定,可以测试微调;请求难度差异很大,模型路由可能更合适;只有任务已经稳定、教师明显优于学生,并且成本或延迟成为主要限制时,蒸馏才值得继续。
residual_fan
4 天前
人工智能
·
算法
·
数据挖掘
·
数据分析
持续对比强化学习(Continual Contrastive Reinforcement Learning)论文分享
在处理复杂时序监测数据与动态演化环境时,传统机器学习模型往往面临训练与部署相互割裂、无法适应数据流持续增长以及类别分布极度不平衡等挑战。论文《Continual contrastive reinforcement learning: Towards stronger agent for environment-aware fault diagnosis of aero-engines through long-term optimization under highly imbalance scenari
leoZ231
4 天前
前端
·
javascript
·
vue.js
·
opencv
·
计算机视觉
·
数据挖掘
·
语音识别
第 4 篇:布局骨架——页面壳、栅格、卡片
把「统一布局」做成几个固定的布局组件。之后每个页面 = 布局骨架 + 一份 schema, AI 不碰布局,布局由这几个组件锁定。
是翎
4 天前
大数据
·
人工智能
·
学习
·
机器学习
·
数据挖掘
Vibe Coding零基础入门:六步工作流拆解
这次的 Vibe Coding 教程案例叫 RicoScreenshot,截图美化编辑工具。我们会完整跑一遍 Vibe Coding 的网站开发流程,工作流是通用的,再复杂一次的的项目也适用。
residual_fan
4 天前
人工智能
·
算法
·
数据挖掘
·
数据分析
特征级SMOTE(Feature-level SMOTE)论文分享
在实际分类任务与机器学习建模中,少数类样本稀缺带来的类别不平衡问题十分常见,同时类别重叠(Inter-class overlap)也进一步增加了分类难度。论文《Feature-level SMOTE: Augmenting fault samples in learnable feature space for imbalanced fault diagnosis of gas turbines》针对这一问题展开了深入研究。传统的合成少数类过采样技术(SMOTE)及其变体主要在原始数据空间中进行线性插值,
leihefeng
4 天前
python
·
分类
·
数据挖掘
·
tf-idf
·
sklearn
邮件文本分类:CountVectorizer / TF-IDF + 朴素贝叶斯
一句话总结: 邮件分类是文本分类的经典场景,TfidfVectorizer(抑制停用词)+ MultinomialNB(多项式朴素贝叶斯)是工业基线三件套。
optiz
4 天前
数据挖掘
·
数据分析
·
聚类
单细胞数据分析--多数据整合harmony聚类