机器学习ML-简介、数据获取、网页数据抓取

机器学习工作流程

  1. 问题构建
  2. 处理&收集数据
  3. 训练&微调模型
  4. 部署模型

其中需要在第二阶段和第四阶段进行检测

挑战

  • 模型构建问题:要聚焦于最有影响力的工业问题
  • 数据问题:高质量数据稀少
  • 训练模型:模型越来越复杂,越来越贵
  • 部署模型
  • 监控

相关角色

  • 领域专家:有商业洞察力,知道什么数据是重要的,并且在哪里找到他,识别一个机器学习模型真正的影响力
  • 数据科学家:数据挖掘,模型训练和部署的全栈
  • 机器学习专家
  • SDE软件开发工程师:开发维护大量代码,模型训练

数据获取

常用数据集

  • MNIST:手写数据集
  • ImageNet:图片搜索引擎中的百万级别的图片
  • AudioSet:youtube声音的切片
  • Kinetics:youtube视频切片
  • KITTI:交通影像数据
  • Amazon Review
  • SQuAD:维基百科的问答数据对
  • LibriSpeech:有声读物数据集

寻找途径

  • Paperswithcodes Datesets:学术数据集
  • Kaggle Datasets:数据科学家上传的ML数据集
  • Google Dateset search:搜索引擎
  • tensorflow,huggingface
  • 各类会议、竞赛
  • Open Data on AWS

网页数据抓取




相关推荐
小糖豆巴拉巴拉5 分钟前
AI应用(1)-基础概念的理解
人工智能
CES_Asia13 分钟前
亚洲科技话语权之争:CES Asia 2026核心展区席位进入收官阶段
大数据·人工智能·科技·物联网·机器人
一个会的不多的人15 分钟前
人工智能基础篇:概念性名词浅谈(第十四讲)
人工智能·制造·数字化转型
Brduino脑机接口技术答疑15 分钟前
TDCA 算法在 SSVEP 场景中:Padding 的应用对象与工程实践指南
人工智能·python·算法·数据分析·脑机接口·eeg
玄同76528 分钟前
Python 装饰器:LLM API 的安全与可观测性增强
开发语言·人工智能·python·安全·自然语言处理·numpy·装饰器
房产中介行业研习社31 分钟前
市面上比较主流的房产中介管理系统有哪些推荐?
大数据·人工智能·房产直播技巧·房产直播培训
学习3人组33 分钟前
目标检测模型选型+训练调参极简步骤清单
人工智能·目标检测·决策树
Yeats_Liao34 分钟前
MindSpore开发之路(十七):静态图 vs. 动态图:掌握MindSpore的两种执行模式
人工智能·深度学习·机器学习
keep_learning1111 小时前
Z-Image模型架构全解析
人工智能·算法·计算机视觉·大模型·多模态
雅欣鱼子酱1 小时前
Type-C接口小家电 PD诱骗电压方案
人工智能·芯片·电子元器件