HarvardX TinyML小笔记2(番外3:数据工程)

课程链接:Course | edX

数据工程其实就是做数据集,这东西没有太多技术含量,但是可以说是决定ML成败的关键一环。毕竟有80%的时间耗费都是在高质量的数据集上。

数据决定模型上限,算法与工程仅决定逼近上限的程度。

整体步骤大概就是确定需求,收集,提炼,维持。流程倒是不难理解,首先明确需要什么样的数据集,然后用多种方式去收集,之后对数据处理验证,最后保管数据。

收集数据集的时候要注意开源协议,分析能不能使用。

数据来源的四种方式:传感器,众包,产品用户,付费用户。

总之好数据集的创建很麻烦。。。

列了几个可以直接用的数据集,Common Voice,COCO,ImageNet等等。后面有机会再看吧。

简单介绍了一下Google的Speech Commands。

Speech Commands

https://arxiv.org/pdf/1804.03209.pdf

  • What are Speech Commands?
  • What was People's motivation behind building Speech Commands?
  • How is Keyword Spotting different from traditional speech recognition models?
  • What are the important metrics in speech recognition for KWS?

之后介绍了一个Web的语音收集平台,Common Voice,都是白嫖很多自愿者。。。

主页:https://commonvoice.mozilla.org/

然后说了下如何复用已有的数据集。

最后还是老生常谈的数码平权,消除偏见。有一说一,不管实际如何,起码美国的学校对这方面还是很重视的。确实未来AI时代,一些细小的偏见都可能对人类社会带来深远影响。

最后还是说明,如果数据集选的不好,就算在程序中训练的准确率再高,程序可能也有问题。

So just because your Colab says you've got a certain accuracy does not mean that it's actually doing its job well from a TinyML application standpoint.

最后的总结,其实看这一篇就够了:Course | edX

相关推荐
高洁0128 分钟前
具身智能-普通LLM智能体与具身智能:从语言理解到自主行动 (2)
深度学习·算法·aigc·transformer·知识图谱
AI即插即用2 小时前
即插即用系列 | 2024 SOTA LAM-YOLO : 无人机小目标检测模型
pytorch·深度学习·yolo·目标检测·计算机视觉·视觉检测·无人机
金融小师妹3 小时前
基于机器学习与深度强化学习:非农数据触发AI多因子模型预警!12月降息预期骤降的货币政策预测
大数据·人工智能·深度学习·1024程序员节
brave and determined3 小时前
可编程逻辑器件学习(day29):Verilog HDL可综合代码设计规范与实践指南
深度学习·fpga开发·verilog·fpga·设计规范·硬件编程·嵌入式设计
大雷神13 小时前
HarmonyOS 横竖屏切换与响应式布局实战指南
python·深度学习·harmonyos
青瓷程序设计13 小时前
水果识别系统【最新版】Python+TensorFlow+Vue3+Django+人工智能+深度学习+卷积神经网络算法
人工智能·python·深度学习
AI模块工坊14 小时前
CVPR 即插即用 | 当RetNet遇见ViT:一场来自曼哈顿的注意力革命,中科院刷新SOTA性能榜!
人工智能·深度学习·计算机视觉·transformer
强化学习与机器人控制仿真15 小时前
Meta 最新开源 SAM 3 图像视频可提示分割模型
人工智能·深度学习·神经网络·opencv·目标检测·计算机视觉·目标跟踪
长不大的蜡笔小新15 小时前
从0到1学AlexNet:用经典网络搞定花分类任务
图像处理·深度学习·机器学习
WWZZ202516 小时前
快速上手大模型:深度学习5(实践:过、欠拟合)
人工智能·深度学习·神经网络·算法·机器人·大模型·具身智能