基于学习的人工智能(5)机器学习基本框架

四、数据

**数据是机器学习的"粮食",是知识的原始载体。**机器学习的目的就是将分散在数据中的知识提取来并保存在模型中。要训练一个优秀的机器学习模型,必须对数据进行精心选择。一般来说,数据需要具备以下几个条件:

质量:数据必须具备较高质量,特别是经过人工标注的数据,其标注准确率应足够高。

数量:数据量必须充足,否则难以训练出合理的模型。

场景覆盖度:数据应涵盖各种场景。例如,一个人脸识别数据库应包含不同光照、角度下的人脸图片,否则训练出来的模型可能难以实用。

近年来,随着大语言模型的发展,对数据的要求越来越高。例如,GPT-3.5 的训练使用了 45TB 的文本语料。如此庞大的数据量,如何清除劣质数据、平衡各数据源,以及如何让模型高效地学习,都是亟待解决的问题。此外,有科学家预测,人工智能可能会很快用尽人类的所有数据,如何应对"数据枯竭"也十分重要。

相关推荐
能源革命7 分钟前
AI 日报(2026-10-09)
人工智能
Xudde.11 分钟前
CVE-2017-9993漏洞复现
笔记·学习·安全·web安全
霍格沃兹测试学院-小舟畅学16 分钟前
AI 智能化测试:从测试用例生成到自动执行的工程实践
人工智能·测试用例
feasibility.20 分钟前
1.6 亿参数跑出 42 FPS:IMTalker 在实时数字人赛道卡住了什么位置(含实测)
人工智能·aigc·数字人·文生视频·语音克隆·图生视频·imtalker
jeffsonfu20 分钟前
迁移学习与微调(Fine-tuning):站在巨人肩膀上的训练
人工智能
牧羊人.33325 分钟前
动手学深度学习 07|Resnet网络与迁移学习
网络·人工智能·深度学习·神经网络·算法·cnn·迁移学习
程序员zgh27 分钟前
C++ erase() 函数用法
c语言·开发语言·c++·学习
北方的银狐-Zero29 分钟前
OntoL 官网上线|数据打通 ≠ 业务打通,为大模型装上「认知底座」
人工智能·本体论
mlidongfeng30 分钟前
【学习】 NVIDIA CFT(Compute Fabric Transport)特性分析
人工智能·学习·fabric
袖清暮雨41 分钟前
机器学习之K-means聚类
机器学习·kmeans·聚类