基于学习的人工智能(5)机器学习基本框架

四、数据

**数据是机器学习的"粮食",是知识的原始载体。**机器学习的目的就是将分散在数据中的知识提取来并保存在模型中。要训练一个优秀的机器学习模型,必须对数据进行精心选择。一般来说,数据需要具备以下几个条件:

质量:数据必须具备较高质量,特别是经过人工标注的数据,其标注准确率应足够高。

数量:数据量必须充足,否则难以训练出合理的模型。

场景覆盖度:数据应涵盖各种场景。例如,一个人脸识别数据库应包含不同光照、角度下的人脸图片,否则训练出来的模型可能难以实用。

近年来,随着大语言模型的发展,对数据的要求越来越高。例如,GPT-3.5 的训练使用了 45TB 的文本语料。如此庞大的数据量,如何清除劣质数据、平衡各数据源,以及如何让模型高效地学习,都是亟待解决的问题。此外,有科学家预测,人工智能可能会很快用尽人类的所有数据,如何应对"数据枯竭"也十分重要。

相关推荐
IvorySQL6 分钟前
PostgreSQL 日报|逻辑解码竞态条件修复(9 月 20 日)
数据库·人工智能·postgresql
M78佐菲6 分钟前
ARM学习笔记(五)
linux·arm开发·笔记·嵌入式硬件·学习
AI智能从业者9 分钟前
数码家电客服机器人怎么选?客户问参数问题机器人能不能接住
运维·人工智能·自动化
2601_9623804810 分钟前
考公讲义教案一键成片的制作流程与实现思路
人工智能
深度人工智能12 分钟前
个人AI与企业级AI:同一物种,两种进化路径
人工智能
Dr.Cup26 分钟前
英伟达SoL-Pi:让AI编码智能体自己优化自己的“脚手架“
人工智能·机器学习·ai智能体
正经教主27 分钟前
【FDE系列】阶段2:Day 31:SQL 基础 — 增删改查一把梭
人工智能·python·fde
镜象科技27 分钟前
AI心理师是什么?和真人心理咨询师有何不同?
人工智能
javaDocker27 分钟前
金融核心系统架构的“第四范式“革命
人工智能·研发效能·金融科技
威嵌神州34 分钟前
复旦微 FMQL100TAI 开发 8 问:仿真器、系统、接口高频问题解答
人工智能·嵌入式硬件·fpga开发