基于学习的人工智能(5)机器学习基本框架

四、数据

**数据是机器学习的"粮食",是知识的原始载体。**机器学习的目的就是将分散在数据中的知识提取来并保存在模型中。要训练一个优秀的机器学习模型,必须对数据进行精心选择。一般来说,数据需要具备以下几个条件:

质量:数据必须具备较高质量,特别是经过人工标注的数据,其标注准确率应足够高。

数量:数据量必须充足,否则难以训练出合理的模型。

场景覆盖度:数据应涵盖各种场景。例如,一个人脸识别数据库应包含不同光照、角度下的人脸图片,否则训练出来的模型可能难以实用。

近年来,随着大语言模型的发展,对数据的要求越来越高。例如,GPT-3.5 的训练使用了 45TB 的文本语料。如此庞大的数据量,如何清除劣质数据、平衡各数据源,以及如何让模型高效地学习,都是亟待解决的问题。此外,有科学家预测,人工智能可能会很快用尽人类的所有数据,如何应对"数据枯竭"也十分重要。

相关推荐
机器之心17 分钟前
Generalist之后,罗剑岚团队推出LWD,也要变革具身智能训练范式
人工智能·openai
IT_陈寒21 分钟前
Vite的public文件夹放静态资源?这坑我替你踩了
前端·人工智能·后端
传说故事22 分钟前
【论文阅读】Diffusion Forcing: Next-token Prediction Meets Full-Sequence Diffusion
论文阅读·人工智能·diffusion
xixixi7777726 分钟前
三重筑基:5G-A超级上行提速千兆,电联低频共享扫平盲点,800V HVDC算电协同破局
人工智能·5g·ai·大模型·算力·通信·信通院
jkyy201427 分钟前
AI运动数字化:以技术重塑场景,健康有益赋能全域运动健康管理
大数据·人工智能·健康医疗
金融小师妹34 分钟前
4月30日多因子共振节点:鲍威尔“收官效应”与权力结构重塑的预期重构
大数据·人工智能·重构·逻辑回归
2601_9499251839 分钟前
AI Agent如何重构跨境物流的决策?
大数据·人工智能·重构·ai agent·geo优化·物流科技
AI木马人1 小时前
1.人工智能实战:大模型推理接口响应慢?从模型加载到 FastAPI 部署的完整优化方案
人工智能·python·fastapi
Black蜡笔小新1 小时前
私有化本地化AI模型训推工作站DLTM训推一体工作站赋能多行业智能化落地
人工智能
qq_411262421 小时前
四博 AI 智能音箱 + ESPC3 Tasmota 计量通断器方案
人工智能·智能音箱