scaling laws for neural language models

关于scaling law 的正确认识 - 知乎最近scaling law 成了最大的热词。一般的理解就是,想干大模型,清洗干净数据,然后把数据tokens量堆上来,然后搭建一个海量H100的集群,干就完了。训练模型不需要啥技巧,模型结构也没啥好设计的,对算法精度影响...https://zhuanlan.zhihu.com/p/684955373对于基于transformer的语言模型,假设模型的参数量为N,数据集tokens个数为D(token数),那么模型的计算量C约为6ND,模型的计算量C一定后,模型的性能即精度就基本确定。语言模型的影响因素只有N和D,跟模型的具体结构诸如层数,深度,attention头个数基本无关,相关性非常小,性能在2%的区间内。

scaling laws的前提是标准的transformer结构。

相关推荐
武子康9 小时前
转写完全正确,语音 Agent 为什么还是做错了决定
人工智能·llm·agent
天空之城--9 小时前
Superpowers 流程控制完全指南:从自动触发到精准决策
人工智能
王大虎9 小时前
一语成美图的 SKILL
人工智能·github·设计
Rocktech_ruixun9 小时前
机器人视觉SLAM对主控硬件有哪些要求?瑞迅科技RK3588/3576/3568分级方案解析
人工智能·嵌入式硬件·机器人
ltqvibe9 小时前
数据很脏,能不能上AI问数
大数据·人工智能·数据治理·智能问数·ai问数·本体语义·数据口径
喜欢睡觉9 小时前
大模型的记忆
人工智能
刘孬孬沉迷学习9 小时前
AI音频领域完整调研:任务、算法、大模型研究全梳理
人工智能·算法·音视频
玫瑰互动GEO9 小时前
工程视角看GEO优化与SEO优化:爬虫排序 vs 大模型引用
人工智能·爬虫·搜索引擎
掘金安东尼9 小时前
WorkBuddy 开放平台详解:五大核心能力、API 接入与竞品定位
人工智能