scaling laws for neural language models

关于scaling law 的正确认识 - 知乎最近scaling law 成了最大的热词。一般的理解就是,想干大模型,清洗干净数据,然后把数据tokens量堆上来,然后搭建一个海量H100的集群,干就完了。训练模型不需要啥技巧,模型结构也没啥好设计的,对算法精度影响...https://zhuanlan.zhihu.com/p/684955373对于基于transformer的语言模型,假设模型的参数量为N,数据集tokens个数为D(token数),那么模型的计算量C约为6ND,模型的计算量C一定后,模型的性能即精度就基本确定。语言模型的影响因素只有N和D,跟模型的具体结构诸如层数,深度,attention头个数基本无关,相关性非常小,性能在2%的区间内。

scaling laws的前提是标准的transformer结构。

相关推荐
飞猫的边缘AI6 分钟前
边缘AI-5: 了解最灵活的计算芯片FPGA
人工智能·fpga开发·ai芯片·边缘ai·计算芯片·边缘ai芯片·titanium edge
auto_go10 分钟前
大模型实战指南(4)——Embedding 与向量检索:让模型“记住”百万篇文章的秘密
人工智能·embedding
程序猿编码11 分钟前
扔掉特征工程!我用三个LSTM“栈“写了一个依存句法分析器,句子结构一眼看穿
人工智能·深度学习·lstm·transformer·大模型推理
水如烟13 分钟前
孤能子视角:华夏“科学“回望·篇外之说明书与呼吸节律——六步框架在中西理论创建史中的两种显影
人工智能
晴天1617 分钟前
LLM 与世界模型:从“会说话“到“会理解世界“-Day27
人工智能·机器学习
练习时长两年半的RL练习生17 分钟前
与AI对话后对 Actor-Critic 中 TD Target 的 a‘ 来源总结
开发语言·人工智能·php
liulilittle39 分钟前
长上下文的成本结构与「甜点区间」——从推理引擎的物理约束看 200K/256K/400K
c++·人工智能·ai·llm·注意力·qkv
AIsoft_868840 分钟前
可以把会议内容整理成摘要的APP推荐:AI总结功能实测
人工智能
Eloudy43 分钟前
全文 - OpenROAD README.md
人工智能·ic agent·ai eda agent