【AI学习】LLaMA模型的微调成本有几何?

在前面文章《LLaMA 系列模型的进化(二)》中提到了Stanford Alpaca模型。

Stanford Alpaca 基于LLaMA (7B) 进行微调,通过使用 Self-Instruct 方法借助大语言模型进行自动化的指令生成,Stanford Alpaca 生成了 52K 条指令遵循样例数据(Alpaca-52K)用于训练。

据说,这个训练成本不到600美元。那这个成本是如何计算的呢?
训练成本 :在8个80GB A100 上训练了3个小时,不到100美元;
数据成本 :生成数据使用OpenAl的API,500美元。这里就是通过使用 Self-Instruct 方法,使用了OpenAl的接口的调用成本。

在前面文章《英伟达ChipNeMo,一个领域大模型的训练案例》里,介绍了领域大模型的训练过程。如下图:

对应的训练时长为:

使用 128 个 A100 GPU 进行了训练。ChipNeMo 的领域适配预训练成本(包括基于领域数据的继续预训练和SFT),具体见下表,单位是A100 GPU hours

ChipNeMo 的领域适配预训练成本,对比从头开始预训练基础模型的总成本不到 1.5%。

以LLaMa 7B模型的训练来说,总训练时长=2710,按照前面"在8个80GB A100 上训练了3个小时,不到100美元"的成本折算,成本应该小于11300美金

13B模型,总训练时长=5100,成本应该小于21250美金

70B模型,总训练时长=21340,成本应该小于88920美金

至于数据,ChipNeMo 的领域适配预训练需要24B以上的数据,这个可能与相应的数据积累有很大关系,不好计算了。

相关推荐
Akir.weiwen几秒前
⑤ 消费格式差异:同一份契约的四角色消费格式
人工智能·编译·设计规范·语义
广凌股份(广凌科技)1 分钟前
实验室安全检查包括哪些内容?智能管理平台筑牢校园实验安全防线
大数据·人工智能
差不多的周周3 分钟前
《MotionLLM:从人体运动和视频理解人类行为》论文核心部分详解
人工智能·深度学习·机器学习·计算机视觉·语言模型·音视频
麻雀飞吧11 分钟前
搜索“近期量化入门”时,先补交易理解再看 Python 和 API
人工智能·python
Leinwin15 分钟前
GPT-Image-2.5 API 上手:Flare 与 Sunburst 怎么选,成本怎么算
人工智能·gpt
2601_9623878217 分钟前
实测恐象 AI:号称一句话生成全栈应用,实际能力到底几斤几两
自然语言处理·源码下载·恐象ai·全栈生成·轻量级开发
星核0penstarry17 分钟前
B站AI大赛3万份投稿背后的真相:门槛下移后,新的壁垒是什么?
人工智能·个人开发·ai编程·自动写代码
新新学长搞科研31 分钟前
【EI检索丨院士主讲】2026年人工智能、大数据与社会计算国际学术会议(ABDSC 2026)
人工智能
广州山泉婚姻35 分钟前
C/C++动态内存:堆内存的申请、使用与释放
c++·人工智能
纪伊路上盛名在40 分钟前
Omni-Mol:用多模态大语言模型构建通用多任务分子模型
人工智能·语言模型·自然语言处理·蛋白质·通用模型·生物大分子·混合专家moe