LLama系列模型简要概述

LLama-1(7B, 13B, 33B, 65B参数量;1.4T tokens训练数据量)

要做真正Open的AI

Efficient:同等预算下,增大训练数据,比增大模型参数量,效果要更好

训练数据:

书、Wiki这种量少、质量高的数据,训了2轮。

模型改动:

silu激活函数:

LLama-2 (7B, 13B, 70B参数量;2T tokens预训练数据量)

训练流程:

PreTrain + SFT微调 + RLHF强化学习;

安全Reward model, 有用Reward model;

效果:观察到,数据量继续增大的话,还可继续提升效果;

引入了GQA(Group Query Attention):

通过把K和V复制多份来实现的

只在70B模型上,用的GQA:

总共64个head,8个一组,一共有8个Query head和8个Value head。

LLama-3(8B,70B,即将放出的400B,15T tokens预训练数据量)

放出的400B测评,有些指标超过了GPT4;

Word embedding量从3.2万,扩大了4倍,到12.8万。好处:推理效率增加,原来1个中文字词被编码至多个tokens,现在只编码到1个token,减少了推理input和output的token数量。

训练数据:

有研究表明,Code训练数据,对大模型的推理能力提升,有重要作用。因此这里加大了Code的训练数据量。

用LLama2来做预训练数据的质量过滤器。

训练:

用小模型的表现,预测大模型的表现,OpenAI先掌握的,Meta后掌握。

2个24000张H100 GPU卡的集群。

LLama3-Instruct: SFT, Rejection Sampling, DPO, PPO

相关推荐
大地爱17 小时前
LLaMA Factory+ModelScope实战——使用 Web UI 进行监督微调
前端·ui·llama
hunteritself18 小时前
AI Weekly『12月2-8日』:OpenAI发布发布满血版o1,Meta发布Llama 3.3模型!
人工智能·gpt·算法·chatgpt·openai·llama
DREAM依旧1 天前
Llama-3.1-405B-Instruct 开源体验|对比|亮点|使用|总结
人工智能·llama
AI程序猿人1 天前
微调 Llama 3.2:让 AI 更好地读取医学图像
人工智能·深度学习·ai·自然语言处理·大模型·llama·llama3.2
go2coding1 天前
Meta发布Llama 3.3 AI大模型
人工智能·llama
少喝冰美式1 天前
微调一个自己的大模型(腾讯云cloud studio + llama factory)
人工智能·深度学习·机器学习·llm·云计算·腾讯云·llama
木亦汐丫1 天前
【大模型系列篇】LLaMA-Factory大模型微调实践 - 从零开始
lora·大模型·微调·chatglm·llama·llama-factory
CV遥感视觉笔记3 天前
笔记04--零基础创建个人本地大模型知识库ollama+Dify
人工智能·笔记·深度学习·语言模型·llama
Nue.js4 天前
ollama的本地部署内含推荐模型!
docker·ai·llama