llaMa模型的创新

LLaMa介绍

LLaMa是基于transformer encoder的生成式模型。

目前有:LLAMA, LLAMA2, LLAMA3 三个大的版本

论文

LLAMA 2: Open Foundation and Fine-Tuned Chat Models: https://arxiv.org/pdf/2307.09288

LLAMA 3: The Llama 3 Herd of Models https://arxiv.org/pdf/2407.21783

模型:

主要创新

  • Pre-Normalization(Pre-Norm,层前归一化)

  • RMSNorm(Root Mean Square Layer Normalization,均方根层归一化):

  • 旋转位置编码(RoPE)

  • 稀疏注意力(Sparse Attention)

  • SwiGLU激活函数:

  • grouped-query attention (GQA)

  • 长上下文:

训练

LLAMA 7B训练18万+小时

相关推荐
橘子在努力2 小时前
【橘子大模型】关于PromptTemplate
python·ai·llama
Chaos_Wang_1 天前
NLP高频面试题(三十)——LLama系列模型介绍,包括LLama LLama2和LLama3
人工智能·自然语言处理·llama
艾鹤1 天前
ollama安装与使用
人工智能·llama
清易2 天前
windows大模型llamafactory微调
llama
漠北尘-Gavin3 天前
【Python3.12.9安装llama-cpp-python遇到编译报错问题解决】
python·llama
爱听歌的周童鞋3 天前
理解llama.cpp如何进行LLM推理
llm·llama·llama.cpp·inference
溯源0063 天前
vscode调试python(transformers库的llama为例)
vscode·python·llama
Flying`4 天前
LLaMA-Factory微调实操记录
llama
张飞飞飞飞飞4 天前
通过Llama-Factory对Deepseek-r1:1.5b进行微调
llama
喜欢吃豆5 天前
LLaMA-Factory使用实战
人工智能·大模型·json·llama