大模型学习笔记 - LLM 之 LLaMA系列(待更新)

LLaMA 概述

LLaMA: Open and Efficient Foundation Language Models

Llama 2: Open Foundation and Fine-Tuned Chat Models (LLama2 & LLama2-Chat)

LLama 3 | LLama 3.1

LLaMA-1

涉及到的基础知识点:

  1. pre-normalization. RSMNorm。
  2. SwiGLU activation function PaLM.
  3. Rotary Embeddings GPTNeo.Rotary positional embeddings (RoPE),
  4. FlashAttention

LLaMA-2

涉及到的基础知识点:

  1. groupAttention
  2. RLHF(PPO,拒绝采样)

LLama2:

我们还将预训练语料库的大小增加了 40%,增加了模型的上下文长度,并采用分组查询注意力(Ainslie et al., 2023)。我们正在发布具有 7B、13B 和 70B 参数的 Llama 2 变体。

LLama2Chat:

Llama 2-Chat 的训练:这个过程始于使用公开可用的在线源对 Llama 2 进行预训练。接下来,我们通过应用监督微调来创建 Llama 2-Chat 的初始版本。随后,使用带有人类反馈 (RLHF) 方法的强化学习迭代地改进模型,特别是通过拒绝采样近端策略优化 (PPO)。在 RLHF 阶段,迭代奖励建模数据与模型增强并行的累积对于确保奖励模型保持在分布内至关重要。

LLaMA-3

相关推荐
咸鱼翻身小阿橙1 天前
现在这个四通道出现的问题
学习
wgego1 天前
基础的反序列化一些总结(php和java)
java·开发语言·笔记
云贝教育-郑老师1 天前
OceanBase 是如何搞定海量数据分片(Sharding)的?
学习·oceanbase·dba
编程圈子1 天前
电机驱动开发学习23. 保护体系与故障状态机
驱动开发·学习
别动我齐刘海1 天前
Day6 unitree_G1人形机器人GMR—— MotionInput
c语言·c++·人工智能·学习·机器学习·机器人·github
leoZ2311 天前
实战复盘:用 Claude Code 从零搭一个 GitHub PR 统计工具
java·人工智能·python·深度学习·自然语言处理·github·llama
神秘的MT1 天前
C# WinForm Socket 服务器 + 串口转发
服务器·网络·学习·c#
依然范特东1 天前
强化学习笔记6--IS、PPO、TD、DQN、Actor-Critic
笔记·算法
zzzll11111 天前
0基础入门大模型:一份清晰的学习路线图
人工智能·学习·chatgpt
正经人_x1 天前
学习日记48:DenseCLIP
学习