NLP/大模型八股专栏结构解析

1.transformer 结构相关

(1)transformer的基本结构有哪些,分别的作用是什么,代码实现。
NLP高频面试题(一)------Transformer的基本结构、作用和代码实现

(2)LSTM、GRU和Transformer结构的区别与联系,优缺点分别是什么?
NLP高频面试题(二)------LSTM、GRU和Transformer结构的区别与联系,优缺点分别是什么?
NLP高频面试题(三)------普通RNN的梯度消失和梯度爆炸问题

(3)为什么要多头注意力机制?

(4)为什么要有QKV三个不同的向量,目前对这块有哪些优化?

(5)self-attention和cross-attention的区别与联系

(6)BN和LN的区别与联系,为什么attention要用LN

NLP高频面试题(四)------BN和LN的区别与联系,为什么attention要用LN

NLP高频面试题(三十四)------深度解析Layer Normalization与Batch Normalization:区别、联系及Transformer为何偏爱LN

2. bert及其变体相关

(1)BERT的基本结构介绍、预训练任务、下游任务
NLP高频面试题(五)------BERT的基本结构介绍、预训练任务、下游任务

(2)BERT和传统的文本表示模型的区别与联系

(3)Bert和transformer论文中有哪些不一样的地方

(4)GPT的基本结构介绍

(5)decoder-only、encoder-only和encoder-decoder的区别与联系
NLP高频面试题(六)------decoder-only、encoder-only和encoder-decoder的区别与联系

(6)GPT和Bert的mask有什么区别?
NLP高频面试题(七)------GPT和Bert的mask有什么区别?

(7)GPT1,2,3分别有哪些改进

NLP高频面试题(八)------GPT三个版本的区别

(8)

3. NLP任务相关

4. 大模型相关

(1)目前常见的几种大模型架构是啥样的
NLP高频面试题(十)------目前常见的几种大模型架构是啥样的

(2)RLHF的流程有哪些
NLP高频面试题(十一)------RLHF的流程有哪些

(3)Lora微调的原理、什么是Qlora
NLP高频面试题(十二)------Lora微调的原理、什么是Qlora

(4)什么是大模型幻觉,如何解决大模型幻觉
NLP高频面试题(十三)------什么是大模型幻觉,如何解决大模型幻觉

(5)DPO、PPO等强化学习训练方法介绍
NLP高频面试题(十四)------DPO、PPO等强化学习训练方法介绍

(6)大模型解码常见参数解析
NLP高频面试题(九)------大模型常见的几种解码方案

NLP高频面试题(二十九)------大模型解码常见参数解析

(7)RAG相关内容简介
NLP高频面试题(二十四)------RAG相关内容简介

(8)RAG的reranker模块结果,原理和目前存在的挑战
NLP高频面试题(二十五)------RAG的reranker模块结果,原理和目前存在的挑战

(9)RAG的retriever模块作用,原理和目前存在的挑战
NLP高频面试题(二十六)------RAG的retriever模块作用,原理和目前存在的挑战

(10)SFT有哪几种参数微调方法?有什么优缺点?
NLP高频面试题(二十七)------SFT有哪几种参数微调方法?有什么优缺点?

(11)Reward model是如何训练的,怎么训练一个比较好的Reward model
NLP高频面试题(二十八)------Reward model是如何训练的,怎么训练一个比较好的Reward model

(12)LLama系列模型介绍,包括LLama LLama2和LLama3
NLP高频面试题(三十)------LLama系列模型介绍,包括LLama LLama2和LLama3
NLP高频面试题(三十五)------LLaMA / ChatGLM / BLOOM的区别

(13)多模态预训练模型的主要结构、特征对齐与融合方法及对比损失函数详解
NLP高频面试题(三十一)------多模态预训练模型的主要结构、特征对齐与融合方法及对比损失函数详解

(14)介绍一下CLIP和CLIP2
NLP高频面试题(三十二)------介绍一下CLIP和CLIP2

(15)Vision Transformer(ViT)模型架构介绍
NLP高频面试题(三十三)------Vision Transformer(ViT)模型架构介绍

(16)深入理解思维链(Chain-of-Thought)提示方法
NLP高频面试题(三十六)------深入理解思维链(Chain-of-Thought)提示方法

5. AI Infra相关

(1)有哪几种分布式训练方式
NLP高频面试题(十五)------有哪几种分布式训练方式

(2)deepspeed原理
NLP高频面试题(十六)------deepspeed原理

(3)什么是KV Cache
NLP高频面试题(十七)------什么是KV Cache

(4)什么是prefill和decoder分离架构
NLP高频面试题(十八)------什么是prefill和decoder分离架构

(5)VLLM推理加速原理
NLP高频面试题(十九)------VLLM推理加速原理

(6)flash attention原理
NLP高频面试题(二十)------flash attention原理

6. DeepSeek相关

(1)deepseek V1-V3 分别有哪些改进,这些改进是如何对模型产生影响的
NLP高频面试题(二十一)------deepseek V1-V3 分别有哪些改进,这些改进是如何对模型产生影响的

(2)deepseek论文中的的GRPO训练原理、和PPO相比有哪些改变,这些改进有什么作用
NLP高频面试题(二十二)------deepseek论文中的的GRPO训练原理、和PPO相比有哪些改变,这些改进有什么作用

7. 其他

(1)对抗训练的发展脉络,原理,演化路径
NLP高频面试题(二十三)对抗训练的发展脉络,原理,演化路径

相关推荐
lilye66几秒前
精益数据分析(26/126):依据商业模式确定关键指标
大数据·人工智能·数据分析
Panesle1 分钟前
月之暗面开源-音频理解、生成和对话生成模型:Kimi-Audio-7B-Instruct
人工智能·音视频·语音生成
视觉语言导航9 分钟前
复杂地形越野机器人导航新突破!VERTIFORMER:数据高效多任务Transformer助力越野机器人移动导航
人工智能·深度学习·机器人·transformer·具身智能
kebijuelun10 分钟前
OpenVLA:大语言模型用于机器人操控的经典开源作品
人工智能·语言模型·机器人
掘金安东尼18 分钟前
大模型+Python脚本,打造属于你的“批量生成文档”应用!
人工智能
vocal20 分钟前
谷歌第七版Prompt Engineering—第二部分
人工智能·后端
Blossom.11828 分钟前
量子计算在密码学中的应用与挑战:重塑信息安全的未来
人工智能·深度学习·物联网·算法·密码学·量子计算·量子安全
子燕若水29 分钟前
How do I install OpenCV with gpu support
人工智能·opencv·计算机视觉
明明跟你说过39 分钟前
深度学习常见框架:TensorFlow 与 PyTorch 简介与对比
人工智能·pytorch·python·深度学习·自然语言处理·tensorflow
搏博41 分钟前
专家系统的基本概念解析——基于《人工智能原理与方法》的深度拓展
人工智能·python·深度学习·算法·机器学习·概率论