transformer知识补足

今天DeepSeek-V4预览版上线了,同时官方还给出了其技术报告。看了几页发现知识真的是学而不思就很容易忘记,故在此结合技术报告温习、学习一些transformer以及LLM的概念。

  • KV Cache:在Transformer 逐 token 生成回答时,每次只产生一个新 token,但为了计算这个新 token 与历史所有 token 的关系,需要存储之前每个 token 的 Key 和 Value,类似于键值对

  • Token交互:在 Transformer 的注意力机制中,每个token之间的"交流"是通过计算相关性分数完成的,随后会两两计算并给出一个加权融合的信息,正是这种交流方式导致了O(n²)

  • 局部视野 / 近邻盲区:在注意力变体中,由于进行了压缩的操作,很多token之间本来紧密挨着的部分因为融合消失了,此时就引入滑动窗口,令其关注未被压缩的相邻token,从而使其不至于忽略掉局部信息

  • 全词表 logit 蒸馏:让学生模型去学习专家模型各个领域的能力,本质上是把这些模型关于词表的预测概率分布给学生模型学习,令其在这些词上输出的概率分布尽可能地靠近每个专家领域

  • KL散度:把上文中提到的专家模型的概率分布比喻成一张图,学生模型的分布比喻成另一张图,KL 散度就是计算这两张图的"形状有多不一样"。数值越小,说明学生模仿得越好。而反向 KL 散度则会特别惩罚学生"低估"了老师分布里本来就很高的区域,从而避免"只学一半",在后训练中,DeepSeek‑V4 用最小化学生与老师之间的反向 KL 散度来更新学生模型,强迫学生认真模仿老师的全部输出概率。

  • 双随机矩阵:满足两个条件的矩阵:所有元素都是非负数以及每一行的和 = 1,每一列的和 = 1。这样的结构保证了不过中间过程怎么样,分布怎么样,输出输入依然保持一致。

相关推荐
吴佳浩4 小时前
今天我们讲讲大模型的“核心”技术:蒸馏(Model Distillation)
人工智能·llm·agent
阿里云大数据AI技术4 小时前
阿里云 ES AI 引擎版:面向 Agent 场景,为亿级租户、千亿规模向量设计的搜索引擎
人工智能·elasticsearch·agent
星栈5 小时前
翻完 Pi 源码:它和 Codex、Claude Code 有何不同
人工智能·agent
码哥字节5 小时前
Google 上周推了个 agents-cli,我装完发现 Claude Code 多了 7 个超能力
google·agent·claude
奋飛7 小时前
AI应用工程:Agent 的能力是如何扩展的?——Tool、Skill、Workflow 与 MCP 的职责边界
agent·workflow·mcp·skills·ai应用工程
小阿鑫8 小时前
一个 AI 应用开发程序员的一天,都在屏幕前忙些什么?
ai·程序员·agent·rd270q·明基rd270q
武子康8 小时前
Token 单价更低,Agent 任务为什么反而更贵:4 层成本口径 + 最小事件账本 + 3 个决策问题
人工智能·agent·ai编程
武子康9 小时前
Shippy 全拆:3 个集合收缩(动作 / 状态 / 后果)+ 4 类边界(版本化行为 / Typed API / CLI / Sandbox)
人工智能·agent·aiops
辞忧九千七9 小时前
MCP 协议完全指南:从原理到 LangGraph 集成,打造即插即用的 AI Agent 工具生态
agent·langgraph·mcp
HIT_Weston11 小时前
153、【Agent】【OpenCode】启动分析(completion)
人工智能·agent·opencode