注意力机制

猫先生Mr.Mao14 小时前
深度学习·大模型·transformer·注意力机制·论文解读
大模型之Attention Is All You Need详解:Transformer如何用注意力重写序列建模【从零走向AGI】旨在深入了解通用人工智能(AGI)的发展路径,从最基础的概念起,逐步构建完整的知识体系。 项目地址🔗:https://github.com/AI-mzq/From-Zero-to-AGI.git
a187927218318 天前
深度学习·ai·transformer·token·注意力机制·deepseek·多层堆叠
从一条直线到大模型输出一个token(九):输出矩阵与多层堆叠建议先看:从一条直线到大模型输出一个token(八):残差连接与前馈网络上一篇走完了单个 Block 的六步。这一篇把 Block 复制 32 份串起来——不同层的 Block 各学什么,2024-2025 各家大模型到底堆了多少层,然后用 6 个 token 实地观察"浅→中→深"到底改了什么——这是理解"下一个 token 如何诞生"的关键一环。
Tbisnic12 天前
算法·自然语言处理·大模型·bert·transformer·注意力机制
BGE-M3 算法详解:从模型架构到三种检索方式的数学原理2024年1月30日,智源研究院(BAAI)发布了BGE家族的新成员——BGE-M3。BGE-M3是首个集多语言(Multi-Linguality)、多粒度(Multi-Granularity)、多功能(Multi-Functionality)三大技术特征于一体的语义向量模型-。
承渊政道17 天前
pytorch·回归·transformer·chatglm·注意力机制·解码器
【从零开始大模型开发与微调:基于PyTorch与ChatGLM】(从注意力到自回归生成:彻底理解Transformer解码器)本文从1开始.前面介绍了编码器的架构和实现代码.那么相信你对编码器的编写已经很熟悉了.解码器是在编码器的基础上对模型进行少量修正,在不改变整体架构的基础上进行模型设计,可以说,如果掌握了编码器的原理,那么学习解码器的概念、设计和原理一定易如反掌.本文首先介绍解码器的原理和程序编写,然后着重解决一个非常大的问题——文本对齐.这是自然语言处理中一个不可轻易逾越的障碍,本文将以翻译模型为例,系统地讲解文本对齐的方法,并实现一个基于汉字和拼音的"翻译系统".
thesky12345618 天前
大模型·注意力机制·mha·gqa·mqa·kv cache·mla
27届大模型面试准备(三十六):注意力机制演进与 KV Cache 优化——从 MHA 到 MLA 的显存之战本篇是 A 系列第 36 篇(A12–A35 已覆盖 RAG、长上下文、VLM、高效推理、后训练、分布式训练、LoRA、量化、评测、MoE、推理时扩展、数据工程、位置编码、推理服务化、幻觉、蒸馏、安全、长文本推理、推理优化、多模态推理、RAG 进阶、解码策略、端侧部署、小模型蒸馏)。A29 讲了高效注意力(FlashAttention、稀疏、线性注意力),A30 讲了推理性能优化全栈。本文聚焦推理侧最贵的那块内存——KV Cache,从注意力机制的演进(MHA→MQA→GQA→MLA)一路讲到 KV Ca
chen_zn9519 天前
人工智能·深度学习·注意力机制·vla
《VLA 系列》π0.5 + KI | 知识隔离 | 离散与连续动作联合训练 | 论文与源码解析π0.5 已经能把多种机器人、任务和通用视觉语言数据放进同一个训练体系,但继续扩大数据并没有消除一个很现实的矛盾:自回归动作 token 训练得快,却要逐 token 解码;Flow Matching 动作专家推理快,却可能让一个随机初始化的机器人模块通过反向传播破坏预训练 VLM 的语言知识。Physical Intelligence 在 Knowledge Insulation(KI,知识隔离) 中给出的答案,不是冻结 VLM,而是把两种动作表示放到同一个模型里训练,并只隔离有害的梯度路径。
Lee_jerome21 天前
nlp·transformer·encoder·注意力机制·decoder·交叉注意力·self-attention
python神经网络编程入门(三十五)——Transformer 整体架构——一张图看懂全貌📍 路标:本篇位于《从零构建 Transformer》系列 第 6/16 章 · 架构篇。 系列主线:注意力思想 → 自注意力 → 多头 → 位置编码 → 编解码架构 → 手撕实现 → 预训练模型 → 实战微调 → 知识收官。 进度:▸ 基石篇(1-5) ▸ 架构篇(6-10·本篇) ▸ 预训练篇(11-13) ▸ 实战篇(14-16)
Lee_jerome22 天前
深度学习·nlp·transformer·注意力机制·多头注意力·self-attention
python神经网络编程入门(三十三)——多头注意力(Multi-Head Attention)📍 路标:本篇位于《从零构建 Transformer》系列 第 4/16 章 · 基石篇。 系列主线:注意力思想 → 自注意力 → 多头 → 位置编码 → 编解码架构 → 手撕实现 → 预训练模型 → 实战微调 → 知识收官。 进度:▸ 基石篇(1-5·本篇) ▸ 架构篇(6-10) ▸ 预训练篇(11-13) ▸ 实战篇(14-16)
Lee_jerome25 天前
rnn·深度学习·nlp·transformer·attention·注意力机制·序列建模
python神经网络编程入门(三十)——Transformer 从 RNN 到注意力:模型为什么需要“瞄一眼“📍 路标:本篇位于《从零构建 Transformer》系列 第 1/16 章 · 基石篇。 系列主线:注意力思想 → 自注意力 → 多头 → 位置编码 → 编解码架构 → 手撕实现 → 预训练模型 → 实战微调 → 知识收官。 进度:▸ 基石篇(1-5·本篇) ▸ 架构篇(6-10) ▸ 预训练篇(11-13) ▸ 实战篇(14-16)
@Mr_LiuYang25 天前
人工智能·大模型·agent·注意力机制
《深入理解 AI Agent:设计原理与工程实践 》实验2-2 2-7 大模型注意力权重分布可视化https://github.com/bojieli/ai-agent-book 本项目是《深入理解 AI Agent》第 2 章配套实验代码,主题是大语言模型注意力机制可视化。它围绕 Qwen3-0.6B 等真实模型,捕获生成过程中的 self-attention 权重,并通过 Matplotlib 热力图、JSON 轨迹文件和 Next.js 前端进行展示。
人间凡尔赛1 个月前
ai·大模型·注意力机制·moe·kimi
Kimi K3 技术拆解:2.8 万亿参数开源模型背后的 KDA 线性注意力与 Stable LatentMoE全球首个 3 万亿级开源模型,896 个专家只激活 16 个,KV Cache 砍掉 75%——月之暗面如何用架构创新把「算力」变成「智能」?
程序喵大人2 个月前
人工智能·深度学习·transformer·注意力机制
解密 Transformer 的核心——注意力机制博主介绍:程序喵大人如果你想真正搞懂 Transformer 是怎么工作的,那就必须越过一座大山:注意力机制(Attention)。可以说,理解了 Attention,就懂了 Transformer 的灵魂。
星马梦缘2 个月前
人工智能·机器学习·cnn·transformer·attention·注意力机制·mlp
机器学习与模式识别 第十六章 Transformers 考点压缩综合来源:Lecture 16 PDF(68页)、课堂笔记(CSDN)占位图需要一种能高效建模所有token之间关系的架构 → Attention机制
星马梦缘2 个月前
人工智能·机器学习·cnn·transformer·attention·注意力机制·mlp
机器学习与模式识别 第十六章 Transformers 模拟卷及答案总分:100分 | 建议用时:60分钟 范围:Attention机制、QKV、多头注意力、Transformer层、位置编码
叫我:松哥3 个月前
图像处理·人工智能·深度学习·yolo·flask·bootstrap·注意力机制
基于深度学习的辣椒叶片病害识别系统设计实现,融合CBAM注意力机制的改进ResNet-50模型和YOLO检测,准确率达96%近年来,国家高度重视农业智能化发展,持续加大对智慧农业的政策支持力度。2026年1月,由天津农学院与天水市农业科学研究所联合承担的中央引导地方科技发展资金项目——“融合人工智能与大数据的辣椒病虫害精准识别与智慧防控技术研究”正式启动。该项目旨在通过人工智能与大数据技术推动辣椒产业提质增效,为东西部科技协作提供示范,标志着人工智能技术在辣椒病虫害识别领域的应用已进入实质性推进阶段。与此同时,农业农村部在2026年种植业行业标准申报工作中,明确将“蔬菜作物的病虫害绿色防控”列为重点支持方向,强调通过标准化生产
王小王-1233 个月前
注意力机制·yolov8·车牌号识别·智能交通·lprnet·车牌检测识别系统
基于 YOLOv8 + SE Attention 与 LPRNet 的车牌检测识别系统目录一、项目效果先看:从图片到车牌号自动输出二、为什么选择“YOLOv8 + LPRNet”两阶段方案
【建模先锋】3 个月前
人工智能·深度学习·注意力机制·预测模型·gat·时间序列预测模型
独家原创!基于特征—时间双图注意力与BiGRU全局注意力并行融合的高创新预测模型单步预测-风速预测模型代码全家桶-CSDN博客半天入门!锂电池剩余寿命预测(Python)-CSDN博客
weixin_468466853 个月前
人工智能·python·深度学习·算法·自然语言处理·transformer·注意力机制
全局与局部注意力机制新手实战指南在处理长文本序列时,你是否遇到过模型“记不住”开头内容,或者对关键信息聚焦不准的情况?这往往是传统循环神经网络或基础注意力机制在长距离依赖建模上的局限所致。特别是在处理数千甚至上万 token 的文档、代码库或长篇对话时,如何让模型高效地捕捉全局语境,同时又不牺牲局部细节的精度,成为了许多开发者面临的实际痛点。
weixin_468466853 个月前
人工智能·python·算法·语言模型·自然语言处理·transformer·注意力机制
大语言模型原理新手入门指南很多开发者在初次接触大语言模型时,往往被其流畅的对话能力所震撼,却对背后的运行逻辑感到神秘莫测。我们习惯了传统软件中确定的输入输出规则,而面对一个能写代码、能创作、甚至能进行逻辑推理的“黑盒”,常常不知从何下手去理解或优化它。其实,剥开那些复杂的数学公式和庞大的参数量,大模型的核心工作原理并没有那么玄乎,它本质上是一个基于概率的文本预测机器,只是通过海量的数据训练和精妙的架构设计,将这种预测能力提升到了智能的高度。
weixin_468466853 个月前
人工智能·架构·transformer·ssm·注意力机制·mamba·状态空间方程
Mamba 架构新手入门与实战指南在深度学习领域,Transformer 架构凭借自注意力机制统治了自然语言处理多年,但随着序列长度的增加,其计算复杂度呈平方级增长,显存占用和推理延迟成为难以忽视的瓶颈。许多开发者在面对长文本任务时,常常陷入“算力不够”或“速度太慢”的困境,迫切寻找一种既能保持高性能又能线性扩展的新方案。Mamba 模型的出现恰好击中了这一痛点,它基于状态空间模型(SSM),实现了线性时间的推理速度和恒定的内存占用,为长序列建模打开了新的大门。