注意力机制

Lee_jerome1 天前
nlp·transformer·encoder·注意力机制·decoder·交叉注意力·self-attention
python神经网络编程入门(三十五)——Transformer 整体架构——一张图看懂全貌📍 路标:本篇位于《从零构建 Transformer》系列 第 6/16 章 · 架构篇。 系列主线:注意力思想 → 自注意力 → 多头 → 位置编码 → 编解码架构 → 手撕实现 → 预训练模型 → 实战微调 → 知识收官。 进度:▸ 基石篇(1-5) ▸ 架构篇(6-10·本篇) ▸ 预训练篇(11-13) ▸ 实战篇(14-16)
Lee_jerome2 天前
深度学习·nlp·transformer·注意力机制·多头注意力·self-attention
python神经网络编程入门(三十三)——多头注意力(Multi-Head Attention)📍 路标:本篇位于《从零构建 Transformer》系列 第 4/16 章 · 基石篇。 系列主线:注意力思想 → 自注意力 → 多头 → 位置编码 → 编解码架构 → 手撕实现 → 预训练模型 → 实战微调 → 知识收官。 进度:▸ 基石篇(1-5·本篇) ▸ 架构篇(6-10) ▸ 预训练篇(11-13) ▸ 实战篇(14-16)
Lee_jerome4 天前
rnn·深度学习·nlp·transformer·attention·注意力机制·序列建模
python神经网络编程入门(三十)——Transformer 从 RNN 到注意力:模型为什么需要“瞄一眼“📍 路标:本篇位于《从零构建 Transformer》系列 第 1/16 章 · 基石篇。 系列主线:注意力思想 → 自注意力 → 多头 → 位置编码 → 编解码架构 → 手撕实现 → 预训练模型 → 实战微调 → 知识收官。 进度:▸ 基石篇(1-5·本篇) ▸ 架构篇(6-10) ▸ 预训练篇(11-13) ▸ 实战篇(14-16)
@Mr_LiuYang5 天前
人工智能·大模型·agent·注意力机制
《深入理解 AI Agent:设计原理与工程实践 》实验2-2 2-7 大模型注意力权重分布可视化https://github.com/bojieli/ai-agent-book 本项目是《深入理解 AI Agent》第 2 章配套实验代码,主题是大语言模型注意力机制可视化。它围绕 Qwen3-0.6B 等真实模型,捕获生成过程中的 self-attention 权重,并通过 Matplotlib 热力图、JSON 轨迹文件和 Next.js 前端进行展示。
人间凡尔赛11 天前
ai·大模型·注意力机制·moe·kimi
Kimi K3 技术拆解:2.8 万亿参数开源模型背后的 KDA 线性注意力与 Stable LatentMoE全球首个 3 万亿级开源模型,896 个专家只激活 16 个,KV Cache 砍掉 75%——月之暗面如何用架构创新把「算力」变成「智能」?
程序喵大人1 个月前
人工智能·深度学习·transformer·注意力机制
解密 Transformer 的核心——注意力机制博主介绍:程序喵大人如果你想真正搞懂 Transformer 是怎么工作的,那就必须越过一座大山:注意力机制(Attention)。可以说,理解了 Attention,就懂了 Transformer 的灵魂。
星马梦缘1 个月前
人工智能·机器学习·cnn·transformer·attention·注意力机制·mlp
机器学习与模式识别 第十六章 Transformers 考点压缩综合来源:Lecture 16 PDF(68页)、课堂笔记(CSDN)占位图需要一种能高效建模所有token之间关系的架构 → Attention机制
星马梦缘1 个月前
人工智能·机器学习·cnn·transformer·attention·注意力机制·mlp
机器学习与模式识别 第十六章 Transformers 模拟卷及答案总分:100分 | 建议用时:60分钟 范围:Attention机制、QKV、多头注意力、Transformer层、位置编码
叫我:松哥2 个月前
图像处理·人工智能·深度学习·yolo·flask·bootstrap·注意力机制
基于深度学习的辣椒叶片病害识别系统设计实现,融合CBAM注意力机制的改进ResNet-50模型和YOLO检测,准确率达96%近年来,国家高度重视农业智能化发展,持续加大对智慧农业的政策支持力度。2026年1月,由天津农学院与天水市农业科学研究所联合承担的中央引导地方科技发展资金项目——“融合人工智能与大数据的辣椒病虫害精准识别与智慧防控技术研究”正式启动。该项目旨在通过人工智能与大数据技术推动辣椒产业提质增效,为东西部科技协作提供示范,标志着人工智能技术在辣椒病虫害识别领域的应用已进入实质性推进阶段。与此同时,农业农村部在2026年种植业行业标准申报工作中,明确将“蔬菜作物的病虫害绿色防控”列为重点支持方向,强调通过标准化生产
王小王-1232 个月前
注意力机制·yolov8·车牌号识别·智能交通·lprnet·车牌检测识别系统
基于 YOLOv8 + SE Attention 与 LPRNet 的车牌检测识别系统目录一、项目效果先看:从图片到车牌号自动输出二、为什么选择“YOLOv8 + LPRNet”两阶段方案
【建模先锋】2 个月前
人工智能·深度学习·注意力机制·预测模型·gat·时间序列预测模型
独家原创!基于特征—时间双图注意力与BiGRU全局注意力并行融合的高创新预测模型单步预测-风速预测模型代码全家桶-CSDN博客半天入门!锂电池剩余寿命预测(Python)-CSDN博客
weixin_468466852 个月前
人工智能·python·深度学习·算法·自然语言处理·transformer·注意力机制
全局与局部注意力机制新手实战指南在处理长文本序列时,你是否遇到过模型“记不住”开头内容,或者对关键信息聚焦不准的情况?这往往是传统循环神经网络或基础注意力机制在长距离依赖建模上的局限所致。特别是在处理数千甚至上万 token 的文档、代码库或长篇对话时,如何让模型高效地捕捉全局语境,同时又不牺牲局部细节的精度,成为了许多开发者面临的实际痛点。
weixin_468466853 个月前
人工智能·python·算法·语言模型·自然语言处理·transformer·注意力机制
大语言模型原理新手入门指南很多开发者在初次接触大语言模型时,往往被其流畅的对话能力所震撼,却对背后的运行逻辑感到神秘莫测。我们习惯了传统软件中确定的输入输出规则,而面对一个能写代码、能创作、甚至能进行逻辑推理的“黑盒”,常常不知从何下手去理解或优化它。其实,剥开那些复杂的数学公式和庞大的参数量,大模型的核心工作原理并没有那么玄乎,它本质上是一个基于概率的文本预测机器,只是通过海量的数据训练和精妙的架构设计,将这种预测能力提升到了智能的高度。
weixin_468466853 个月前
人工智能·架构·transformer·ssm·注意力机制·mamba·状态空间方程
Mamba 架构新手入门与实战指南在深度学习领域,Transformer 架构凭借自注意力机制统治了自然语言处理多年,但随着序列长度的增加,其计算复杂度呈平方级增长,显存占用和推理延迟成为难以忽视的瓶颈。许多开发者在面对长文本任务时,常常陷入“算力不够”或“速度太慢”的困境,迫切寻找一种既能保持高性能又能线性扩展的新方案。Mamba 模型的出现恰好击中了这一痛点,它基于状态空间模型(SSM),实现了线性时间的推理速度和恒定的内存占用,为长序列建模打开了新的大门。
weixin_468466853 个月前
人工智能·python·深度学习·机器学习·transformer·热力图·注意力机制
Transformer 模型新手入门与实战指南很多刚接触深度学习的开发者,往往被环境配置劝退。明明只是想跑通一个文本情感分析的 Demo,却在安装 CUDA、匹配 PyTorch 版本、解决依赖冲突上耗费了整整两天。这种“还没开始学算法,先成了运维专家”的挫败感,让不少人望而却步。其实,随着工具链的成熟,搭建深度学习环境的门槛已经大幅降低。只要理清思路,利用现成的生态工具,我们完全可以在半小时内从零构建起可用的开发环境,并直接上手核心任务。
这张生成的图像能检测吗3 个月前
人工智能·机器学习·注意力机制·长序列建模·视觉分类
(论文速读)TSSA:令牌统计自注意力机制论文题目:TOKEN STATISTICS TRANSFORMER: LINEAR-TIME ATTENTION VIA VARIATIONAL RATE REDUCTION(令牌统计数据转换器:通过降低变分率实现线性时间关注)
西西弗Sisyphus3 个月前
transformer·attention·注意力机制·注意力·decoder·self-attention
从零实现Transformer:第 9 部分 - 推理(Inference )文本转张量 → 编码器编码一次 → 解码器从 SOS 开始 → 循环逐词贪心生成 → 遇到 EOS 停止 → 张量转回文本
小何code3 个月前
深度学习·bert·transformer·注意力机制
人工智能【第23篇】Transformer模型详解:Attention Is All You Need作者的话:在前面的文章中,我们学习了Seq2Seq和注意力机制。2017年,Google的论文《Attention Is All You Need》彻底改变了NLP领域,提出了Transformer架构。Transformer完全基于注意力机制,摒弃了RNN的循环结构,实现了并行计算和更强的长距离依赖建模能力。本文将深入讲解Transformer的原理和实现,带你理解现代大语言模型的基础!
小何code3 个月前
人工智能·深度学习·自然语言处理·机器翻译·注意力机制·seq2seq
人工智能【第22篇】Seq2Seq模型与注意力机制:机器翻译的基石作者的话:在前面的文章中,我们学习了RNN、LSTM以及NLP的基础知识。现在让我们进入NLP的核心应用——机器翻译。Seq2Seq(Sequence to Sequence)模型是机器翻译的基石,而注意力机制(Attention)的出现更是将翻译质量提升到了新的高度。本文将详细讲解这两个核心技术,帮助你理解现代NLP的基础!
西西弗Sisyphus3 个月前
resnet·transformer·attention·注意力机制·注意力
从零实现Transformer:第 4 部分 - 残差连接、层归一化与前馈网络(Add & Norm, Feed-Forward)flyfish本部分的完整代码在文末主要用于和其他的图做参考 还有两个组件要实现 多头注意力机制(Multi-Head Attention)已经实现了还有Add & Norm和 Feed-forward networ,这里的norm是Layer normalization.