注意力机制

这张生成的图像能检测吗13 小时前
聚类·注意力机制·视频生成
(论文速读)AdaCluster:让视频 DiT 的稀疏注意力学会“区别对待”Q 和 K论文题目: AdaCluster: Adaptive Query-Key Clustering for Sparse Attention in Video Generation 中文翻译: AdaCluster:面向视频生成稀疏注意力的自适应 Query-Key 聚类 会议: CVPR 2026 源码: https://github.com/USTC-MLSys-Team/Adacluster
AI你一生一世2 天前
人工智能·大语言模型·注意力机制·rag·长上下文·上下文窗口·推理成本
Attention is all you have:当上下文成为唯一的护城河我是AI时代的无业游民,我游荡在现实与意念之间过去两年,主流大模型的上下文窗口从 8K 一路推到 1M 甚至 10M token。表面上看,这是"能塞更多文档"的工程红利;但在真实系统里,它带来的第一个问题不是性能,而是决策逻辑的崩塌。
金色印象13 天前
注意力机制·深度残差网络·复合故障诊断·类内离散抑制·深度渐进收缩学习·软阈值化
【论文解读】DPSL:把“类内离散”一层层收缩掉,让复合故障不再与单故障混淆本文解读的论文是 Mechanical compound fault diagnosis via suppressing intra-class dispersions: A deep progressive shrinkage perspective,发表在 Measurement 上。
金色印象15 天前
故障诊断·注意力机制·少样本学习·孪生网络·难样本挖掘·同心损失·dcsn
【论文解读】DCSN:面向船舶发动机少样本故障诊断的难样本挖掘船舶发动机的故障样本极其稀少,且不可避免地存在类间差异较小的难样本,给少样本条件下的故障诊断带来了很大挑战。针对这一问题,论文DCSN: Focusing on hard samples mining in small-sample fault diagnosis of marine engine提出了一种深度度量学习方法,名为深度同心孪生网络(Deep Concentric Siamese Network,简称 DCSN)。其核心想法是用一对同心边界把容易和难的样本对区分开来,让网络把主要的学习压力施加
海天一色y1 个月前
人工智能·注意力机制
注意力机制的进化:MHA → GQA → MLA → CSA → HCA本文梳理大语言模型(LLM)核心组件"注意力机制"的演进主线:前三个阶段(MHA → GQA → MLA)的核心问题是:如何让每个 token 的 KV 表示更窄、更省缓存——即沿着"宽度/特征维度"压缩。
猫先生Mr.Mao1 个月前
深度学习·大模型·transformer·注意力机制·论文解读
大模型之Attention Is All You Need详解:Transformer如何用注意力重写序列建模【从零走向AGI】旨在深入了解通用人工智能(AGI)的发展路径,从最基础的概念起,逐步构建完整的知识体系。 项目地址🔗:https://github.com/AI-mzq/From-Zero-to-AGI.git
a187927218311 个月前
深度学习·ai·transformer·token·注意力机制·deepseek·多层堆叠
从一条直线到大模型输出一个token(九):输出矩阵与多层堆叠建议先看:从一条直线到大模型输出一个token(八):残差连接与前馈网络上一篇走完了单个 Block 的六步。这一篇把 Block 复制 32 份串起来——不同层的 Block 各学什么,2024-2025 各家大模型到底堆了多少层,然后用 6 个 token 实地观察"浅→中→深"到底改了什么——这是理解"下一个 token 如何诞生"的关键一环。
Tbisnic1 个月前
算法·自然语言处理·大模型·bert·transformer·注意力机制
BGE-M3 算法详解:从模型架构到三种检索方式的数学原理2024年1月30日,智源研究院(BAAI)发布了BGE家族的新成员——BGE-M3。BGE-M3是首个集多语言(Multi-Linguality)、多粒度(Multi-Granularity)、多功能(Multi-Functionality)三大技术特征于一体的语义向量模型-。
承渊政道2 个月前
pytorch·回归·transformer·chatglm·注意力机制·解码器
【从零开始大模型开发与微调:基于PyTorch与ChatGLM】(从注意力到自回归生成:彻底理解Transformer解码器)本文从1开始.前面介绍了编码器的架构和实现代码.那么相信你对编码器的编写已经很熟悉了.解码器是在编码器的基础上对模型进行少量修正,在不改变整体架构的基础上进行模型设计,可以说,如果掌握了编码器的原理,那么学习解码器的概念、设计和原理一定易如反掌.本文首先介绍解码器的原理和程序编写,然后着重解决一个非常大的问题——文本对齐.这是自然语言处理中一个不可轻易逾越的障碍,本文将以翻译模型为例,系统地讲解文本对齐的方法,并实现一个基于汉字和拼音的"翻译系统".
thesky1234562 个月前
大模型·注意力机制·mha·gqa·mqa·kv cache·mla
27届大模型面试准备(三十六):注意力机制演进与 KV Cache 优化——从 MHA 到 MLA 的显存之战本篇是 A 系列第 36 篇(A12–A35 已覆盖 RAG、长上下文、VLM、高效推理、后训练、分布式训练、LoRA、量化、评测、MoE、推理时扩展、数据工程、位置编码、推理服务化、幻觉、蒸馏、安全、长文本推理、推理优化、多模态推理、RAG 进阶、解码策略、端侧部署、小模型蒸馏)。A29 讲了高效注意力(FlashAttention、稀疏、线性注意力),A30 讲了推理性能优化全栈。本文聚焦推理侧最贵的那块内存——KV Cache,从注意力机制的演进(MHA→MQA→GQA→MLA)一路讲到 KV Ca
chen_zn952 个月前
人工智能·深度学习·注意力机制·vla
《VLA 系列》π0.5 + KI | 知识隔离 | 离散与连续动作联合训练 | 论文与源码解析π0.5 已经能把多种机器人、任务和通用视觉语言数据放进同一个训练体系,但继续扩大数据并没有消除一个很现实的矛盾:自回归动作 token 训练得快,却要逐 token 解码;Flow Matching 动作专家推理快,却可能让一个随机初始化的机器人模块通过反向传播破坏预训练 VLM 的语言知识。Physical Intelligence 在 Knowledge Insulation(KI,知识隔离) 中给出的答案,不是冻结 VLM,而是把两种动作表示放到同一个模型里训练,并只隔离有害的梯度路径。
Lee_jerome2 个月前
nlp·transformer·encoder·注意力机制·decoder·交叉注意力·self-attention
python神经网络编程入门(三十五)——Transformer 整体架构——一张图看懂全貌📍 路标:本篇位于《从零构建 Transformer》系列 第 6/16 章 · 架构篇。 系列主线:注意力思想 → 自注意力 → 多头 → 位置编码 → 编解码架构 → 手撕实现 → 预训练模型 → 实战微调 → 知识收官。 进度:▸ 基石篇(1-5) ▸ 架构篇(6-10·本篇) ▸ 预训练篇(11-13) ▸ 实战篇(14-16)
Lee_jerome2 个月前
深度学习·nlp·transformer·注意力机制·多头注意力·self-attention
python神经网络编程入门(三十三)——多头注意力(Multi-Head Attention)📍 路标:本篇位于《从零构建 Transformer》系列 第 4/16 章 · 基石篇。 系列主线:注意力思想 → 自注意力 → 多头 → 位置编码 → 编解码架构 → 手撕实现 → 预训练模型 → 实战微调 → 知识收官。 进度:▸ 基石篇(1-5·本篇) ▸ 架构篇(6-10) ▸ 预训练篇(11-13) ▸ 实战篇(14-16)
Lee_jerome2 个月前
rnn·深度学习·nlp·transformer·attention·注意力机制·序列建模
python神经网络编程入门(三十)——Transformer 从 RNN 到注意力:模型为什么需要“瞄一眼“📍 路标:本篇位于《从零构建 Transformer》系列 第 1/16 章 · 基石篇。 系列主线:注意力思想 → 自注意力 → 多头 → 位置编码 → 编解码架构 → 手撕实现 → 预训练模型 → 实战微调 → 知识收官。 进度:▸ 基石篇(1-5·本篇) ▸ 架构篇(6-10) ▸ 预训练篇(11-13) ▸ 实战篇(14-16)
@Mr_LiuYang2 个月前
人工智能·大模型·agent·注意力机制
《深入理解 AI Agent:设计原理与工程实践 》实验2-2 2-7 大模型注意力权重分布可视化https://github.com/bojieli/ai-agent-book 本项目是《深入理解 AI Agent》第 2 章配套实验代码,主题是大语言模型注意力机制可视化。它围绕 Qwen3-0.6B 等真实模型,捕获生成过程中的 self-attention 权重,并通过 Matplotlib 热力图、JSON 轨迹文件和 Next.js 前端进行展示。
人间凡尔赛2 个月前
ai·大模型·注意力机制·moe·kimi
Kimi K3 技术拆解:2.8 万亿参数开源模型背后的 KDA 线性注意力与 Stable LatentMoE全球首个 3 万亿级开源模型,896 个专家只激活 16 个,KV Cache 砍掉 75%——月之暗面如何用架构创新把「算力」变成「智能」?
程序喵大人3 个月前
人工智能·深度学习·transformer·注意力机制
解密 Transformer 的核心——注意力机制博主介绍:程序喵大人如果你想真正搞懂 Transformer 是怎么工作的,那就必须越过一座大山:注意力机制(Attention)。可以说,理解了 Attention,就懂了 Transformer 的灵魂。
星马梦缘3 个月前
人工智能·机器学习·cnn·transformer·attention·注意力机制·mlp
机器学习与模式识别 第十六章 Transformers 考点压缩综合来源:Lecture 16 PDF(68页)、课堂笔记(CSDN)占位图需要一种能高效建模所有token之间关系的架构 → Attention机制
星马梦缘3 个月前
人工智能·机器学习·cnn·transformer·attention·注意力机制·mlp
机器学习与模式识别 第十六章 Transformers 模拟卷及答案总分:100分 | 建议用时:60分钟 范围:Attention机制、QKV、多头注意力、Transformer层、位置编码
叫我:松哥4 个月前
图像处理·人工智能·深度学习·yolo·flask·bootstrap·注意力机制
基于深度学习的辣椒叶片病害识别系统设计实现,融合CBAM注意力机制的改进ResNet-50模型和YOLO检测,准确率达96%近年来,国家高度重视农业智能化发展,持续加大对智慧农业的政策支持力度。2026年1月,由天津农学院与天水市农业科学研究所联合承担的中央引导地方科技发展资金项目——“融合人工智能与大数据的辣椒病虫害精准识别与智慧防控技术研究”正式启动。该项目旨在通过人工智能与大数据技术推动辣椒产业提质增效,为东西部科技协作提供示范,标志着人工智能技术在辣椒病虫害识别领域的应用已进入实质性推进阶段。与此同时,农业农村部在2026年种植业行业标准申报工作中,明确将“蔬菜作物的病虫害绿色防控”列为重点支持方向,强调通过标准化生产