transformer

zcg194240 分钟前
transformer
注意力机制之——Window AttentionWindow Attention简单理解:crop再计算注意力但窗口注意力不是把图片真的裁成多张图再分别送网络,而是在特征图上按固定窗口分组,只在每个窗口内部计算 self-attention。
lkforce1 小时前
人工智能·深度学习·ai·transformer
Transformer架构下的详细计算流程模拟,精确到数字(单层单头)本文用一套模拟数字,通过详细的数字计算,看看Transformer架构下大模型是如何使用自注意力,不断计算出下一个token的。
爱吃程序猿的喵1 天前
人工智能·python·深度学习·计算机视觉·3d·transformer
LingBot-Map 复现与原理剖析:基于 Geometric Context Transformer 的流式 3D 重建项目地址:github.com/robbyant/lingbot-map论文:Geometric Context Transformer for Streaming 3D Reconstruction
tyler_download5 天前
深度学习·算法·transformer
揉扁搓圆transformer架构:反向传播算法详解深度学习一大特色就是能够根据给定数据和自己的预判结果进行自我调整,然后让自己的预判结果跟实际数据越来越接近。前面我们研究的损失函数用于判断模型的输出结果与实际结果的“接近层度”,反向传播算法就是调整 模型内部参数,然后让模型的输出在损失函数的评判下,使得输出结果与实际数据的“接近层度”越来越大,也就是让损失函数的数值越来越小。
weixin_468466855 天前
人工智能·深度学习·transformer·computer vision·vit·卷积·swin
从Transformer到ViT与Swin详解2017年,Attention Is All You Need一文提出了Transformer架构,彻底改变了自然语言处理领域。2020年,Vision Transformer(ViT)将纯Transformer结构直接应用于图像分类,展示了Transformer在视觉任务中的巨大潜力。2021年,Swin Transformer引入了层级化设计和窗口注意力机制,使Transformer在多种视觉任务上全面超越CNN。
Together_CZ7 天前
人工智能·transformer·通用关键点检测·gkdt·keypoint·detection
GKDT: General Keypoint Detection Transformer——通用关键点检测 Transformer关键点检测是计算机视觉的基础任务,用于定位图像中物体的语义关键点(如人体关节点、动物眼睛、家具角点等)。
Yunzenn7 天前
人工智能·笔记·深度学习·机器学习·transformer·集成学习·vllm
强化学习1-Liu2026_GFlowRL_精读笔记一句话:微软研究院把GFlowNet中那个"学不会又爱捣乱"的配分函数网络直接砍掉,用批次内蒙特卡洛估计替代,让分布匹配RL首次在235B MoE上稳定训练,顺便在14B规模就追平了o3-mini的做题水平。
LDZKKJ8 天前
语言模型·chatgpt·transformer
国产开源 MoE 三强横评:Qwen3 235B / Kimi K2 / DeepSeek V3.1 深度技术解读点点词元技术专栏 · 第 36 篇2025 年是国产开源 MoE 的"分野年"。Qwen3-235B-A22B、Kimi K2、DeepSeek V3.1 三款旗舰在半年内先后落地,把国产开源阵营从"跟着 Llama 抄"抬到了"自己定义架构"的位置。但更值得玩味的是——三家在同一个 MoE 大方向下,选了三条完全不同的技术路线。
汤姆小白9 天前
人工智能·python·机器学习·numpy·transformer
08-应用部署MiniMind 提供了 OpenAI 兼容的 API 服务,可以直接替换 OpenAI API 使用:
一只空白格9 天前
人工智能·深度学习·transformer
Transformer架构面试题目答:Transformer 相比 RNN/CNN 的核心优势是 self-attention。RNN 需要按时间递归传递信息,长距离依赖路径长且难以并行; CNN 依赖局部卷积,建立全局 attention 关系需要堆叠很多层。 而 Transformer 中任意两个 token 可以通过 attention 直接交互,因此更擅长长距离依赖,并且训练时可以并行计算整段序列。更重要的是,Transformer 提供了统一的 token 接口,文本、图像 patch、机器人 state 等多样化信息都可以放在
汤姆小白9 天前
人工智能·python·机器学习·transformer
06-LoRA参数高效微调关键假设:预训练模型在适配下游任务时,权重的变化量(ΔW)是低秩的。即:虽然模型参数矩阵 W 很大,但在微调过程中的变化量 ΔW 可以用两个小矩阵的乘积近似:
小程故事多_8011 天前
人工智能·重构·transformer
挣脱长文本算力枷锁,MLA多头隐式注意力如何重构大模型推理底层逻辑做过大模型落地开发的人,几乎都踩过长文本推理的深坑。前两年我们团队在做企业知识库问答项目时,就遇到过一个非常现实的难题,客户需要一次性上传十万字的行业白皮书,让模型通读全文后精准定位分散在不同章节的专业数据。当时我们采用行业通用的标准多头注意力MHA架构,硬件是80G显存的A100显卡,可仅仅加载32K长度的文本,KV缓存就会吃掉近九成显存,别说拓展到128K超长上下文,就连多用户并发推理都完全做不到。
咕泡科技11 天前
人工智能·深度学习·transformer
Transformer 模型为何如此深刻地改变深度学习?我来尝试回答一下这个提问:Transformer 到底凭什么深刻改变了深度学习?老式架构:RNN 循环神经网络
金融小师妹11 天前
均值算法·线性回归·transformer
多因子宏观推演模型:地缘局势风险与利率预期共振下,黄金价格为何持续承压的智能预测框架摘要:本文通过多因子宏观分析模型,结合事件驱动识别、通胀传导路径分析、利率敏感性建模、资金流向预测以及资产关联网络,解析国际黄金近期承压的主要原因,并围绕能源价格、货币政策预期及宏观经济数据等核心变量,对黄金未来运行逻辑进行系统分析。
墨神谕11 天前
人工智能·神经网络·transformer
神经网络之TransformerTransformer 是一种基于“注意力机制(Attention)”的深度神经网络架构,最初用于自然语言处理(NLP),后来成为大语言模型(如 GPT 系列)、机器翻译、语音、图像、多模态 AI 等领域的核心架构。
程序喵大人11 天前
人工智能·深度学习·transformer·注意力机制
解密 Transformer 的核心——注意力机制博主介绍:程序喵大人如果你想真正搞懂 Transformer 是怎么工作的,那就必须越过一座大山:注意力机制(Attention)。可以说,理解了 Attention,就懂了 Transformer 的灵魂。
FeelTouch Labs12 天前
人工智能·深度学习·transformer
深度学习模型架构——TransformerTransformer 是 2017 年由谷歌团队在论文《Attention Is All You Need》中提出的深度学习模型架构,核心摒弃了传统 RNN(循环神经网络)的循环结构、CNN(卷积神经网络)的局部连接,以 自注意力机制(Self-Attention) 为核心,专门解决序列数据(文本、语音、时序信号)的建模问题,如今已成为自然语言处理(NLP)、多模态生成(文本 / 图像 / 视频)的 “底层基石”,是 ChatGPT、BERT、GPT 系列等大模型的核心架构。
城中南小12 天前
人工智能·语言模型·transformer
零基础认识大语言模型(LLM)工作原理(5.Transformer的FFN模块到底是什么?)在上一章中,我们已经知道,Attention 的作用是:让模型能够在生成每个 Token 时,回看并加权所有历史信息。
韦胖漫谈IT13 天前
网络·人工智能·macos·transformer
Apple M3 Max 与 Apple M5 Max 对比:本地算力的新旧王者之争随着大语言模型(LLM)和生成式 AI 的爆发,开发者们对“本地算力”的需求达到了前所未有的高度。苹果的 Mac 凭借着独特的统一内存(Unified Memory)架构,早已成为 AI 开发者们本地部署和调试大模型的“神机”。
机器学习之心13 天前
回归·gru·transformer·扩散模型
扩散模型遇上 Transformer-GRU:小样本场景下的回归预测新范式当训练数据不足 200 条时,如何训练出一个测试 R² 接近 0.9 的回归模型?本文记录了一种将扩散模型(Diffusion Model)与 Transformer-GRU 混合架构相结合的技术方案,在仅有 178 条原始训练样本的条件下,通过合成数据增强与序列化建模,实现了优异的回归预测效果。