transformer

高洁011 小时前
python·深度学习·机器学习·transformer
智能体的“记忆”难题智能体的“记忆”难题 1 | 一个被忽视的关键问题 2 | 人类的记忆 vs. AI的记忆 3 | 当前解决方案及其局限 4 | 理想中的AI记忆系统 5 | 这意味着什么?
十三画者12 小时前
人工智能·深度学习·数据挖掘·数据分析·transformer·数据可视化
【文献分享】ConfRetro:融合3D构象信息的逆合成预测Transformer框架逆合成(retrosynthesis)是有机合成和药物发现中的核心问题,其目标是从目标产物分子出发,找到能够合成该产物的反应物集合。这一任务面临着巨大的化学搜索空间和无数的分子组合,传统上高度依赖化学家的大量专业知识和经验,效率低下。近年来,数据驱动的深度学习方法在逆合成预测领域取得了显著进展,特别是无模板(template-free)方法——将逆合成视为序列到序列的机器翻译任务,直接从产物SMILES生成反应物SMILES,避免了预定义模板覆盖度有限和可扩展性差的问题。
大模型丫丫1 天前
gpt·深度学习·transformer
Transformer架构详解:从Attention到GPT的演进之路Transformer 是近年来自然语言处理(NLP)领域最具革命性的架构之一。自 2017 年 Google 在论文《Attention Is All You Need》中提出以来,它彻底改变了序列建模的范式,取代了传统的循环神经网络(RNN)和卷积神经网络(CNN),成为大语言模型(如 GPT、BERT、T5 等)的核心基础。
root_123456_2 天前
rnn·lstm·transformer·自学ai
注意力机制的诞生:从 Seq2Seq Attention 到注意力的本质在 Transformer 诞生之前,序列建模任务长期依赖 RNN、LSTM、GRU 这类循环结构。循环模型依靠时序逐次迭代完成文本编码,天然存在时序依赖,无法实现并行计算,长距离信息传递过程中还会出现梯度消失问题,当文本序列长度增加,模型很难捕捉相距较远词语之间的关联关系。注意力机制(Attention Mechanism)的提出,正是为了解决循环网络的信息遗忘瓶颈。本章将完整回溯注意力机制的发展脉络,从早期 Seq2Seq 架构的固有缺陷切入,讲解加法注意力、乘法注意力的数学推导,剖析注意力的底层本质
大数据点灯人2 天前
人工智能·深度学习·ai·大模型·transformer
【大模型】深度解答:OOV 与 Tokenizer 词汇表共用问题很多人觉得“分词而已,差几个 token 有什么关系”。但实际上:同一段文本在不同模型下的 token 计数可能相差显著(实测中 10%~30% 的量级并不罕见,中文场景偏差尤其明显),而 API 是按 token 计费的,上下文窗口是按 token 算的。
XLYcmy3 天前
llm·transformer·encoder·decoder·自注意力·deepseek·深度思考
小红书 算法一面 七Transformer 编码器(Encoder)的**多头自注意力(Multi-Head Self-Attention)**与解码器(Decoder)的**掩码多头自注意力(Masked Multi-Head Self-Attention)**,核心差异源于两者的任务目标不同:**Encoder 负责“理解输入序列的全局语义”,需双向关注所有 token;Decoder 负责“生成连贯的输出序列”,需单向关注已生成的 token,防止泄露未来信息**。
阿图灵3 天前
pytorch·深度学习·gru·transformer·机器翻译·seq2seq
Seq2Seq Transformer 中英翻译实战:从 GRU 到 Transformer,BLEU 0.225 → 0.307项目地址(Gitee):https://gitee.com/Touari/seq2seq_zh_en_translation.git 本文记录 Seq2Seq_Transformer 项目的完整构建过程:从 Seq2Seq_Attention(GRU + Luong 注意力)复制出来 → 改造为 Transformer 架构 → 重新训练 → 实测对比。所有数据均为实测(RTX 3060 6GB)。
杀生丸学AI3 天前
人工智能·深度学习·3d·数据挖掘·transformer·世界模型·高斯泼溅
【世界模型】Lyra 2.0:可探索的生成式3D世界(NVIDIA)图1:Lyra 2.0能够基于单张图像实现长视距的三维一致性场景生成。用户可从输入图像出发,通过迭代定义相机运动来探索场景;与此同时,Lyra 2.0会合成具有空间持续性的视频输出,逐步扩展场景环境。这些视频可直接重构为高保真3DGS与表面网格,从而生成可在仿真引擎及交互式查看器中部署的3D资产。
Lee_jerome4 天前
transformer·位置编码·前向传播·自注意力·交叉注意力·多头注意力·layernorm
python神经网络编程入门(三十八)——从零实现 Transformer 前向传播📍 路标:本篇位于《从零构建 Transformer》系列 第 9/16 章 · 架构篇。 系列主线:注意力思想 → 自注意力 → 多头 → 位置编码 → 编解码架构 → 手撕实现 → 预训练模型 → 实战微调 → 知识收官。 进度:▸ 基石篇(1-5) ▸ 架构篇(6-10·本篇) ▸ 预训练篇(11-13) ▸ 实战篇(14-16)
Together_CZ5 天前
语言模型·llm·transformer·scaling laws·parcae·用于稳定循环语言模型的扩展定律·stable looped
Parcae: Scaling Laws For Stable Looped Language Models——用于稳定循环语言模型的扩展定律论文由加州大学圣迭戈分校和Together AI的研究者共同完成,聚焦于如何稳定地训练循环(Looped)架构的大语言模型,并将其发展为一种独立于模型参数和数据量的、可预测的扩展计算规模的新维度。核心贡献是提出了新型循环架构 Parcae,通过动态系统理论和工程化改进,解决了该类模型长期存在的训练不稳定问题,并首次系统性地推导了其在训练和推理阶段的扩展定律。
叠层归一研究院4 天前
人工智能·python·算法·机器学习·transformer·agi
如何用程序搭建一个 AGI 种子系统(三):生长如何对接物理与数学宇宙这是 m178 模块论文的下篇,也是三部曲的收官。上篇我们搭了地基(向量种子、维度生成 F2/F3、无限生长引擎);中篇我们在地基上挂了内容层(猜想引擎 ConjectureEngine、引力井、康威宇宙内容层)。
承渊政道4 天前
pytorch·回归·transformer·chatglm·注意力机制·解码器
【从零开始大模型开发与微调:基于PyTorch与ChatGLM】(从注意力到自回归生成:彻底理解Transformer解码器)本文从1开始.前面介绍了编码器的架构和实现代码.那么相信你对编码器的编写已经很熟悉了.解码器是在编码器的基础上对模型进行少量修正,在不改变整体架构的基础上进行模型设计,可以说,如果掌握了编码器的原理,那么学习解码器的概念、设计和原理一定易如反掌.本文首先介绍解码器的原理和程序编写,然后着重解决一个非常大的问题——文本对齐.这是自然语言处理中一个不可轻易逾越的障碍,本文将以翻译模型为例,系统地讲解文本对齐的方法,并实现一个基于汉字和拼音的"翻译系统".
叠层归一研究院7 天前
人工智能·算法·数据挖掘·transformer·agi
AGI 系统(十二):高阶递归极限 — k 阶差分 C^(k) 指数收敛到静止 (无限阶自反)AGI 系统 M171 · 2026-08-04agi-01~agi-11 建立了递归守恒、深度同构、区分三分、时序递归、多主体网络、时序断裂、范畴基础、嵌入函子、意识自然变换、二阶递归、二阶网络,模块已 63 项 check。agi-10 二阶递归用 C’(n)=C(n)−C(n−1)。本篇让论文发现再次回灌升级 M171:把二阶递归推广到任意 k 阶——递归定义 C(k)(n)=C(k-1)(n)−C^(k-1)(n−1)。验证:因每层差分向稳态 1−ψ³ 逼近(乘损失因子),|C^(k)| 随 k
lucky_syq5 天前
人工智能·语言模型·架构·transformer
第3篇 · S1·上:什么是大语言模型 + Transformer 架构深讲这一篇剥掉大模型的神秘外衣:LLM 的概率本质、能力与边界,以及 Decoder-only Transformer 的完整架构与注意力推导。它是整个学习篇(S1-S10)的地基,后续训练(第 6-7 篇)、微调(第 8-9 篇)、推理优化(第 10-11 篇)都踩在这块地基上。 学完你应该能看懂任何主流 LLM 的架构图,把注意力计算对应到自己熟悉的分布式/数据概念上,面试能默写注意力公式并讲清 √d_k。 每节按 原理 -> 关键推导 -> 前端/后端/大数据映射 -> 实操要点 -> 误区 走。遇到公
JAI科研5 天前
人工智能·深度学习·算法·机器学习·自然语言处理·transformer·vllm
Deepseek Agent Harness教程(二) | DeepSeek Harness 设计思路你写了一个能跑的Agent,感觉没什么难的。直到你要换模型厂商、加监控、做审批、处理并发冲突——那20行循环开始向你索命。这篇文章拆解DeepSeek Harness的设计,看它如何用20万行代码回答两个最致命的问题。
chen_zn956 天前
人工智能·深度学习·transformer·具身智能·vla
《VLA 系列》Human-to-Robot Transfer | 人类视频共训练 | 跨本体涌现迁移 | 论文解析人类视频数量大、场景丰富,采集成本也比机器人遥操作低得多,但人和机器人长得不一样、运动方式不一样,动作空间更不一样。过去的方法通常要做视觉域对齐、手部重定向或专门的跨本体模块。这篇论文给出的结论反而很简单:当 VLA 已经在足够多的场景、任务和机器人本体上预训练后,不需要额外设计显式对齐损失,仅通过人类数据与机器人数据共微调,人类示范中的新场景、新物体和新任务知识就能迁移到机器人。
杀生丸学AI6 天前
深度学习·3d·音视频·transformer·三维重建·空间智能
【稀疏重建】StructSplat:基于非校准稀疏视图的可泛化3DGS图1:基于非校准稀疏视图的新视角合成的定性对比结果。我们的方法能够减少伪影、模糊现象及位移。标题:StructSplat: Generalizable 3D Gaussian Splatting from Uncalibrated Sparse Views 哈尔滨工业大学(深圳);大湾大学;广州云蝶科技有限公司 链接:https://structsplat.github.io
HyperAI超神经6 天前
人工智能·深度学习·目标检测·计算机视觉·数据集·transformer
128K长上下文+智能体强化训练!LFM2.5-2.6B解锁端侧大模型高效部署;DETR用Transformer斩断NMS与Anchor,重塑目标检测随着 AI 智能体逐渐从云端走向终端,如何在有限算力与内存下实现高质量的任务执行成为关键。LFM2.5-2.6B 面向这一需求打造,基于 LFM2 架构并引入 128K 长上下文与智能体强化训练,在工具调用、指令遵循和多步骤任务中展现出越级性能,可与参数规模大 4 倍的模型竞争。模型还针对主流智能体框架进行训练优化,提升实际应用中的兼容性。更值得关注的是,其在 Apple M5 Max 上推理速度可达 220 tok/s,AMD Ryzen CPU 上达 113 tok/s,内存占用低于 2.5GB,在轻