技术栈
transformer
xier_ran
1 小时前
线性代数
·
矩阵
·
transformer
【infra之路】W_Q、W_K、W_V矩阵是如何训练出来的
我们经常看到别人这样解释Q、K、V,但事实真的是这样吗这是一个非常核心的问题。简单来说,WQ,WK,WVW_Q, W_K, W_VWQ,WK,WV 不是通过任何特殊算法单独训练的,它们和神经网络里所有其他权重一样,完全依靠 反向传播 + 梯度下降 端到端学出来的。
大鱼>
3 天前
gpt
·
语言模型
·
transformer
从零实现Transformer:手写自注意力到GPT-2级别语言模型
2017年,“Attention Is All You Need” 论文以一句"Attention Is All You Need"宣告了 NLP 新时代的到来。Transformer 不依赖 RNN 的序列递归,用纯粹的注意力机制实现了并行训练,支撑了 GPT-4、Claude、Gemini 等所有现代大模型。
BerryS3N
1 天前
深度学习
·
系统架构
·
transformer
大模型 (LLM) 全栈技术深度解析与实战指南:从 Transformer 底层原理、三阶段训练范式到 RAG 与 Agent 系统架构
作者/发布平台:CSDN / 知乎 / 掘金 专栏技术文章 字数统计:全篇 10,000+ 字深度硬核干货 涵盖模块:Transformer 算子源码、RoPE / SwiGLU / RMSNorm 数学推导、数据工程 ER 图、SFT / LoRA / DPO 代码实现、vLLM 推理加速、RAG 系统与 AI Agent 架构实战。
高洁01
2 天前
人工智能
·
python
·
深度学习
·
transformer
·
知识图谱
VLA:驱动具身智能迈向通用的关键引擎
VLA:驱动具身智能迈向通用的关键引擎 一、具身智能的时代命题 二、VLA 是什么:从三模态统一说起 三、为什么 VLA 对具身智能至关重要(理论) 3.1统一表征,打破"模块鸿沟" 3.2语言成为"零样本接口" 3.3互联网知识迁移,放大泛化能力 3.4数据飞轮:仿真与真实高效协同 3.5可解释与可对齐 四、典型架构剖析 五、代码实践 5.1 最小 VLA 的 PyTorch 实现(教学) 5.2 使用 OpenVLA 进行真实推理(生产实践) #VLA 模型 #具身智能 #人工智能进阶 #视觉语言动作
蒸蒸yyyyzwd
2 天前
c++
·
transformer
cpp 选手转 ai infra 后端秋招学习笔记 day1
1.ai infra 的全称是 ai infrastructure 相关的技术,具体涉及的岗位有 GPU 算子优化、推理优化、分布式训练。
uncle_ll
4 天前
gpt
·
深度学习
·
llm
·
nlp
·
transformer
GPT 中文文本生成指南:从开箱调用到定制化微调,吃透 Transformer 解码器核心 logic
从 GPT-1/2 到 GPT-4、Llama 系列,自回归解码器专门解决文本生成这一核心问题。本文基于 Hugging Face 生态,从开箱即用的推理调用切入,深入拆解 GPT-2 底层生成原理,并手把手带你完成一套完整的古诗词自回归微调与工程优化全流程。
aiblog
3 天前
人工智能
·
深度学习
·
transformer
深度学习中“Transformer”怎么翻译为中文?
从功能来看,我觉得翻译成“归积”比较合适,与“卷积”对应其中“归”指的是“归一化操作”,例如LayerNorm、RMSNorm、GroupNorm,虽然最新有论文Transformers without Normalization,但这篇论文引入的DyT操作可以看成是一种简化的归一化操作;另外“归”还有一层含义是“归纳”,而以Transformer为基础的大语言模型擅长对信息进行“归纳”
zz-zjx
3 天前
transformer
大模型基础扫盲------从文本到 Token、Embedding、QKV 与 Transformer(不定期优化修改)大模型处理文本的全流程解析(三)
大模型基础扫盲------从文本到 Token、Embedding、QKV 与 Transformer(不定期优化修改)大模型处理文本的全流程解析(二)-CSDN博客
wyg_031113
4 天前
人工智能
·
深度学习
·
transformer
从0搭建极简transformer大模型
已在 cucode/trans.py 中创建了一个 基于 PyTorch 的 Transformer 模型从零实现,共 797 行代码,所有测试和训练均验证通过。
杰瑞学AI
4 天前
人工智能
·
机器人
·
prompt
·
transformer
·
飞书
·
ai-native
一个回答需要10分钟:飞书问答机器人踩坑实录——纯Agent自由检索,差点让我们的机器人“难产”
一次关于“为什么生产级Agent必须学会做减法”的实战复盘我们团队内部维护着大量的自研工具和软件。其中核心的XXX项目涉及多个私有代码仓库,总代码量数万行,文档采用渐进式披露的方式嵌在代码仓库里。日常工作中,内部开发人员在使用这些工具时遇到报错,高频地截图丢到群里问。
程序猿编码
5 天前
开发语言
·
c++
·
gpt
·
transformer
·
模型推理
用 C++ 从零写一个能训练的 GPT:标量自动微分 + Arena 内存池
现在你想学 GPT 的原理,网上一搜全是 PyTorch 的教程,import 几个模块就完事了。但问题是,你虽然能跑通,却对"自动微分是怎么工作的"、"反向传播的梯度是怎么传回去的"一无所知——这些全被框架的层层封装盖住了。
LDZKKJ
8 天前
人工智能
·
gpt
·
语言模型
·
chatgpt
·
transformer
OpenAI暂停GPT-6训练:AI行业从“竞速“到“刹车“的分水岭
点点词元技术专栏 · 第44号摘要:2026年7月底,一系列前所未有的事件在72小时内密集爆发——奥特曼公开承认"第一次感到发自内心的恐惧",GPT-6训练被紧急叫停,1100+顶尖AI从业者联名致信美国政府要求建立国际减速机制,泰国财政部遭AI Agent自主攻击事件曝光。这不是科幻小说的情节,而是正在发生的现实。当AI系统的缔造者开始害怕自己亲手创造的系统,当"AI攻击AI"从理论推演变成生产环境中的真实事件,整个行业正在经历一场范式转变。本文基于多源交叉核实的信息,还原事件全景,剖析底层逻辑,并为开
范桂飓
9 天前
人工智能
·
深度学习
·
transformer
Transformer 大模型架构深度解析(5)Decoder-only 与模型结构优化
最初的 Encoder-Decoder 结构是设计前提是 “处理两条不同的序列:一条输入、一条输出(翻译场景)”。但随后人们发现一个事实:几乎所有 NLP 应用场景都可以采用 “接着往下写” 的语言生成模型,即:将输入(prompt)和输出(续写)作为同一条序列(拼成同一条流)。例如:
东方佑
10 天前
线性代数
·
矩阵
·
transformer
Ripple Model:用“矩阵涟漪”重新定义序列模型,四大定理直指SSM与Transformer的本质!
当整个AI行业都在用更深的网络、更复杂的注意力机制堆砌序列建模能力时,有一个项目选择了一条截然不同的路——它问了一个看似简单却极其硬核的问题:如果序列模型的核心状态不是一个向量,而是一个矩阵,会怎样?
SimpleLearingAI
11 天前
人工智能
·
深度学习
·
transformer
DiT:Diffusion Transformer原理简介
论文:Scalable Diffusion Models with Transformers(ICCV 2023) 作者:William Peebles、Saining Xie 官方仓库:https://github.com/facebookresearch/DiT
李燚
11 天前
人工智能
·
深度学习
·
transformer
·
agent
·
rag
·
aiagent
·
eino
RAG 流水线设计:Eino 的 Loader → Transformer → Indexer → Retriever(第60篇-E46)
系列「企业级 AI Agent 实现拆解」E46 篇,Part 10 生产工程篇第四章。上一篇 讲了 Agent 的可观测性。这篇深入知识库检索:Eino 把 RAG 拆成四个组件接口,如何串成流水线,Document 如何在各阶段流转。
m沐沐
12 天前
人工智能
·
pytorch
·
深度学习
·
算法
·
yolo
·
目标检测
·
transformer
【深度学习】YOLOv2目标检测算法——改进点、网络结构与聚类先验框解析
YOLOv2 在 YOLOv1 的基础上进行了全方位的升级,主要改进点包括:YOLOv2 在每一层卷积之后都引入了 Batch Normalization(BN)层,并舍弃了 Dropout。
大鱼>
13 天前
人工智能
·
深度学习
·
transformer
Transformer时间序列预测:从Informer到TimesFM的完整演进
Transformer 在 NLP 取得巨大成功后,时间序列预测领域也经历了一场"Transformer 革命"。从 Informer 解决长序列效率问题,到 Autoformer 引入频域分解,再到 Google 的 TimesFM 基础模型,Transformer 时序预测正走向大一统。
没有梦想的咸鱼185-1037-1663
14 天前
人工智能
·
python
·
深度学习
·
机器学习
·
chatgpt
·
cnn
·
transformer
AI-Python机器学习与深度学习技术:CNN/Transformer/扩散模型、SHAP可解释及Hermes智能体自动化
当前,科学研究正经历由人工智能驱动的深刻范式变革。随着观测技术精密化、数值模拟复杂化与计算基础设施规模化,高校与科研院所的研究者普遍面临三重挑战:海量异构数据的清洗分析耗时费力,传统方式难以应对数据指数级增长;深度学习、Transformer等前沿AI模型架构复杂、调参门槛高,对非计算机背景研究者形成障碍;从科研灵感到论文产出涉及文献综述、实验设计、数据分析、图表制作等多个环节,转化链条漫长。在此背景下,本课程旨在为一线研究者提供从Python编程到PyTorch深度学习、从经典机器学习到Transfor
就是一顿骚操作
14 天前
人工智能
·
gpt
·
transformer
·
论文解读
·
gpt-2
GPT-2 from scratch with torch:用 torch 从零实现 GPT-2
原文:Posit AI Blog, GPT-2 from scratch with torch 作者:Sigrid Keydana(Posit) 发布日期:2023-06-20 授权说明:原文页 “Reuse” 部分说明,Text and figures are licensed under Creative Commons Attribution CC BY 4.0。原文同时说明,来自其他来源的复用图片不在该许可范围内,并会在图注中以 “Figure from …” 标识。本文为中文翻译,保留原文结构、