transformer

布吉岛的石头1 天前
java·架构·transformer
Java 程序员第 48 阶段1:Transformer 架构总览与自注意力直觉,从 RNN 痛点理解注意力机制做 Java 的同学第一次接触大模型,往往会被「为什么会突然冒出 Transformer 这个东西」搞懵。其实它是对 RNN/LSTM 两大致命缺陷的正面回答。
EW Frontier2 天前
transformer·调制识别·无人机信号识别·辐射源识别
拆解|多尺度复数卷积,把调制识别准确率又往上推了 3 个点【文末附代码链接】本文环境: Python 3.9 + PyTorch 2.0 + CUDA 11.8 + NVIDIA RTX 3090
克里斯蒂亚诺更新2 天前
rnn·cnn·transformer
介绍CNN RNN Transformer(新王)这是一个非常经典且核心的深度学习问题。这三者本质上都是特征提取器,但它们的设计哲学和适用场景截然不同。
猫先生Mr.Mao2 天前
深度学习·大模型·transformer·注意力机制·论文解读
大模型之Attention Is All You Need详解:Transformer如何用注意力重写序列建模【从零走向AGI】旨在深入了解通用人工智能(AGI)的发展路径,从最基础的概念起,逐步构建完整的知识体系。 项目地址🔗:https://github.com/AI-mzq/From-Zero-to-AGI.git
Ado柳贯一2 天前
人工智能·深度学习·transformer
Transformer模型详解-CSDN发布版本文内容依据知乎「初识CV」《Transformer模型详解(图解最完整版)》优化重写,配图改为 Mermaid 绘制,方便在 CSDN 直接阅读。适合对深度学习有兴趣、想搞清楚 Transformer 到底在干嘛的同学。
YoanAILab3 天前
语言模型·transformer·embedding·token·rag
大语言模型基础:Token、Embedding、Transformer、KV Cache 与 RAG理解大语言模型,可以先记住两条主线:大语言模型并不是直接以“汉字”或者“英文单词”为单位处理文本,而是先通过 Tokenizer(分词器) 将文本切分成一个个 Token。
JAI科研5 天前
开发语言·人工智能·深度学习·算法·自然语言处理·transformer·vllm
Deepseek Agent Harness教程(七) | Deepseek Harness不是一个内核加一堆插件“DeepSeek Harness 不是一个内核加一堆插件” —— 这句话精准地概括了 DeepSeek Harness 的核心架构思想。
zcg19425 天前
人工智能·深度学习·transformer
CNN/Transformer/VAE中的Encoder-Decoder有什么区别CNN(如 U-Net)的 Encoder-Decoder 之所以看起来对称,是因为它操作的对象是空间特征图:
高洁016 天前
人工智能·python·深度学习·transformer·知识图谱
Teacher Forcing技术解析标题:Teacher Forcing技术解析 1. 为什么需要 Teacher Forcing? 2. Teacher Forcing 的工作原理 3. Teacher Forcing 的优缺点 4. 对抗 Teacher Forcing 缺点的改进方法
ShineWinsu7 天前
人工智能·prompt·transformer
人工智能基础概念全景解析:从 AI 到 Transformer、LLM、Prompt、Token、RAG、Agent、对齐与安全一文说明人工智能领域的 20+ 个核心概念 —— 不只是定义,而是深入理解每个概念背后的"为什么"hello 大家,我们都知道,人工智能领域的发展速度之快,让"跟上节奏"本身成了一件难事。2025 年 GPT-4o 还在让开发者惊叹,2026 年 GPT-5.5、Claude Opus 4.6、DeepSeek V4、Gemini 3.1 Pro 已经让人应接不暇。各种新名词、新概念、新框架层出不穷,从业者很容易陷入"会用但不知道为什么这样用"的困境。
逢生博客8 天前
人工智能·cnn·transformer·mnist·手写数字识别
MNIST 手写数字识别实战:CNN + Transformer 混合模型本项目用 PyTorch 在 CPU 上训练一个手写数字识别模型。与常见的纯 CNN 方案不同,这里采用了混合架构:CNN 负责提取局部笔画,Transformer 负责建模全局关系。
就是一顿骚操作8 天前
人工智能·深度学习·计算机视觉·transformer·论文解读
ViT:把图像切成词之后,Transformer 如何进入计算机视觉本文是一篇原创中文论文解读,主要参考 D2L《Dive into Deep Learning》1.0.3 章节 Transformers for Vision,解读 Alexey Dosovitskiy 等人的经典论文 An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale。D2L 书籍文本与图示采用 Creative Commons Attribution-ShareAlike 4.0 Internationa
slacker-kian8 天前
人工智能·python·transformer·huggingface·blip·modelscope·blipprocessor
HuggingFace API加载模型超时:用 ModelScopeAPI 替代从 Hugging Face 下载预训练模型(如 BLIP、Llama、Stable Diffusion 等)经常会遇到连接超时、下载中断、进度条卡死等问题。
渡我白衣8 天前
java·linux·开发语言·c++·人工智能·深度学习·transformer
深入理解 Transformer:Transformer 究竟是什么?在上一篇文章中,我们暂时没有急着讨论 Q、K、V,也没有直接推导 Attention 的计算公式。我们先回答了一个更基础的问题:
亦皓ai9 天前
人工智能·算法·机器学习·搜索引擎·transformer
AI时代后端工程(二):AI把代码写得越来越快,我却越来越不敢让它直接开工了当 Coding(编码)越来越容易以后,程序员真正稀缺的能力,到底还剩什么?这个问题其实是上一课最重要的延伸。
柳絮飞祭奠9 天前
人工智能·深度学习·语言模型·数据分析·transformer·边缘计算·集成学习
Dify Windows Docker Desktop 部署文档适用:Windows10/11,使用 Docker Desktop + WSL2 后端,不建议直接 windows 原生,必须开启 WSL2 最低配置:内存 ≥8G,推荐 16G;磁盘预留 40G 以上空间
richard_first9 天前
人工智能·深度学习·transformer
Transformer 与大语言模型:第3章 输入是如何进入 Transformer 的本章目标:理解文字是如何一步步变成 Transformer 可以处理的向量的,以及为什么需要 Position Encoding。
richard_first9 天前
人工智能·深度学习·transformer
Transformer 与大语言模型:第6章 Self-Attention自注意本章目标:完整推导 Self-Attention 的计算过程,手算一个例子,理解每一步的含义。Self-Attention 的输入是一个矩阵 XXX:
richard_first9 天前
深度学习·架构·transformer
Transformer 与大语言模型:第2章 Transformer 总体架构本章目标:从整体上理解 Transformer 的结构,知道每个模块负责什么,以及为什么 GPT 只有 Decoder,BERT 只有 Encoder。