transformer

JAI科研10 分钟前
人工智能·深度学习·计算机视觉·transformer·nerf
CT重建(一) | NeRF 原理详解面向"从零理解 NeRF"的说明文档。内容结合本仓库(Ben Mildenhall 等人的官方 TensorFlow 实现,ECCV 2020)的代码,回答一系列常见疑问:它解决什么问题、5D 坐标是什么、MLP 长什么样、为什么输入是射线、为什么做 3D 重建却输出 2D 图、以及粗/细网络分别是什么。
渡我白衣1 天前
linux·服务器·网络·c++·人工智能·深度学习·transformer
深入理解 Transformer:Decoder与Masked_Attention前六篇文章,我们已经沿着 Transformer 的核心结构一步一步地走了下来。第一篇,我们从 RNN、LSTM 的局限出发,理解了为什么需要 Transformer。
千里码aicood2 天前
人工智能·cnn·transformer
基于cnn和transformer的卡通图像质量评价随着数字媒体的发展,卡通图像的应用日益广泛,其质量评价成为重要需求。传统的图像质量评价方法难以准确评估卡通图像的独特风格和特征。因此,本项目提出了一种基于CNN和Transformer的卡通图像质量评价方法,旨在提高评估的准确性和效率。本文首先介绍了卡通图像质量评价的相关背景和意义,然后详细阐述了项目的主要内容包括卡通图像的特征提取、CNN和Transformer模型的构建与训练,以及质量评价的具体实现。本项目采取的技术路线是先利用CNN进行图像特征提取,再通过Transformer进行特征融合和分类,最
richard_first2 天前
人工智能·深度学习·语言模型·自然语言处理·transformer
第19章 RAG(Retrieval-Augmented Generation)本章目标:理解 RAG 的完整流程,包括 Chunk、Embedding、Retrieval、Reranker 和 Prompt 设计。
@陈小鱼2 天前
人工智能·深度学习·神经网络·算法·cnn·transformer·血压
基于CNN-Transformer的无袖带血压估计血压(Blood Pressure,BP)是反映人体心血管系统状态的重要生理参数,也是高血压等心血管疾病诊断、风险评估与健康管理的重要指标[]。传统血压测量主要依赖基于袖带充气的示波法或听诊法,通过周期性压迫动脉血管获得收缩压(Systolic Blood Pressure,SBP)和舒张压(Diastolic Blood Pressure,DBP)。尽管袖带式血压计具有较成熟的测量原理和较高的临床认可度,但其通常只能获得离散时间点的血压值,并不适合长时间、连续性的日常血压监测,因此,无袖带血压(Cuff
hunteritself2 天前
大数据·前端·人工智能·深度学习·transformer
卷卷卷!GPT-6 Sol、Luna 正式发布,OpenAI 开始卷价格了Claude Opus 5.5 刚刚露面,OpenAI 就上场了。间隔,90 分钟。几小时前,OpenAI 正式发布 GPT-6 Sol 和 GPT-6 Luna。这是 GPT-6 全家桶的第二和第三个成员,GPT-6 Astra 的弟弟和妹妹。
硅谷秋水2 天前
人工智能·深度学习·机器学习·语言模型·transformer
Looped Transformer的来源和发展Looped Transformer 从“让模型学会反复计算”的架构设计,发展为推理时扩展计算量的方法,进一步走向对循环位置、次数和实际计算成本的联合优化。
高洁012 天前
python·深度学习·django·transformer·tornado
AI视频生成技术:从静态图文到动态视觉的内容智能革命AI视频生成技术:从静态图文到动态视觉的内容智能革命一、AI视频生成核心原理:时序动态内容的生成逻辑二、AI视频生成技术演进:从模糊片段到高清成片三、AI视频生成工程落地:核心难点与优化方案四、AI视频生成核心业务:全行业内容量产赋能五、AI视频生成行业治理:版权与风控规范#大模型 #数字孪生 #世界模型 #具身智能
蒸蒸yyyyzwd2 天前
transformer·八股
学习笔记 day51一、李宏毅生成式 ai 2025fall 导论学习第二节课是关于 RAG 的,RAG 是检索增强生成,在不训练模型,提供外部知识库给模型去提升模型的能力,context engineering 应该避免上下文塞爆,比如系统提示词,用户提示词,记忆,外部知识库,网络搜索或者使用工具得到结果。
倔强的石头1062 天前
android·深度学习·transformer
【Transformer】Tokenization详解_BPE_WordPiece_SentencePiece摘要:大模型处理的不是“字”或“词”,而是 token。Tokenization 决定一段文本会被切成多少 token,直接影响上下文长度、API 成本、训练效率、KV Cache、RAG 分块、代码能力和多语言效果。本文从“为什么不能直接按词切分”讲起,解释 token、token id、vocab、embedding 的关系,再用可运行的小实验讲清 BPE、WordPiece、SentencePiece 的直觉,最后讨论特殊 token、chat template、token 成本和 tokenize
问天_观心3 天前
人工智能·深度学习·学习·大模型·transformer
大模型训练与推理优化(二)Data Parallelism 的核心是:复制模型 + 切分数据也就是:例如:Global Batch Size = 1024
倔强的石头1063 天前
gpt·深度学习·transformer
【Transformer】GPT系列演进_从GPT1到GPT4的技术路线摘要:GPT 系列的演进不是简单的“参数越来越大”。它背后有一条清晰技术路线:用 Decoder-Only Transformer 做自回归语言建模,用大规模预训练学习通用文本分布,用上下文学习把任务写进 prompt,用监督微调让模型更会按指令回答,再用偏好对齐改善有用性和安全性。本文从 GPT-1、GPT-2、GPT-3、InstructGPT/ChatGPT 到 GPT-4,讲清每一阶段解决了什么问题、技术重点如何变化,以及为什么 GPT 路线会从“语言模型”发展成“通用助手”。读完后,你应该能理解
梦想的初衷~3 天前
深度学习·transformer·扩散模型·遥感影像处理·图神经网络gnn·pytorch实战·pinn正反问题
深度学习全栈技术复盘:PINN科学计算、Transformer多场景建模、GNN时空网络与强化学习工业实战当前,科学研究正经历”数据驱动”与”机理驱动”双轮融合的深刻范式变革。一方面,观测、监测与遥感数据呈指数级增长,传统建模方式难以从中提炼可靠知识;另一方面,数值模拟模型日益复杂,率定成本高企,且模型内部机理难以被纯数据方法替代。高校与科研院所的研究者普遍面临三重挑战:物理方程与深度学习两套话语体系割裂,PINN等融合方法门槛高、落地少;Transformer、图神经网络、强化学习等前沿架构概念繁多,跨领域迁移路径不清晰;模型率定、超参调优与结果解释环节仍依赖经验试错,进化计算等系统化方法论支撑。在此背景下
布吉岛的石头4 天前
java·人工智能·深度学习·bert·transformer
Java 程序员第 49 阶段5:BERT 预训练目标 MLM+NSP 的工程含义在大模型工程落地里,这个话题绕不开。很多 Java 同学刚接触时容易只看结论、不究原理,一旦线上出问题就无从下手。先把「为什么重要」说清楚,后面才好理解它怎么用。
倔强的石头1064 天前
语言模型·bert·transformer
【Transformer】BERT_双向预训练语言模型的开端摘要:BERT 是理解型预训练语言模型的里程碑。它不像 GPT 那样从左到右预测下一个 token,而是使用 Encoder-Only Transformer 双向阅读整段文本,并通过 Masked Language Modeling 学习上下文表示。BERT 让“先在海量文本上预训练,再在具体任务上微调”成为 NLP 的主流范式,也为今天的 embedding、rerank、分类、信息抽取等系统打下基础。本文从 BERT 出现前的 NLP 困境讲起,解释 Encoder-Only、MLM、NSP、[CL
huisheng_qaq4 天前
rnn·lstm·transformer·循环神经网络
【transformer前置篇-03】深入理解LSTM的底层原理在学习LSTM之前,需要先学习这个RNN循环神经网络:RNN循环神经网络上一篇文章我们讲解了RNN循环神经网络,RNN循环神经网络基于前馈神经网络的基础上已经有了很大的优化,在集成了前馈神经网络的特点的情况下,同时引入了隐藏状态H—上下文的压缩摘要(压缩记忆),让模型有了上下文记忆;引入时间维度让整个流程固定的顺序读,使得他有了固定处理顺序数据的能力。通过这两点让神经网络有了顺序和短期记忆。RNN虽然在这些方面有了一定的改进,但本身仍然有着许多的痛点,比如会随着序列越长导致早期的许多重要信息逐渐丢失,记忆
倔强的石头1064 天前
人工智能·深度学习·transformer
【Transformer】Encoder_Decoder_vs_Decoder_Only架构对比摘要:Transformer 不是只有一种形态。BERT 是 Encoder-Only,T5/BART 是 Encoder-Decoder,GPT/LLaMA/Qwen 是 Decoder-Only。三者差异不只是“模块名字不同”,而是注意力方向、训练目标、输入输出组织方式和工程成本都不同。本文从任务直觉出发,解释 Encoder-Only 为什么适合理解,Encoder-Decoder 为什么适合序列到序列转换,Decoder-Only 为什么成为现代生成式大模型主流,并用 mask 和伪代码展示它们的
高洁0111 天前
人工智能·深度学习·机器学习·transformer·知识图谱
未来三年,AI 落地的五个确定性判断一未来三年,AI 落地的五个确定性判断一、判断一:价值会向两端集中二、判断二:评测从"能不能"转向"稳不稳"三、判断三:数据工作的重心会从采集转向治理四、判断四:人机协作的形态会被重新定义五、判断五:治理要求会从事后走向事前#智能体 #大模型 #通用智能 #数字孪生
江畔柳前堤12 天前
前端·人工智能·深度学习·opencv·目标检测·重构·transformer
字节跳动·大模型应用知识手册岗位:校园招聘 - 大模型应用(商业化基模 & Agent 方向)- 内容质量与数据服务平台 办公地点:北京市朝阳区 时尚·万科中心(朝阳北路 152 号院,东四环红领巾桥,5A 甲级写字楼) 业务归属:抖音集团「内容质量与数据服务平台(CQC)」× 字节商业化「巨量引擎 · 商业信任与安全」——用大模型保障广告 / 生服 / 电商的商业内容安全与合规 序列:运营序列(做算法的事、要业务的结果) Leader 关注点:懂 Agent、懂后训练、有创新能力;纯技术画像,产品向不 OK 团队形态:模型中台,对
高洁0112 天前
人工智能·深度学习·transformer·知识图谱·tornado
AI智能体:会自己张罗事的软件实体AI智能体:会自己张罗事的软件实体一、智能体与普通程序有何不同二、支撑它运转的关键机制三、它在哪些环节真正好用四、与多智能体协作的新形态五、风险与负责任的使用#智能体 #通用智能 #数字孪生 #世界模型