技术栈
diffusion
thesky123456
8 天前
大模型
·
文生图
·
diffusion
·
扩散模型
·
dit
·
自回归生成
·
多模态生成
27届大模型面试准备(四十六):多模态生成式架构——扩散与自回归的统一
大模型的能力版图里,A14 讲了视觉语言模型(VLM,理解侧),A31 讲了多模态推理,A40 讲了多模态大模型训练与对齐,A44 讲了生成式世界模型与视频生成(偏"世界如何被模拟")。本文把镜头对准"生成范式"本身:同样是文生图、文生视频,底层为什么会出现自回归(Autoregressive, AR)和扩散(Diffusion)两条技术路线?它们各自擅长什么、又为什么正在相互靠拢?
惊鸿一博
23 天前
人工智能
·
自动驾驶
·
diffusion
·
规控
基于Diffusion的轨迹优化:扩散模型在自动驾驶中的原理、架构与落地挑战
自动驾驶的核心难点从来不是"感知精度",而是多模态未来、不确定性、长尾场景。用一句话概括:未来不是一个点,而是一个分布。
传说故事
4 个月前
论文阅读
·
人工智能
·
diffusion
【论文阅读】Diffusion Forcing: Next-token Prediction Meets Full-Sequence Diffusion
本文提出了一种叫“扩散强制(Diffusion Forcing)”的新方法,让模型既能像GPT一样自由地生成长短不一的序列(如视频、动作),又能像全序列扩散模型一样进行全局规划和纠错,解决了长序列生成容易“崩”掉的问题。
YMWM_
4 个月前
论文阅读
·
diffusion
·
policy
论文阅读《Diffusion Policy: Visuomotor Policy Learning via Action Diffusion》
这篇论文《Diffusion Policy: Visuomotor Policy Learning via Action Diffusion》由Cheng Chi等人提出,旨在解决机器人模仿学习中的关键挑战。
山顶夕景
5 个月前
大模型
·
llm
·
diffusion
·
生成式
·
llada
【LLaDA】Large Language Diffusion Models
这篇论文提出了LLaDA(Large Language Diffusion with mAsking),一种从预训练和监督微调(SFT)范式下从头开始训练的扩散模型。
风巽·剑染春水
5 个月前
人工智能
·
深度学习
·
生成模型
·
diffusion
·
扩散模型
【扩散模型原理】(三)Score-Based Perspective: From EBMs to NCSN
《扩散模型原理:从起源到发展》:第三章 基于分数的视角:从 EBMs 到 NCSN专著:The Principles of Diffusion Models
隔窗听雨眠
8 个月前
diffusion
·
3.5
·
stable
·
fp8
Stable Diffusion 3.5 FP8 模型架构解析与优化技巧
近年来,扩散模型在图像生成领域取得了突破性进展,其中Stable Diffusion系列模型因其出色的生成质量和开源特性而广受欢迎。随着模型规模的扩大,推理速度和显存消耗成为实际部署的关键挑战。Stable Diffusion 3.5 FP8正是在这一背景下推出的优化版本,通过FP8精度量化大幅提升了推理效率。
具身智能之心
8 个月前
diffusion
·
具身智能
·
vla
首个开源扩散VLA:Unified DVLA!实现SOTA性能+4倍加速
Diffusion Large Language Model (DLLM)是大模型圈近期最火的topic之一,对于VLA来说,我们的motivation是充分利用dllm在生成理解一体化方面天然的优势,将未来帧生成和动作预测统一在一个框架内。
九河_
9 个月前
transformer
·
vae
·
diffusion
·
dit
关于DiT模型的一些思考
之前看过VAE、DDPM和DiT的论文,但是那时候的理解比较浅,另外论文中涉及大量的公式推导,时间长了就容易细节和整体都把握不住,只记住了有这样一个模型,但是内部的机制忘得差不多了。
风巽·剑染春水
9 个月前
diffusion
·
图像生成
·
mri
·
脑肿瘤
【技术追踪】D2Diff:一种用于精确多对比度MRI合成的双域扩散模型(MICCAI-2025)
多对一 MRI 生成!论文:D2Diff : A Dual Domain Diffusion Model for Accurate Multi-Contrast MRI Synthesis 代码:https://github.com/sanuwanihewa/D2Diff
F_D_Z
10 个月前
diffusion
·
sota
·
1024程序员节
·
bev
·
skydiffusion
·
视角变换
·
多图融合
SkyDiffusion:用 BEV 视角打开街景→航拍图像合成新范式
Junyan Ye、Jun He、Weijia Li 等中山大学与上海人工智能实验室的研究者提出 SkyDiffusion,首次将“曲面 BEV 视角变换 + 多图融合”与“条件扩散模型”结合,实现无需相机参数、无需文本或语义图的纯街景→高分辨率航拍图像合成,在灾难响应、无人机低空影像和历史遥感补洞三大场景均刷新 SOTA,并开源了包含 2 万张跨视角图像的 Ground2Aerial-3 数据集与完整代码。
analywize
1 年前
人工智能
·
笔记
·
深度学习
·
机器学习
·
diffusion
·
扩散桥
diffusion原理和代码延伸笔记1——扩散桥,GOUB,UniDB
扩散模型包含前向过程和反向过程,前向过程把数据分布映射成高斯分布,反向过程想复原之,不过这种映射是一整个分布和一整个分布之间的,学习的是如何从噪声中创造出新的数据。要是图像修复,去雨,超分,分子设计等需要点对点的任务,不怎么需要“创造”能力的任务,比如在药物设计中,我们可能需要生成一个起始构象和目标构象是固定的分子,在图像修复,去雨等问题上,可以理解为一对一的点任务。这一篇笔记介绍GOUB和更为广泛且纳入GOUB,VE,VP等为特殊情况的UniDB。
远瞻。
1 年前
论文阅读
·
人工智能
·
diffusion
【论文精读】DifFace: Blind Face Restoration with Diffused Error Contraction
这篇文章是被 2024 TPAMI接收的关于人脸修复(face restoration)方向的论文,作者是南洋理工大学Chen Change Loy 课题组的。这个课题组很经典,在图像Low Level 方向发表了多篇经典论文,例如视频超分辨率的BasicVSR++,人脸修复的CodeFormer。
紫雾凌寒
1 年前
深度学习
·
计算机视觉
·
stable diffusion
·
aigc
·
文生图
·
图像分割
·
diffusion
计算机视觉|从0到1揭秘Diffusion:图像生成领域的新革命
Diffusion 模型是一种基于扩散过程的生成模型,其灵感来源于非平衡热力学的理论框架。简单来说,它通过模拟数据的逐步退化与重建过程来生成新数据。具体而言,Diffusion 模型先通过正向扩散,向原始数据(如图像)中逐步添加噪声,使其逐渐演变为随机噪声;随后,通过学习一个反向过程,从纯噪声开始逐步还原出原始数据。这种方法在图像生成领域表现尤为突出,能够根据文本描述等条件生成逼真的图像。此外,它还在视频生成中展现出潜力,可生成连贯且高质量的动态内容,在当前人工智能生成内容(AIGC)领域中占据了一席之地
Adenialzz
2 年前
人工智能
·
深度学习
·
机器学习
·
计算机视觉
·
diffusion
Rectified Flow 原理简介与示例代码解读
Rectified Flow 是最近非常火热的图像生成模型框架,最新的 SD3、Flux 等模型都是基于该框架。本文对其原理进行简单直观地介绍,并通过分析官方示例代码来加深理解。
好评笔记
2 年前
人工智能
·
stable diffusion
·
aigc
·
sd
·
diffusion
Stable Diffusion核心网络结构——VAE
本文详细介绍SD模型的三部件之一——VAE,阐述VAE在SD模型中的作用和完整的架构。目录传统VAEStable Diffusion核心网络结构
许野平
2 年前
stable diffusion
·
transformer
·
sd
·
vae
·
diffusion
SD(Stable Diffusion)模型的基本工作数据流
SD(Stable Diffusion)模型的基本工作数据流主要涉及图像生成过程,它建立在深度学习的基础上,利用神经网络对图像和文本进行建模和学习。以下是SD模型基本工作数据流的详细步骤:
m0_60857098
2 年前
diffusion
·
扩散模型
·
dit
扩散模型学习
先验概率和后验概率是贝叶斯统计学中的两个重要概念,用于描述事件发生的概率在更新观测数据后的变化情况。先验概率(Prior Probability):
comedate
2 年前
人工智能
·
diffusion
·
mindspore
·
扩散模型
昇思 25 天学习打卡营第 25 天 | MindSpore Diffusion 扩散模型
使用 MindSpore 学习神经网络,打卡第 25 天;主要内容也依据 mindspore 的学习记录。
mm_exploration
2 年前
pytorch
·
python
·
diffusion
论文解读:DiAD之SG网络
DiAD论文最主要的创新点就是使用SG网络解决多类别异常检测中的语义信息丢失问题,那么它是怎么实现的保留原始图像语义信息的同时重建异常区域?