技术栈
扩散模型
thesky123456
7 天前
大模型
·
文生图
·
diffusion
·
扩散模型
·
dit
·
自回归生成
·
多模态生成
27届大模型面试准备(四十六):多模态生成式架构——扩散与自回归的统一
大模型的能力版图里,A14 讲了视觉语言模型(VLM,理解侧),A31 讲了多模态推理,A40 讲了多模态大模型训练与对齐,A44 讲了生成式世界模型与视频生成(偏"世界如何被模拟")。本文把镜头对准"生成范式"本身:同样是文生图、文生视频,底层为什么会出现自回归(Autoregressive, AR)和扩散(Diffusion)两条技术路线?它们各自擅长什么、又为什么正在相互靠拢?
白拾
10 天前
扩散模型
·
前馈模型
·
arxiv 2026
·
genception 论文分享
·
视频生成预训练
·
通用视觉感知
【arXiv 2026】GenCeption:视频生成模型是通用视觉学习者|从生成式视觉预训练范式视角
本文解读 arXiv 2026 论文《Video Generation Models are General-Purpose Vision Learners》。该论文提出 GenCeption,把大规模文生视频扩散模型改造为单步前馈的通用视觉感知模型,通过统一 RGB 表示、可学习 token与统一 $L_2$ 损失,让 8 类稠密/稀疏任务共用一个骨干与解码器,其特别之处在于仅用纯合成视频数据训练,即全面超越各任务专用 SOTA。实验表明法向 Hi4D mAE 10.99、深度 Goliath AbsR
杀生丸学AI
10 天前
人工智能
·
3d
·
三维重建
·
扩散模型
·
高斯泼溅
·
空间智能
·
室内重建
【三维重建】QuerySplat:在 3DGS 预测中解耦几何与外观表征
图 1:QuerySplat 概览。对不同视角数量的未校准图像,QuerySplat 采用无姿态约束、前向传播且无需像素对齐的方式,重建出清晰且高保真度的3DGS场景。与现有方法相比,该方法能够生成结构更为连贯的场景,并可在数秒内处理真实场景下的输入图像。
爱知菜
17 天前
人工智能
·
深度学习
·
transformer
·
扩散模型
Transformer vs Diffusion:为什么扩散模型更擅长捕捉细节?
在近几年 AI 的发展中,Transformer 和 扩散模型 (Diffusion Model) 是两条重要的技术路线。它们都能生成语音、图像甚至音乐,但在效果上常常有一个直观的差别:Transformer 输出偏“粗”,扩散模型更擅长生成细节。这篇文章就用直观例子和数学原理来解释其中的原因。
数据猎手小k
18 天前
扩散模型
·
胎儿超声
·
edm2
·
合成数据增强
·
临床评估
首个将EDM2扩散架构引入胎儿超声:512×512高分辨率合成使下游分类准确率达93.36%-UltrasoundEDM2
2026年8月5日,由英国南安普顿大学(联合清华大学、伦敦国王学院、伦敦大学学院UCL-ARC)的研究团队提出了一个基于EDM2扩散架构的高分辨率胎儿超声图像合成框架。该框架在4个公开数据集上训练,生成512×512分辨率的6类解剖平面胎儿超声图像,总体FID从先前方法的176.85降至104.25(降低40.9%),下游胎儿平面分类在合成数据微调后集成准确率达93.36%,超过仅用真实数据训练的92.32%。一位10年以上经验的胎儿超声专家对100张图像的临床评估给出平均真实度2.67/5(真实图像3.
杀生丸学AI
19 天前
3d
·
三维重建
·
扩散模型
·
视觉大模型
·
高斯泼溅
·
前馈模型
·
大场景重建
【前馈三维重建】AdaptiveSplat:前馈重建的纹理感知可控3DGS分配方法(ECCV 2026)
图1:概述:给定输入图像和目标高斯预算,AdaptiveSplat可生成稀疏但高质量的重建结果----控制基本图元分配的同时,能够保持场景保真度的能力。相比之下,现有方法在高稀疏度下会出现伪影及过度平滑现象。
白拾
21 天前
扩散模型
·
论文分享
·
视频生成
·
开源大模型
·
wan 2.1 论文分享
·
dit 架构
·
arxiv 2025
【arXiv 2025】开源视频生成大模型 Wan 2.1|从视频生成开源基座视角
本文解读 arXiv 2025 论文《Wan: Open and Advanced Large-Scale Video Generative Models》。该论文提出Wan 2.1 开源视频生成大模型,通过融合DiT 架构、Flow Matching 训练与Wan-VAE 时空压缩,以 14B 旗舰 + 1.3B 消费级双规模覆盖 8 大生成任务,其特别之处在于全栈开源(代码 + 权重 + 数据管线 + 评测工具)并首个支持视频内中英双语文字生成。实验表明 Wan 14B 在 VBench 总分 86.
白拾
23 天前
扩散模型
·
世界模型
·
模仿学习
·
rss 2025
·
uwm 论文分享
·
机器人预训练
【RSS 2025】统一世界模型:耦合视频与动作扩散的机器人预训练|从扩散时间步设计视角
本文解读 RSS 2025 论文《Unified World Models: Coupling Video and Action Diffusion for Pretraining on Large Robotic Datasets》。该论文提出统一世界模型(UWM),通过融合动作扩散、未来观测视频扩散与独立扩散时间步设计,让同一个扩散 Transformer 同时充当策略、前向动力学、逆动力学与视频预测四种模型,其特别之处在于用噪声水平统一了 conditioning 与 marginalization
科研小刘带你玩学术
24 天前
人工智能
·
深度学习
·
计算机视觉
·
生成式ai
·
扩散模型
【学术干货】CVPR论文解析:扩散模型如何推动生成式人工智能进入新时代?
近年来,生成式人工智能快速发展。从AI绘画工具到文本生成视频系统,扩散模型(Diffusion Model)已经成为生成式AI领域的重要技术基础。
星云_byto
1 个月前
3d
·
扩散模型
·
3d目标检测
·
开放天气泛化
·
lidar-4d雷达融合
·
鲁棒感知
·
k-radar
DCDA:双评判器扩散对齐,开放天气LiDAR-4D雷达融合3D检测泛化新范式
🔥 本文定位:CSDN 原创干货 | 南京航空航天大学 开放天气鲁棒 3D 检测新范式🎯 核心收益:一次性解决"训练天气有限→测试天气无限"的开放世界泛化难题!基于 双评判器引导扩散对齐(DCDA),将退化 LiDAR 特征恢复到干净流形,检测引导评判器 + 天气对抗评判器双重约束,无需天气标签/配对数据即可泛化到未见天气类型和严重程度,LiDAR-4D Radar 融合 3D 检测全面超越 L4DR 和 V2X-R 基线,完美适配开放世界自动驾驶
CAE320
1 个月前
扩散模型
·
eit成像
·
unet网络
融合深度学习与传统方法的电阻抗成像各种计算框架
摘要:电阻抗层析成像(Electrical Impedance Tomography, EIT)是一种非侵入式成像技术,具有无辐射、高时间分辨率等优势,但其图像重建过程面临严重的非线性与病态性挑战。特别是在数据受限(Limited Data)的场景下,如 2023 年 Kuopio 断层扫描挑战赛(KTC 2023),传统算法往往难以获得高分辨率图像。本文介绍了一套通用的开源 EIT 重建框架,该框架集成了经典的 Tikhonov 正则化方法、基于卷积神经网络(CNN/UNet)的深度学习方法以及最前沿的
杀生丸学AI
1 个月前
人工智能
·
3d
·
数据挖掘
·
aigc
·
三维重建
·
扩散模型
·
视觉大模型
【三维重建】ArtiFixer:自回归扩散增强与扩展3DGS(NVIDIA)
图1. ArtiFixer高效且可扩展地增强3DGS结果。 给定初始重建结果、可选的参考视图及文本提示,该工具可通过自回归方法生成新的内容,同时保持与现有观测数据的高度一致性。ArtiFixer可在单次推理过程中直接生成数百个新视图,或作为伪监督数据用于优化底层三维重建效果。
机器学习之心
2 个月前
回归
·
gru
·
transformer
·
扩散模型
扩散模型遇上 Transformer-GRU:小样本场景下的回归预测新范式
当训练数据不足 200 条时,如何训练出一个测试 R² 接近 0.9 的回归模型?本文记录了一种将扩散模型(Diffusion Model)与 Transformer-GRU 混合架构相结合的技术方案,在仅有 178 条原始训练样本的条件下,通过合成数据增强与序列化建模,实现了优异的回归预测效果。
这张生成的图像能检测吗
2 个月前
人工智能
·
计算机视觉
·
故障诊断
·
扩散模型
(论文速读)REF-DDPM:一种新的基于DDPM的不平衡滚动轴承故障诊断数据增强方法
论文题目:ReF-DDPM: A novel DDPM-based data augmentation method for imbalanced rolling bearing fault diagnosis(一种新的基于DDPM的不平衡滚动轴承故障诊断数据增强方法)
君为先-bey
2 个月前
深度学习
·
扩散模型
·
视频生成
·
潜在扩散模型
LightningDiT----重建与生成:在潜在扩散模型中驯服优化困境
论文标题Reconstruction vs. Generation: Taming Optimization Dilemma in Latent Diffusion Models
君为先-bey
2 个月前
transformer
·
扩散模型
·
导航
·
具身智能
·
世界模型
·
条件扩散
NWM----导航世界模型
论文标题Navigation World Models作者Amir Bar, Gaoyue Zhou, Danny Tran, Trevor Darrell, Yann LeCun
科研小刘带你玩学术
3 个月前
扩散模型
·
图像生成
·
扩散transformer
·
解耦架构
·
条件编码器
·
速度解码器
学术干货|DDT:解耦扩散Transformer实现高效高质量图像生成
扩散模型(Diffusion Models)作为当前生成式AI领域最具影响力的技术范式之一,自2020年提出以来便以惊人的速度发展演进。与传统的生成对抗网络(GAN)和自回归模型(AR)相比,扩散模型在生成质量、多样性和训练稳定性方面展现出显著优势,已成为图像生成、视频合成、3D建模等任务的主流选择。 然而,扩散模型也面临着严峻的计算效率挑战。以经典的DDPM(Denoising Diffusion Probabilistic Models)为例,模型需要在推理阶段执行多达数百甚至上千步的去噪迭代,每次迭
机器学习之心
3 个月前
回归
·
lstm
·
transformer
·
扩散模型
扩散模型数据增强 + Transformer-LSTM 回归预测:小样本场景下的工业级解决方案
摘要:在小样本回归任务中,数据稀缺往往是制约模型性能的核心瓶颈。本文将扩散模型(Diffusion Model)作为数据生成引擎与 Transformer-LSTM 深度回归网络深度融合,构建了一套端到端的小样本增强预测框架。实验结果表明,经扩散模型数据增强后,Transformer-LSTM 回归模型在测试集上取得了 MAE = 1.0122、RMSE = 1.2945、R² = 0.9007 的优异性能,充分验证了该技术路线在工业小样本场景中的实用价值。
君为先-bey
3 个月前
计算机视觉
·
多模态
·
扩散模型
·
视频生成
UniVidX——基于扩散先验的统一多模态视频生成框架
UniVidX: A Unified Multimodal Framework for Versatile Video Generation via Diffusion Priors