扩散模型

白拾1 天前
扩散模型·论文分享·视频生成·开源大模型·wan 2.1 论文分享·dit 架构·arxiv 2025
【arXiv 2025】开源视频生成大模型 Wan 2.1|从视频生成开源基座视角本文解读 arXiv 2025 论文《Wan: Open and Advanced Large-Scale Video Generative Models》。该论文提出Wan 2.1 开源视频生成大模型,通过融合DiT 架构、Flow Matching 训练与Wan-VAE 时空压缩,以 14B 旗舰 + 1.3B 消费级双规模覆盖 8 大生成任务,其特别之处在于全栈开源(代码 + 权重 + 数据管线 + 评测工具)并首个支持视频内中英双语文字生成。实验表明 Wan 14B 在 VBench 总分 86.
白拾3 天前
扩散模型·世界模型·模仿学习·rss 2025·uwm 论文分享·机器人预训练
【RSS 2025】统一世界模型:耦合视频与动作扩散的机器人预训练|从扩散时间步设计视角本文解读 RSS 2025 论文《Unified World Models: Coupling Video and Action Diffusion for Pretraining on Large Robotic Datasets》。该论文提出统一世界模型(UWM),通过融合动作扩散、未来观测视频扩散与独立扩散时间步设计,让同一个扩散 Transformer 同时充当策略、前向动力学、逆动力学与视频预测四种模型,其特别之处在于用噪声水平统一了 conditioning 与 marginalization
科研小刘带你玩学术4 天前
人工智能·深度学习·计算机视觉·生成式ai·扩散模型
【学术干货】CVPR论文解析:扩散模型如何推动生成式人工智能进入新时代?近年来,生成式人工智能快速发展。从AI绘画工具到文本生成视频系统,扩散模型(Diffusion Model)已经成为生成式AI领域的重要技术基础。
星云_byto12 天前
3d·扩散模型·3d目标检测·开放天气泛化·lidar-4d雷达融合·鲁棒感知·k-radar
DCDA:双评判器扩散对齐,开放天气LiDAR-4D雷达融合3D检测泛化新范式🔥 本文定位:CSDN 原创干货 | 南京航空航天大学 开放天气鲁棒 3D 检测新范式🎯 核心收益:一次性解决"训练天气有限→测试天气无限"的开放世界泛化难题!基于 双评判器引导扩散对齐(DCDA),将退化 LiDAR 特征恢复到干净流形,检测引导评判器 + 天气对抗评判器双重约束,无需天气标签/配对数据即可泛化到未见天气类型和严重程度,LiDAR-4D Radar 融合 3D 检测全面超越 L4DR 和 V2X-R 基线,完美适配开放世界自动驾驶
CAE32012 天前
扩散模型·eit成像·unet网络
融合深度学习与传统方法的电阻抗成像各种计算框架摘要:电阻抗层析成像(Electrical Impedance Tomography, EIT)是一种非侵入式成像技术,具有无辐射、高时间分辨率等优势,但其图像重建过程面临严重的非线性与病态性挑战。特别是在数据受限(Limited Data)的场景下,如 2023 年 Kuopio 断层扫描挑战赛(KTC 2023),传统算法往往难以获得高分辨率图像。本文介绍了一套通用的开源 EIT 重建框架,该框架集成了经典的 Tikhonov 正则化方法、基于卷积神经网络(CNN/UNet)的深度学习方法以及最前沿的
杀生丸学AI24 天前
人工智能·3d·数据挖掘·aigc·三维重建·扩散模型·视觉大模型
【三维重建】ArtiFixer:自回归扩散增强与扩展3DGS(NVIDIA)图1. ArtiFixer高效且可扩展地增强3DGS结果。 给定初始重建结果、可选的参考视图及文本提示,该工具可通过自回归方法生成新的内容,同时保持与现有观测数据的高度一致性。ArtiFixer可在单次推理过程中直接生成数百个新视图,或作为伪监督数据用于优化底层三维重建效果。
机器学习之心1 个月前
回归·gru·transformer·扩散模型
扩散模型遇上 Transformer-GRU:小样本场景下的回归预测新范式当训练数据不足 200 条时,如何训练出一个测试 R² 接近 0.9 的回归模型?本文记录了一种将扩散模型(Diffusion Model)与 Transformer-GRU 混合架构相结合的技术方案,在仅有 178 条原始训练样本的条件下,通过合成数据增强与序列化建模,实现了优异的回归预测效果。
这张生成的图像能检测吗1 个月前
人工智能·计算机视觉·故障诊断·扩散模型
(论文速读)REF-DDPM:一种新的基于DDPM的不平衡滚动轴承故障诊断数据增强方法论文题目:ReF-DDPM: A novel DDPM-based data augmentation method for imbalanced rolling bearing fault diagnosis(一种新的基于DDPM的不平衡滚动轴承故障诊断数据增强方法)
君为先-bey2 个月前
深度学习·扩散模型·视频生成·潜在扩散模型
LightningDiT----重建与生成:在潜在扩散模型中驯服优化困境论文标题Reconstruction vs. Generation: Taming Optimization Dilemma in Latent Diffusion Models
君为先-bey2 个月前
transformer·扩散模型·导航·具身智能·世界模型·条件扩散
NWM----导航世界模型论文标题Navigation World Models作者Amir Bar, Gaoyue Zhou, Danny Tran, Trevor Darrell, Yann LeCun
科研小刘带你玩学术2 个月前
扩散模型·图像生成·扩散transformer·解耦架构·条件编码器·速度解码器
学术干货|DDT:解耦扩散Transformer实现高效高质量图像生成扩散模型(Diffusion Models)作为当前生成式AI领域最具影响力的技术范式之一,自2020年提出以来便以惊人的速度发展演进。与传统的生成对抗网络(GAN)和自回归模型(AR)相比,扩散模型在生成质量、多样性和训练稳定性方面展现出显著优势,已成为图像生成、视频合成、3D建模等任务的主流选择。 然而,扩散模型也面临着严峻的计算效率挑战。以经典的DDPM(Denoising Diffusion Probabilistic Models)为例,模型需要在推理阶段执行多达数百甚至上千步的去噪迭代,每次迭
机器学习之心2 个月前
回归·lstm·transformer·扩散模型
扩散模型数据增强 + Transformer-LSTM 回归预测:小样本场景下的工业级解决方案摘要:在小样本回归任务中,数据稀缺往往是制约模型性能的核心瓶颈。本文将扩散模型(Diffusion Model)作为数据生成引擎与 Transformer-LSTM 深度回归网络深度融合,构建了一套端到端的小样本增强预测框架。实验结果表明,经扩散模型数据增强后,Transformer-LSTM 回归模型在测试集上取得了 MAE = 1.0122、RMSE = 1.2945、R² = 0.9007 的优异性能,充分验证了该技术路线在工业小样本场景中的实用价值。
君为先-bey2 个月前
计算机视觉·多模态·扩散模型·视频生成
UniVidX——基于扩散先验的统一多模态视频生成框架UniVidX: A Unified Multimodal Framework for Versatile Video Generation via Diffusion Priors
君为先-bey2 个月前
强化学习·扩散模型·opd
DiffusionOPD——扩散模型中在线策略蒸馏的统一视角DiffusionOPD: A Unified Perspective of On-Policy Distillation in Diffusion Models
君为先-bey2 个月前
人工智能·深度学习·计算机视觉·扩散模型·图像生成
JointDiT:使用扩散变换器增强RGB-深度联合建模JointDiT: Enhancing RGB-Depth Joint Modelingwith Diffusion Transformers
君为先-bey2 个月前
人工智能·音视频·扩散模型
VideoReward: 人类反馈优化视频生成文献深度阅读分析VideoReward: 人类反馈优化视频生成 文献深度阅读分析近年来,视频生成技术经历了革命性的发展,其中流匹配(Flow Matching)技术的崛起标志着这一领域进入了新的阶段。与传统的扩散模型通过逐步去噪生成数据不同,流匹配通过学习时间相关的速度场,建立从噪声分布到目标数据分布的直接映射。这种方法不仅简化了训练过程,还在生成质量和效率方面取得了显著进步。
君为先-bey2 个月前
3d·音视频·扩散模型
CineMaster: 3D感知电影级视频生成框架文献深度阅读分析CineMaster: 3D感知电影级视频生成框架 文献深度阅读分析近年来,文本到视频(Text-to-Video, T2V)生成技术经历了前所未有的快速发展。从早期的基于循环神经网络(RNN)和生成对抗网络(GAN)的方法,到扩散模型(Diffusion Models)和流匹配(Flow Matching)技术的崛起,视频生成质量得到了质的飞跃。特别是2024年以来,以Sora、可灵(Kling)、Pika等为代表的商业系统展示了令人惊叹的生成能力,能够根据文本描述生成长达数分钟、具有连贯叙事的高质量视
未知方程 无解2 个月前
ai绘画·扩散模型·rtx4090·rxt4090显卡
我用RTX4090显卡训练了一个AI绘画模型AI绘画的实现依赖于生成式模型对图像分布的建模能力。其中, 扩散模型 (Diffusion Models)通过逐步去噪生成高质量图像,其UNet结构需大量卷积运算; 变分自编码器 (VAE)负责潜在空间压缩与重建; 条件生成对抗网络 (cGAN)则通过判别器提升细节真实性。这些模型共同特点是参数量大、计算密集。
摘星编程2 个月前
ai绘画·扩散模型·图像生成·多图融合·seedream4.0
豆包Seedream 4.0多图融合实力派:田园犬+三花猫多场景创作,AI绘画新时代来了!🌟 Hello,我是摘星! 🌈 在彩虹般绚烂的技术栈中,我是那个永不停歇的色彩收集者。 🦋 每一个优化都是我培育的花朵,每一个特性都是我放飞的蝴蝶。 🔬 每一次代码审查都是我的显微镜观察,每一次重构都是我的化学实验。 🎵 在编程的交响乐中,我既是指挥家也是演奏者。让我们一起,在技术的音乐厅里,奏响属于程序员的华美乐章。