技术栈
扩散模型
白拾
1 天前
扩散模型
·
论文分享
·
视频生成
·
开源大模型
·
wan 2.1 论文分享
·
dit 架构
·
arxiv 2025
【arXiv 2025】开源视频生成大模型 Wan 2.1|从视频生成开源基座视角
本文解读 arXiv 2025 论文《Wan: Open and Advanced Large-Scale Video Generative Models》。该论文提出Wan 2.1 开源视频生成大模型,通过融合DiT 架构、Flow Matching 训练与Wan-VAE 时空压缩,以 14B 旗舰 + 1.3B 消费级双规模覆盖 8 大生成任务,其特别之处在于全栈开源(代码 + 权重 + 数据管线 + 评测工具)并首个支持视频内中英双语文字生成。实验表明 Wan 14B 在 VBench 总分 86.
白拾
3 天前
扩散模型
·
世界模型
·
模仿学习
·
rss 2025
·
uwm 论文分享
·
机器人预训练
【RSS 2025】统一世界模型:耦合视频与动作扩散的机器人预训练|从扩散时间步设计视角
本文解读 RSS 2025 论文《Unified World Models: Coupling Video and Action Diffusion for Pretraining on Large Robotic Datasets》。该论文提出统一世界模型(UWM),通过融合动作扩散、未来观测视频扩散与独立扩散时间步设计,让同一个扩散 Transformer 同时充当策略、前向动力学、逆动力学与视频预测四种模型,其特别之处在于用噪声水平统一了 conditioning 与 marginalization
科研小刘带你玩学术
4 天前
人工智能
·
深度学习
·
计算机视觉
·
生成式ai
·
扩散模型
【学术干货】CVPR论文解析:扩散模型如何推动生成式人工智能进入新时代?
近年来,生成式人工智能快速发展。从AI绘画工具到文本生成视频系统,扩散模型(Diffusion Model)已经成为生成式AI领域的重要技术基础。
星云_byto
12 天前
3d
·
扩散模型
·
3d目标检测
·
开放天气泛化
·
lidar-4d雷达融合
·
鲁棒感知
·
k-radar
DCDA:双评判器扩散对齐,开放天气LiDAR-4D雷达融合3D检测泛化新范式
🔥 本文定位:CSDN 原创干货 | 南京航空航天大学 开放天气鲁棒 3D 检测新范式🎯 核心收益:一次性解决"训练天气有限→测试天气无限"的开放世界泛化难题!基于 双评判器引导扩散对齐(DCDA),将退化 LiDAR 特征恢复到干净流形,检测引导评判器 + 天气对抗评判器双重约束,无需天气标签/配对数据即可泛化到未见天气类型和严重程度,LiDAR-4D Radar 融合 3D 检测全面超越 L4DR 和 V2X-R 基线,完美适配开放世界自动驾驶
CAE320
12 天前
扩散模型
·
eit成像
·
unet网络
融合深度学习与传统方法的电阻抗成像各种计算框架
摘要:电阻抗层析成像(Electrical Impedance Tomography, EIT)是一种非侵入式成像技术,具有无辐射、高时间分辨率等优势,但其图像重建过程面临严重的非线性与病态性挑战。特别是在数据受限(Limited Data)的场景下,如 2023 年 Kuopio 断层扫描挑战赛(KTC 2023),传统算法往往难以获得高分辨率图像。本文介绍了一套通用的开源 EIT 重建框架,该框架集成了经典的 Tikhonov 正则化方法、基于卷积神经网络(CNN/UNet)的深度学习方法以及最前沿的
杀生丸学AI
24 天前
人工智能
·
3d
·
数据挖掘
·
aigc
·
三维重建
·
扩散模型
·
视觉大模型
【三维重建】ArtiFixer:自回归扩散增强与扩展3DGS(NVIDIA)
图1. ArtiFixer高效且可扩展地增强3DGS结果。 给定初始重建结果、可选的参考视图及文本提示,该工具可通过自回归方法生成新的内容,同时保持与现有观测数据的高度一致性。ArtiFixer可在单次推理过程中直接生成数百个新视图,或作为伪监督数据用于优化底层三维重建效果。
机器学习之心
1 个月前
回归
·
gru
·
transformer
·
扩散模型
扩散模型遇上 Transformer-GRU:小样本场景下的回归预测新范式
当训练数据不足 200 条时,如何训练出一个测试 R² 接近 0.9 的回归模型?本文记录了一种将扩散模型(Diffusion Model)与 Transformer-GRU 混合架构相结合的技术方案,在仅有 178 条原始训练样本的条件下,通过合成数据增强与序列化建模,实现了优异的回归预测效果。
这张生成的图像能检测吗
1 个月前
人工智能
·
计算机视觉
·
故障诊断
·
扩散模型
(论文速读)REF-DDPM:一种新的基于DDPM的不平衡滚动轴承故障诊断数据增强方法
论文题目:ReF-DDPM: A novel DDPM-based data augmentation method for imbalanced rolling bearing fault diagnosis(一种新的基于DDPM的不平衡滚动轴承故障诊断数据增强方法)
君为先-bey
2 个月前
深度学习
·
扩散模型
·
视频生成
·
潜在扩散模型
LightningDiT----重建与生成:在潜在扩散模型中驯服优化困境
论文标题Reconstruction vs. Generation: Taming Optimization Dilemma in Latent Diffusion Models
君为先-bey
2 个月前
transformer
·
扩散模型
·
导航
·
具身智能
·
世界模型
·
条件扩散
NWM----导航世界模型
论文标题Navigation World Models作者Amir Bar, Gaoyue Zhou, Danny Tran, Trevor Darrell, Yann LeCun
科研小刘带你玩学术
2 个月前
扩散模型
·
图像生成
·
扩散transformer
·
解耦架构
·
条件编码器
·
速度解码器
学术干货|DDT:解耦扩散Transformer实现高效高质量图像生成
扩散模型(Diffusion Models)作为当前生成式AI领域最具影响力的技术范式之一,自2020年提出以来便以惊人的速度发展演进。与传统的生成对抗网络(GAN)和自回归模型(AR)相比,扩散模型在生成质量、多样性和训练稳定性方面展现出显著优势,已成为图像生成、视频合成、3D建模等任务的主流选择。 然而,扩散模型也面临着严峻的计算效率挑战。以经典的DDPM(Denoising Diffusion Probabilistic Models)为例,模型需要在推理阶段执行多达数百甚至上千步的去噪迭代,每次迭
机器学习之心
2 个月前
回归
·
lstm
·
transformer
·
扩散模型
扩散模型数据增强 + Transformer-LSTM 回归预测:小样本场景下的工业级解决方案
摘要:在小样本回归任务中,数据稀缺往往是制约模型性能的核心瓶颈。本文将扩散模型(Diffusion Model)作为数据生成引擎与 Transformer-LSTM 深度回归网络深度融合,构建了一套端到端的小样本增强预测框架。实验结果表明,经扩散模型数据增强后,Transformer-LSTM 回归模型在测试集上取得了 MAE = 1.0122、RMSE = 1.2945、R² = 0.9007 的优异性能,充分验证了该技术路线在工业小样本场景中的实用价值。
君为先-bey
2 个月前
计算机视觉
·
多模态
·
扩散模型
·
视频生成
UniVidX——基于扩散先验的统一多模态视频生成框架
UniVidX: A Unified Multimodal Framework for Versatile Video Generation via Diffusion Priors
君为先-bey
2 个月前
强化学习
·
扩散模型
·
opd
DiffusionOPD——扩散模型中在线策略蒸馏的统一视角
DiffusionOPD: A Unified Perspective of On-Policy Distillation in Diffusion Models
君为先-bey
2 个月前
人工智能
·
深度学习
·
计算机视觉
·
扩散模型
·
图像生成
JointDiT:使用扩散变换器增强RGB-深度联合建模
JointDiT: Enhancing RGB-Depth Joint Modelingwith Diffusion Transformers
君为先-bey
2 个月前
人工智能
·
音视频
·
扩散模型
VideoReward: 人类反馈优化视频生成文献深度阅读分析
VideoReward: 人类反馈优化视频生成 文献深度阅读分析近年来,视频生成技术经历了革命性的发展,其中流匹配(Flow Matching)技术的崛起标志着这一领域进入了新的阶段。与传统的扩散模型通过逐步去噪生成数据不同,流匹配通过学习时间相关的速度场,建立从噪声分布到目标数据分布的直接映射。这种方法不仅简化了训练过程,还在生成质量和效率方面取得了显著进步。
君为先-bey
2 个月前
3d
·
音视频
·
扩散模型
CineMaster: 3D感知电影级视频生成框架文献深度阅读分析
CineMaster: 3D感知电影级视频生成框架 文献深度阅读分析近年来,文本到视频(Text-to-Video, T2V)生成技术经历了前所未有的快速发展。从早期的基于循环神经网络(RNN)和生成对抗网络(GAN)的方法,到扩散模型(Diffusion Models)和流匹配(Flow Matching)技术的崛起,视频生成质量得到了质的飞跃。特别是2024年以来,以Sora、可灵(Kling)、Pika等为代表的商业系统展示了令人惊叹的生成能力,能够根据文本描述生成长达数分钟、具有连贯叙事的高质量视
未知方程 无解
2 个月前
ai绘画
·
扩散模型
·
rtx4090
·
rxt4090显卡
我用RTX4090显卡训练了一个AI绘画模型
AI绘画的实现依赖于生成式模型对图像分布的建模能力。其中, 扩散模型 (Diffusion Models)通过逐步去噪生成高质量图像,其UNet结构需大量卷积运算; 变分自编码器 (VAE)负责潜在空间压缩与重建; 条件生成对抗网络 (cGAN)则通过判别器提升细节真实性。这些模型共同特点是参数量大、计算密集。
摘星编程
2 个月前
ai绘画
·
扩散模型
·
图像生成
·
多图融合
·
seedream4.0
豆包Seedream 4.0多图融合实力派:田园犬+三花猫多场景创作,AI绘画新时代来了!
🌟 Hello,我是摘星! 🌈 在彩虹般绚烂的技术栈中,我是那个永不停歇的色彩收集者。 🦋 每一个优化都是我培育的花朵,每一个特性都是我放飞的蝴蝶。 🔬 每一次代码审查都是我的显微镜观察,每一次重构都是我的化学实验。 🎵 在编程的交响乐中,我既是指挥家也是演奏者。让我们一起,在技术的音乐厅里,奏响属于程序员的华美乐章。