扩散模型

风巽·剑染春水3 天前
图像分割·扩散模型·医学影像·小样本
【技术追踪】SD-FSMIS:面向小样本医学图像分割的 Stable Diffusion 适配方法(CVPR-2026)利用 Stable Diffusion 的生成先验来做判别式的分割任务!论文:SD-FSMIS: Adapting Stable Diffusion for Few-Shot Medical Image Segmentation 代码:https://github.com/Galaxy-Knight-Lee/SD-FSMIS
四川兔兔3 天前
扩散模型·深度估计
Marigold v2论文讲解Marigold 论文讲解主要讲解论文的理论知识,而代码讲解是包含整体框架和实现细节。Marigold 目前有两个版本,这里我重点讲解一下最新的第二个版本。这是我把知识收集的地方,所有的领域基础哲学是有限的,变化是无限的。随着ai的发展,我发现有好多文献去看,好多技术去学习,但是实践过程交给ai,阅读量几乎是原来的十倍不止。柯洁说过,ai给我带来了便利,但是我们的工作时长却没有减少,甚至比以前更累。我发现我应该慢下来,而写文章的停顿,查阅资料整理,正是我慢下来,静下来的方法。这是论文连接。
这张生成的图像能检测吗4 天前
图像处理·人工智能·深度学习·计算机视觉·扩散模型·图像超分
(论文速读)FiDeSR:高保真保细节一步扩散超分辨率论文题目:FiDeSR: High-Fidelity and Detail-Preserving One-Step Diffusion Super-Resolution(FiDeSR:高保真保细节一步扩散超分辨率)
这张生成的图像能检测吗4 天前
扩散模型·视频生成
(论文速读)CogVideoX:用 3D Causal VAE 与 Expert Transformer 生成长时、高动态视频论文题目: CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer 中文翻译: CogVideoX:基于专家 Transformer 的文本到视频扩散模型 会议: ICLR 2025
TonyLee0175 天前
人工智能·扩散模型
扩散模型初探(二)接续上一篇笔记:扩散模型初探(一)。 这里主要探讨一下NCSN与DDPM。我看了一下论文研究时间,相差不久,作者都是尝试从去噪的角度去做的,过程看似不同,但最后数学上居然能统一起来。两者殊途同归,真是妙啊。。
这张生成的图像能检测吗7 天前
人工智能·扩散模型·视频生成·特征缓存·步骤蒸馏
(论文速读)DISCA:利用与蒸馏兼容的可学习特征缓存加速视频扩散转换器论文题目:DisCa: Accelerating Video Diffusion Transformers with Distillation-Compatible Learnable Feature Caching(DISCA:利用与蒸馏兼容的可学习特征缓存加速视频扩散转换器)
纪伊路上盛名在7 天前
扩散模型·采样·分子动力学模拟·蛋白质·稀有构象·转变路径·自由能鞍点
Gen-COMPAS 蛋白质稀有构象转变路径采样工具参考:https://github.com/Tangcyu/Gen-COMPAS 核心:扩散模型 + 迭代增强采样(committor 引导)找 A↔B 过渡态 / 反应路径
杀生丸学AI13 天前
人工智能·三维重建·扩散模型·4dgs·动态重建
【动态重建】Flow4DGS-SLAM:基于光流引导的4DGS-SLAM算法图 1:本方法可生成具有空间与时间上连贯的高斯运动效果的高质量渲染图像。标题:Flow4DGS-SLAM: Optical Flow-Guided 4D Gaussian Splatting SLAM 新加坡国立大学计算科学与信息学学院 链接:https://wangys16.github.io/Flow4DGS-SLAM.
这张生成的图像能检测吗15 天前
大模型·文生图·多模态·扩散模型·图像生成
(论文速读)Scaling Rectified Flow Transformers:Rectified Flow + MM-DiT 的高分辨率文生图路线论文题目: Scaling Rectified Flow Transformers for High-Resolution Image Synthesis 中文翻译: 用于高分辨率图像合成的可扩展 Rectified Flow Transformer 会议: ICML 2024
thesky1234561 个月前
大模型·文生图·diffusion·扩散模型·dit·自回归生成·多模态生成
27届大模型面试准备(四十六):多模态生成式架构——扩散与自回归的统一大模型的能力版图里,A14 讲了视觉语言模型(VLM,理解侧),A31 讲了多模态推理,A40 讲了多模态大模型训练与对齐,A44 讲了生成式世界模型与视频生成(偏"世界如何被模拟")。本文把镜头对准"生成范式"本身:同样是文生图、文生视频,底层为什么会出现自回归(Autoregressive, AR)和扩散(Diffusion)两条技术路线?它们各自擅长什么、又为什么正在相互靠拢?
白拾1 个月前
扩散模型·前馈模型·arxiv 2026·genception 论文分享·视频生成预训练·通用视觉感知
【arXiv 2026】GenCeption:视频生成模型是通用视觉学习者|从生成式视觉预训练范式视角本文解读 arXiv 2026 论文《Video Generation Models are General-Purpose Vision Learners》。该论文提出 GenCeption,把大规模文生视频扩散模型改造为单步前馈的通用视觉感知模型,通过统一 RGB 表示、可学习 token与统一 $L_2$ 损失,让 8 类稠密/稀疏任务共用一个骨干与解码器,其特别之处在于仅用纯合成视频数据训练,即全面超越各任务专用 SOTA。实验表明法向 Hi4D mAE 10.99、深度 Goliath AbsR
杀生丸学AI1 个月前
人工智能·3d·三维重建·扩散模型·高斯泼溅·空间智能·室内重建
【三维重建】QuerySplat:在 3DGS 预测中解耦几何与外观表征图 1:QuerySplat 概览。对不同视角数量的未校准图像,QuerySplat 采用无姿态约束、前向传播且无需像素对齐的方式,重建出清晰且高保真度的3DGS场景。与现有方法相比,该方法能够生成结构更为连贯的场景,并可在数秒内处理真实场景下的输入图像。
爱知菜1 个月前
人工智能·深度学习·transformer·扩散模型
Transformer vs Diffusion:为什么扩散模型更擅长捕捉细节?在近几年 AI 的发展中,Transformer 和 扩散模型 (Diffusion Model) 是两条重要的技术路线。它们都能生成语音、图像甚至音乐,但在效果上常常有一个直观的差别:Transformer 输出偏“粗”,扩散模型更擅长生成细节。这篇文章就用直观例子和数学原理来解释其中的原因。
数据猎手小k1 个月前
扩散模型·胎儿超声·edm2·合成数据增强·临床评估
首个将EDM2扩散架构引入胎儿超声:512×512高分辨率合成使下游分类准确率达93.36%-UltrasoundEDM22026年8月5日,由英国南安普顿大学(联合清华大学、伦敦国王学院、伦敦大学学院UCL-ARC)的研究团队提出了一个基于EDM2扩散架构的高分辨率胎儿超声图像合成框架。该框架在4个公开数据集上训练,生成512×512分辨率的6类解剖平面胎儿超声图像,总体FID从先前方法的176.85降至104.25(降低40.9%),下游胎儿平面分类在合成数据微调后集成准确率达93.36%,超过仅用真实数据训练的92.32%。一位10年以上经验的胎儿超声专家对100张图像的临床评估给出平均真实度2.67/5(真实图像3.
杀生丸学AI1 个月前
3d·三维重建·扩散模型·视觉大模型·高斯泼溅·前馈模型·大场景重建
【前馈三维重建】AdaptiveSplat:前馈重建的纹理感知可控3DGS分配方法(ECCV 2026)图1:概述:给定输入图像和目标高斯预算,AdaptiveSplat可生成稀疏但高质量的重建结果----控制基本图元分配的同时,能够保持场景保真度的能力。相比之下,现有方法在高稀疏度下会出现伪影及过度平滑现象。
白拾1 个月前
扩散模型·论文分享·视频生成·开源大模型·wan 2.1 论文分享·dit 架构·arxiv 2025
【arXiv 2025】开源视频生成大模型 Wan 2.1|从视频生成开源基座视角本文解读 arXiv 2025 论文《Wan: Open and Advanced Large-Scale Video Generative Models》。该论文提出Wan 2.1 开源视频生成大模型,通过融合DiT 架构、Flow Matching 训练与Wan-VAE 时空压缩,以 14B 旗舰 + 1.3B 消费级双规模覆盖 8 大生成任务,其特别之处在于全栈开源(代码 + 权重 + 数据管线 + 评测工具)并首个支持视频内中英双语文字生成。实验表明 Wan 14B 在 VBench 总分 86.
白拾1 个月前
扩散模型·世界模型·模仿学习·rss 2025·uwm 论文分享·机器人预训练
【RSS 2025】统一世界模型:耦合视频与动作扩散的机器人预训练|从扩散时间步设计视角本文解读 RSS 2025 论文《Unified World Models: Coupling Video and Action Diffusion for Pretraining on Large Robotic Datasets》。该论文提出统一世界模型(UWM),通过融合动作扩散、未来观测视频扩散与独立扩散时间步设计,让同一个扩散 Transformer 同时充当策略、前向动力学、逆动力学与视频预测四种模型,其特别之处在于用噪声水平统一了 conditioning 与 marginalization
科研小刘带你玩学术1 个月前
人工智能·深度学习·计算机视觉·生成式ai·扩散模型
【学术干货】CVPR论文解析:扩散模型如何推动生成式人工智能进入新时代?近年来,生成式人工智能快速发展。从AI绘画工具到文本生成视频系统,扩散模型(Diffusion Model)已经成为生成式AI领域的重要技术基础。
星云_byto2 个月前
3d·扩散模型·3d目标检测·开放天气泛化·lidar-4d雷达融合·鲁棒感知·k-radar
DCDA:双评判器扩散对齐,开放天气LiDAR-4D雷达融合3D检测泛化新范式🔥 本文定位:CSDN 原创干货 | 南京航空航天大学 开放天气鲁棒 3D 检测新范式🎯 核心收益:一次性解决"训练天气有限→测试天气无限"的开放世界泛化难题!基于 双评判器引导扩散对齐(DCDA),将退化 LiDAR 特征恢复到干净流形,检测引导评判器 + 天气对抗评判器双重约束,无需天气标签/配对数据即可泛化到未见天气类型和严重程度,LiDAR-4D Radar 融合 3D 检测全面超越 L4DR 和 V2X-R 基线,完美适配开放世界自动驾驶