扩散模型

智码看视界17 小时前
扩散模型·图像生成·本地部署·开源大模型·qwen-image-2.1·rgba透明
开源大模型追踪:Qwen-Image-2.1 :7B 视觉生成模型开源榜登顶 60.28,原生 RGBA 透明出图Qwen-Image-2.1 是阿里巴巴 Qwen 团队于 2026-09-20 开源的图像生成与编辑一体化模型,视觉生成部分为一个 7B 参数的 32 层单流 DiT,搭配 Qwen3-VL 8B 文本编码器与 64 通道 RGBA VAE。BF16 全量权重约 33GB,INT8 量化栈可压到约 14GB,Unsloth 的 Q4_K_M GGUF 甚至能在 12GB 显存上跑通;vLLM-Omni 在 1024² 40 步下实测约 3.3–4.5 秒/张(厂商数据)。它最大亮点是原生 RGBA 透明
这张生成的图像能检测吗21 小时前
人工智能·计算机视觉·扩散模型·超分辨率
(论文速读)一种用于图像超分辨率的有效扩散变换结构论文题目:Effective Diffusion Transformer Architecture for Image Super-Resolution(一种用于图像超分辨率的有效扩散变换结构)
这张生成的图像能检测吗2 天前
扩散模型·图像生成·卷积
(论文速读)FCDM:ConvNeXt 也能做高效扩散模型,卷积网络重新挑战 DiT论文题目: Reviving ConvNeXt for Efficient Convolutional Diffusion Models 中文翻译: 重振 ConvNeXt:面向高效卷积扩散模型的架构设计 会议: CVPR 2026
Rocky Ding*3 天前
论文阅读·人工智能·深度学习·机器学习·aigc·扩散模型·ai-native
深入浅出完整解析FLUX.2、Seedream(即梦)、Z-image、Qwen-Image、GLM-Image核心基础知识欢迎大家关注Rocky的知乎:Rocky Ding 《三年面试五年模拟》AIGC/LLM/AI Agent算法工程师/开发工程师求职面试秘籍独家资源:【三年面试五年模拟】WeThinkIn/AIGC-Interview-Book,欢迎大家Star~
山顶夕景3 天前
机器人·多模态·扩散模型·具身智能·vla·dit·vlm
【VLA】Qwen-VLA:VLM+DiT统一多模态理解与连续机器人动作生成Qwen-VLA 的做法,不是声称"把所有机器人统一成一种动作",而是用 Qwen3.5-4B 视觉—语言骨干 + 约 1.15B 参数的 DiT 流匹配动作专家 + 一套 H×K 张量/前缀掩码/具身提示的接口,把操作、导航、人本动作、轨迹预测接进同一个条件生成框架。
一穷二白到年薪百万8 天前
扩散模型
【流匹配模型Flow Maching】流匹配模型入门理解(3)下面在这个代码的基础上 【流匹配模型Flow Maching】流匹配模型入门理解(2),讲一下条件流模型。
梦想的初衷~9 天前
深度学习·transformer·扩散模型·遥感影像处理·图神经网络gnn·pytorch实战·pinn正反问题
深度学习全栈技术复盘:PINN科学计算、Transformer多场景建模、GNN时空网络与强化学习工业实战当前,科学研究正经历”数据驱动”与”机理驱动”双轮融合的深刻范式变革。一方面,观测、监测与遥感数据呈指数级增长,传统建模方式难以从中提炼可靠知识;另一方面,数值模拟模型日益复杂,率定成本高企,且模型内部机理难以被纯数据方法替代。高校与科研院所的研究者普遍面临三重挑战:物理方程与深度学习两套话语体系割裂,PINN等融合方法门槛高、落地少;Transformer、图神经网络、强化学习等前沿架构概念繁多,跨领域迁移路径不清晰;模型率定、超参调优与结果解释环节仍依赖经验试错,进化计算等系统化方法论支撑。在此背景下
风巽·剑染春水10 天前
人工智能·生成对抗网络·扩散模型·mri
【医学AI前沿】(NPJ-DM-2026)利用身份保持去噪扩散生成对抗网络预测阿尔茨海默病进展数字孪生脑:用 AI 提前看见阿尔茨海默病的大脑未来!论文:Forecasting Alzheimer’s disease progression via identity-preserved denoising diffusion generative adversarial network 代码:https://github.com/zhonghuajiuzhou12138/DDGAN
一穷二白到年薪百万10 天前
扩散模型
【流匹配模型Flow Maching】流匹配模型入门理解(2)之前已经介绍过DDMP以及流模型见如下四篇链接: 【扩散模型DDPM】扩散模型入门理解(1), 【扩散模型DDPM】扩散模型入门理解(2),【扩散模型DDPM】扩散模型入门理解(3),【流匹配模型Flow Maching】流匹配模型入门理解(1)现在看一下流模型的代码,这个代码在DDPM代码的基础上比较好理解,见扩散模型理解(3)。
这张生成的图像能检测吗11 天前
人工智能·lora·扩散模型·高分辨率成像·结构健康监测
(论文速读)DI-CDM:微调条件扩散模型在结构健康监测中的损伤成像论文题目:Damage imaging in structural health monitoring with fine-tuned conditional diffusion model(微调条件扩散模型在结构健康监测中的损伤成像)
一穷二白到年薪百万20 天前
扩散模型
【扩散模型DDPM】扩散模型入门理解(2)接着上篇 【扩散模型DDPM】扩散模型入门理解(1),理解完成噪声生成的推导,模型训练之后。那么当模型训练完成之后如何生成呢,毕竟模型唯一个一个预测功能是噪声预测,而且上一个小节明确说了,模型训练完成之后,随机采样一个噪声去预测,但是用噪声预测网络去预测噪声没啥用啊。下面我们深入分析这个问题。
一穷二白到年薪百万20 天前
扩散模型
【扩散模型DDPM】扩散模型入门理解(1)DDPM乍一看非常复杂各种推导公式,变分推断等。但是直接从本质理解并不是很麻烦,先不考虑背后的复杂原理和数学基础,单纯从代码角度理解是非常容易的。DDPM就是两个过程,第一个过程是数据加噪在这个过程中涉及到加噪公式的推导。第二个是数据训练也就是噪声预测,这个过程是让模型学会如何预测噪声即学会去噪。当了解这个过程之后,就明白了什么是经典DDPM,还有就是基于这个过程的各种改进。
风巽·剑染春水23 天前
图像分割·扩散模型·医学影像·小样本
【技术追踪】SD-FSMIS:面向小样本医学图像分割的 Stable Diffusion 适配方法(CVPR-2026)利用 Stable Diffusion 的生成先验来做判别式的分割任务!论文:SD-FSMIS: Adapting Stable Diffusion for Few-Shot Medical Image Segmentation 代码:https://github.com/Galaxy-Knight-Lee/SD-FSMIS
四川兔兔23 天前
扩散模型·深度估计
Marigold v2论文讲解Marigold 论文讲解主要讲解论文的理论知识,而代码讲解是包含整体框架和实现细节。Marigold 目前有两个版本,这里我重点讲解一下最新的第二个版本。这是我把知识收集的地方,所有的领域基础哲学是有限的,变化是无限的。随着ai的发展,我发现有好多文献去看,好多技术去学习,但是实践过程交给ai,阅读量几乎是原来的十倍不止。柯洁说过,ai给我带来了便利,但是我们的工作时长却没有减少,甚至比以前更累。我发现我应该慢下来,而写文章的停顿,查阅资料整理,正是我慢下来,静下来的方法。这是论文连接。
这张生成的图像能检测吗24 天前
图像处理·人工智能·深度学习·计算机视觉·扩散模型·图像超分
(论文速读)FiDeSR:高保真保细节一步扩散超分辨率论文题目:FiDeSR: High-Fidelity and Detail-Preserving One-Step Diffusion Super-Resolution(FiDeSR:高保真保细节一步扩散超分辨率)
这张生成的图像能检测吗24 天前
扩散模型·视频生成
(论文速读)CogVideoX:用 3D Causal VAE 与 Expert Transformer 生成长时、高动态视频论文题目: CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer 中文翻译: CogVideoX:基于专家 Transformer 的文本到视频扩散模型 会议: ICLR 2025
TonyLee01725 天前
人工智能·扩散模型
扩散模型初探(二)接续上一篇笔记:扩散模型初探(一)。 这里主要探讨一下NCSN与DDPM。我看了一下论文研究时间,相差不久,作者都是尝试从去噪的角度去做的,过程看似不同,但最后数学上居然能统一起来。两者殊途同归,真是妙啊。。
这张生成的图像能检测吗1 个月前
人工智能·扩散模型·视频生成·特征缓存·步骤蒸馏
(论文速读)DISCA:利用与蒸馏兼容的可学习特征缓存加速视频扩散转换器论文题目:DisCa: Accelerating Video Diffusion Transformers with Distillation-Compatible Learnable Feature Caching(DISCA:利用与蒸馏兼容的可学习特征缓存加速视频扩散转换器)
纪伊路上盛名在1 个月前
扩散模型·采样·分子动力学模拟·蛋白质·稀有构象·转变路径·自由能鞍点
Gen-COMPAS 蛋白质稀有构象转变路径采样工具参考:https://github.com/Tangcyu/Gen-COMPAS 核心:扩散模型 + 迭代增强采样(committor 引导)找 A↔B 过渡态 / 反应路径
杀生丸学AI1 个月前
人工智能·三维重建·扩散模型·4dgs·动态重建
【动态重建】Flow4DGS-SLAM:基于光流引导的4DGS-SLAM算法图 1:本方法可生成具有空间与时间上连贯的高斯运动效果的高质量渲染图像。标题:Flow4DGS-SLAM: Optical Flow-Guided 4D Gaussian Splatting SLAM 新加坡国立大学计算科学与信息学学院 链接:https://wangys16.github.io/Flow4DGS-SLAM.