AI和大模型——扩展模型

一、AIGC

AI-Generated Content,简称AIGC。AI应用虽然火爆,但真正让普通人感觉到的,其实就是AIGC。至于其它更高深的应用比如军事、科研上,反而普通人的感知并不强烈。至少现在大家刷抖音,AI生成的图像和视频有比比皆是。

从大模型的角度来看,AIGC主要是依靠生成对抗网络 (GAN)、扩散模型、大语言模型等深度学习技术来实现现有数据学习后的新内容生成。

二、扩散模型

从上面的分析可以看到,扩散模型是实现AIGC的底层技术支撑之一。那么什么是扩散模型呢? Diffusion Model,扩散模型。它是AI底层生成技术的重要模型,它通过学习逆扩散去噪的过程,从随机噪声中生成数据的深度生成模型。

作为一种新兴的技术,它借鉴了原来自回归的传统方式的经验,迅速应用于各个应用领域。需要说明的是,扩散模型和大语言模型有各自擅长的领域。Transformer模型更适合于离散数据而扩散模型则更适合于处理连续空间的数据。正如前面所讲,它们都是生成式AI的重要技术,区别在于建模的方式有所不同。

现在的趋势是多模态模型融合二者的优势,在AIGC中起到更好的作用。

三、分析

扩散模型一般为成两步:

  1. 正向扩散过程
    所谓正向扩散,就让模型在学习过程中,如何逐步向目标(清晰图片或完整文字等)添加噪声,直到它变成包含一团完全的随机噪声的目标
  2. 反向去噪过程
    反向去噪则是指模型从包含随机噪声的目标,学习如何一步步地"去噪",并最终还原出清晰的图像或通顺完整的文字

说个不太恰当的比喻,它有点类似于把一滴墨水滴到清水中,形成一个污水;然后再反向分离墨水和清水的过程。可以理解扩散模型是一个前向加噪反向去噪的过程。它不依赖固定的顺序,而是并行的、整体的输出。看到这个后,就明白它的优势在哪里了吧。

四、应用场景和特点

扩散模型在AIGC领域应用非常广泛,主要包括:

  1. 图形图像生成处理
    这个是最为广泛的应用之一,生成新图像(海报、室内效果、绘画等等)、去背景、换风格等等
  2. 视频生成处理
    可以通过文本和图等来生成相关的视频,进行视频的后期处理如风格、补帧等等
  3. 音频和语音生成处理
    可以基于需求生成合成语音(现在小说的朗读语音)、音频处理(聒噪)、音频修复等等
  4. 3D建模
    可以提供3D建模、运动补全及轨迹生成等等
  5. 科学研究应用
    在科学研究中材料研究、分子研究等等都有重要的作用

对于扩散模型来说,它的优点主要是训练相对稳定、生成的目标质量好、可控性强;缺点是生成过程较慢(计算成本高)、受随机性影响较大、对细节把握受限。另外,它还受限于版权和法律例规以及相关的安全风险责任等等。

五、主流库和应用

对于扩散模型来说,现在最主流的库是Hugging Face Diffusers。它可以应用于使用文字、图形来生成新的图像或进行图像处理(局部重绘等),也可以用来进行音视频的生成。

而在应用领域中,推荐使用ComfyUI,其通过PyTorch-CUDA 针对NVIDIA GPU进行了深度优化。当然,它也可以使用AMD的GPU来进行相关的AIGC。

其它还有很多的库,如k-diffusion、OpenAI guided-diffusion等等,有兴趣可以自行查阅。

六、总结

AI技术的应用,已经开始向普通大众普及。作为开发者介于普通应用与AI技术底层的桥梁,有着至关重要的作用。如何能够更好的理解和利用底层技术,向用户输出更容易更简单快捷的AIGC应用是未来发展的一个重要方向。

另外,推荐一下CSDN上的AMD的AI开发者计划,确实不错。有时间的话还是看一看,整体还是不错的。

相关推荐
user-猴子10 分钟前
2026国产AI智能体七强横评:WorkBuddy、AiPy、悟空、Kimi Work、TRAE Work、QoderWork、百度搭子怎么选?
人工智能·百度·dubbo
IvanCodes8 小时前
RAG 实战教程(一):RAG 工作原理与完整流程——分片、索引、召回、重排和生成
人工智能·后端·agent
今天AI了吗8 小时前
合规场景下的 AI 推理可解释性:Attention 可视化与推理路径追踪的工程实践
人工智能
周末程序猿9 小时前
浅析大模型推理十二篇之KV Cache
人工智能
鱼樱前端9 小时前
用 AI 做内容变收入
前端·人工智能·ai编程
Dawson Zhu9 小时前
基于Palantir Foundry构建半导体制造AI友好型数据中台:从良率分析场景谈起
人工智能·语言模型·架构·制造·agi
fthux10 小时前
装闭 RenoPit 源码解析(04):装修图纸和合同文件上传处理流程
人工智能·ai·开源·github·open source·renopit
weixin_4462608511 小时前
从被动镜像到主动智能体:面向网络物理人工智能的整体论数字孪生(HDT-Net)
网络·人工智能
秋枫要学习11 小时前
你的鼠标,正在被 AI 抢走
人工智能·计算机外设