一、AIGC
AI-Generated Content,简称AIGC。AI应用虽然火爆,但真正让普通人感觉到的,其实就是AIGC。至于其它更高深的应用比如军事、科研上,反而普通人的感知并不强烈。至少现在大家刷抖音,AI生成的图像和视频有比比皆是。
从大模型的角度来看,AIGC主要是依靠生成对抗网络 (GAN)、扩散模型、大语言模型等深度学习技术来实现现有数据学习后的新内容生成。
二、扩散模型
从上面的分析可以看到,扩散模型是实现AIGC的底层技术支撑之一。那么什么是扩散模型呢? Diffusion Model,扩散模型。它是AI底层生成技术的重要模型,它通过学习逆扩散去噪的过程,从随机噪声中生成数据的深度生成模型。
作为一种新兴的技术,它借鉴了原来自回归的传统方式的经验,迅速应用于各个应用领域。需要说明的是,扩散模型和大语言模型有各自擅长的领域。Transformer模型更适合于离散数据而扩散模型则更适合于处理连续空间的数据。正如前面所讲,它们都是生成式AI的重要技术,区别在于建模的方式有所不同。
现在的趋势是多模态模型融合二者的优势,在AIGC中起到更好的作用。
三、分析
扩散模型一般为成两步:
- 正向扩散过程
所谓正向扩散,就让模型在学习过程中,如何逐步向目标(清晰图片或完整文字等)添加噪声,直到它变成包含一团完全的随机噪声的目标 - 反向去噪过程
反向去噪则是指模型从包含随机噪声的目标,学习如何一步步地"去噪",并最终还原出清晰的图像或通顺完整的文字
说个不太恰当的比喻,它有点类似于把一滴墨水滴到清水中,形成一个污水;然后再反向分离墨水和清水的过程。可以理解扩散模型是一个前向加噪反向去噪的过程。它不依赖固定的顺序,而是并行的、整体的输出。看到这个后,就明白它的优势在哪里了吧。
四、应用场景和特点
扩散模型在AIGC领域应用非常广泛,主要包括:
- 图形图像生成处理
这个是最为广泛的应用之一,生成新图像(海报、室内效果、绘画等等)、去背景、换风格等等 - 视频生成处理
可以通过文本和图等来生成相关的视频,进行视频的后期处理如风格、补帧等等 - 音频和语音生成处理
可以基于需求生成合成语音(现在小说的朗读语音)、音频处理(聒噪)、音频修复等等 - 3D建模
可以提供3D建模、运动补全及轨迹生成等等 - 科学研究应用
在科学研究中材料研究、分子研究等等都有重要的作用
对于扩散模型来说,它的优点主要是训练相对稳定、生成的目标质量好、可控性强;缺点是生成过程较慢(计算成本高)、受随机性影响较大、对细节把握受限。另外,它还受限于版权和法律例规以及相关的安全风险责任等等。
五、主流库和应用
对于扩散模型来说,现在最主流的库是Hugging Face Diffusers。它可以应用于使用文字、图形来生成新的图像或进行图像处理(局部重绘等),也可以用来进行音视频的生成。
而在应用领域中,推荐使用ComfyUI,其通过PyTorch-CUDA 针对NVIDIA GPU进行了深度优化。当然,它也可以使用AMD的GPU来进行相关的AIGC。
其它还有很多的库,如k-diffusion、OpenAI guided-diffusion等等,有兴趣可以自行查阅。
六、总结
AI技术的应用,已经开始向普通大众普及。作为开发者介于普通应用与AI技术底层的桥梁,有着至关重要的作用。如何能够更好的理解和利用底层技术,向用户输出更容易更简单快捷的AIGC应用是未来发展的一个重要方向。
另外,推荐一下CSDN上的AMD的AI开发者计划,确实不错。有时间的话还是看一看,整体还是不错的。