ai数字人音频停顿处理,删除无用音频段

您当前的算法中,当静音段被缩短时,生成的静音样本数量是通过比例缩放计算出来的。但这个方法可能会导致一些音频失真,从而产生"沙沙"的噪音。这是因为在处理静音段时,使用了简单的零填充方式,导致音频数据出现突变,从而产生不自然的声音。

为了改进这个算法,可以采用以下思路:

平滑处理:在静音段过渡到有声音的段落时,使用平滑过渡的方式来避免突变,减少噪音。

减少零填充:在静音段缩短时,可以使用更接近原始音频特性的方式来填充缩短后的静音部分,而不是简单地使用零填充。

public static byte\[\] ScaleSilence(byte\[\] inputFile, float silenceThreshold = 0.01f, int silenceDurationMs = 200, int targetSilenceDurationMs = 100)

{

using (var reader = new MyAudioFileReader(inputFile))

{

var samples = new List();

int sampleRate = reader.WaveFormat.SampleRate;

int channels = reader.WaveFormat.Channels;

int silenceSampleCountThreshold = (int)(sampleRate * channels * (silenceDurationMs / 1000.0));

float\[\] buffer = new floatsampleRate \* channels;

int samplesRead;

int silentSampleCount = 0;

List silentSamples = new List();

复制代码
    while ((samplesRead = reader.Read(buffer, 0, buffer.Length)) > 0)
    {
        for (int i = 0; i < samplesRead; i++)
        {
            if (Math.Abs(buffer[i]) <= silenceThreshold)
            {
                silentSampleCount++;
                silentSamples.Add(buffer[i]);
            }
            else
            {
                if (silentSampleCount >= silenceSampleCountThreshold)
                {
                    // 计算缩放比例
                    double scale = (double)targetSilenceDurationMs / (silenceDurationMs * (silentSampleCount / (double)silenceSampleCountThreshold));
                    int samplesToKeep = (int)(silentSampleCount * scale);

                    // 使用渐变过渡来处理缩短后的静音部分
                    for (int j = 0; j < samplesToKeep; j++)
                    {
                        float transitionSample = silentSamples[(int)((j / (float)samplesToKeep) * silentSampleCount)];
                        samples.Add(transitionSample);
                    }
                }
                else
                {
                    // 如果静音部分不足以达到阈值,则不做缩短处理,直接添加原始静音样本
                    samples.AddRange(silentSamples);
                }

                silentSampleCount = 0;
                silentSamples.Clear();
                samples.Add(buffer[i]);
            }
        }
    }

    // 保存处理后的音频
    return SaveToBuferr(samples.ToArray(), reader.WaveFormat);
}

}

改进要点:

平滑处理:改进后的代码在静音段的处理上引入了渐变过渡,而不是直接使用零填充。通过逐步调整静音样本的值,可以平滑地过渡到有声音的部分,避免突变带来的噪音。

静音缩短比例:在缩短静音段时,保留了一部分原始的静音样本,通过对样本进行插值计算(逐渐增加或减少静音样本的强度),避免了沙沙噪音的出现。

以上方法能够减少音频失真并有效移除静音部分,同时避免沙沙的噪音。

相关推荐
stuartevil42 分钟前
AI图生视频常见坑:参考图风格不一致怎么解决
人工智能·深度学习·音视频
贾宝玉的玉宝贾2 小时前
FreeSWITCH 简单图形化界面 63 - 编写 mod_avsource 模块,将 RTSP/RTMP 源桥接为视频通道
音视频·voip·freeswitch·ippbx·pbx·sip通信
Blockchina2 小时前
5个开源AI视频项目怎么选?从脚本、分镜到Shorts和剪映自动化
人工智能·开源·音视频
要开心吖ZSH3 小时前
腾讯 IM × TRTC 联动实战:后端如何撑起一次视频问诊(混流录制篇)
java·音视频·腾讯云·健康医疗·即时通讯·im
jike_202613 小时前
iPhone采访录音同时拍现场照片的APP:图片音频同步记录实测
笔记·智能手机·音视频·语音识别
小猴子爱上树14 小时前
跨境电商翻译工具推荐:批量图片翻译、视频字幕翻译、智能抠图一站式搞定
人工智能·python·音视频
林澈在路上14 小时前
AI翻唱软件哪个好 2026国产AI写歌工具对比推荐
大数据·人工智能·深度学习·github·aigc·音视频·音频
阿童木写作15 小时前
跨马翻译:AI批量图片翻译与视频字幕翻译工具推荐
人工智能·python·音视频
Dovis(誓平步青云)16 小时前
折叠屏悬停看视频,上半屏和下半屏应该各做什么
android·java·服务器·开发语言·安全·音视频
敢敢のwings21 小时前
Wan2.2 模型系统解读:从视频扩散到 WAM 世界模型模块
音视频