我们比较这两个之后就会发现,双讲段主要出现在中间这一段。我们评估双讲性能的主要指标是回声抑制比和近端语音失真度。上面这是经过回声消除之后的语谱,中间的是NLMS算法的结果。我们可以看到它的回声抑制不是很理想,不管在单讲段还是在双讲段,都有比较多的回声残留。而下面这个是采用双耦合算法得到的语谱,可以看到在单讲和双讲里面回声抑制得都比较干净,并且在双讲里,对近端语音的损伤也很小。这个数据对应视频会议场景,因此还需要做一步NLP的处理。上面这个就是基于双耦合算法,做了NLP之后的输出结果。我们可以看到处理完之后,整个语谱很清晰,回声去得很干净,而且语谱没有太大损伤,双讲很通透。我再来简单总结一下,主要是介绍了三个方面的内容,个就是认识了非线性声学回声、产生的原因、研究现状以及技术难点。接下来重点介绍了华为云音视频的双耦合声学回声消除算法,我们的主要贡献体现在两个方面,个方面就是构建一种双耦合自适应滤波器结构;第二个就是提出了小平均短时累计误差准则并进行求解。通过求解之后,我们会得到双耦合滤波器的线性滤波器是具有Wiener-Hopf方程解的比较好解这种形式,然后非线性滤波器具有小二乘解。实现对整个声学回声路径的变化进行有效跟进。江苏语音交互声学回声降噪算法
n)为加混响的远端参考信号x(n)+近端语音信号s(n)。理论上NLMS在处理这种纯线性叠加的信号时,可以不用非线性部分出马,直接干掉远端回声信号。图7(a)行为近端信号d(n),第二列为远端参考信号x(n),线性部分输出结果,黄色框中为远端信号。WebRTCAEC中采用固定步长的NLMS算法收敛较慢,有些许回声残留。但是变步长的NLMS收敛较快,回声抑制相对好一些,如图7(b)。线性滤波器参数设置#defineFRAME_LEN80#definePART_LEN64enum{kExtendedNumPartitions=32};staticconstintkNormalNumPartitions=12;FRAME_LEN为每次传给音频3A模块的数据的长度,默认为80个采样点,由于WebRTCAEC采用了128点FFT,内部拼帧逻辑会取出PART_LEN=64个样本点与前一帧剩余数据连接成128点做FFT,剩余的16点遗留到下一次,因此实际每次处理PART_LEN个样本点(4ms数据)。默认滤波器阶数为kNormalNumPartitions=12个,能够覆盖的数据范围为kNormalNumPartitions*4ms=48ms,如果打开扩展滤波器模式(设置extended_filter_enabled为true),覆盖数据范围为kNormalNumPartitions*4ms=132ms。随着芯片处理能力的提升,默认会打开这个扩展滤波器模式,甚至扩展为更高的阶数。
浙江机器人唤醒声学回声祛混响算法搜索“声学回声消除”的相关文献。
一是恼人的异常音往往是比较轻微的,由于人工听音存在主观辨识性的问题,对于这类轻微的异常音疏于判断,但是终端客户可能不接受;二是在于产线测试环境嘈杂,普通的测试设备易受干扰,人耳对低阶次谐波的失真不敏感,所以在低阶的谐波失真导致的异音可能无法听出,但仪器有可能测出,从而导致误测,生产效率降低。要想准确检测出异常音,高性能的硬件采集和的软件算法缺一不可。指南测控的标准声学测试系统,通过规范的配备自研的高精度的测试传感器、高隔离度的环境环境、高灵敏度的GT-BT216C音频分析仪,辅以良好的减振结构设计,基于异常音包含大量的高次谐波失真成分这一基本原理,结合大量的生产测试经验和实验研究,形成了优于普通Rub&Buzz的独特的多达4种异常音检测指标,来检测异常音。下图TWS耳机中的右耳在播放低频成分较为明显的音乐或者声源时,人耳可以听出略微的异音感;左耳表现正常。通过指南测控的标准声学测试系统实际测试的结果,右耳喇叭播放时有略微异音,左耳喇叭听感正常。左右耳TWS组队声学测试,可以在喇叭播放特性的喇叭异常音测试步骤中看到,有异音的右耳的低频分量强度会变高,通过在指南GirantAudistic声学测试软件上测试异(常)音。
这样会带来一个新的问题:按照Widrow的自适应滤波理论,滤波器的长度越长,其收敛速度越慢,同时权噪声越大,进而导致强混响下回声消除不够理想。第二个问题是延时跳变问题。在实时音视频通话领域,延时跳变是一个比较普遍的问题。主要现象是麦克端采集的信号和回声参考信号之间的时延关系会发生跳变,每次跳变之后就需要重新对齐信号,就会漏一些回声出来。第三个问题是啸叫问题。啸叫的检测和啸叫的抑制是公认的在回声领域的经典难题。还有双讲问题。双讲是评估回声消除算法性能的一个重要指标,当然也是很难处理的一个问题,因为双讲很容易导致滤波器系数发散。综合以上这些维度我们可以看到,非线性的声学回声消除是一个很有挑战的研究方向。双耦合声学回声消除算法这个是我们团队提出来的一种算法,它的主要特点是,在构建滤波器模型的过程中结合了非线性声学回声的一些特性,因此它在抑制非线性回声方面,也体现出固有的优势。1.非线性声学回声系统建模,继续回到前面的这个声学回声路径。我们对这个模型进行了简化。我们将左边的喇叭端用一个传递函数Wn来表示,假设它的是非线性的回声路径传递函数;同时我们将喇叭右边,就是麦克端,统一用Wl来表示。
回声来自于非预期的泄露,一般分为电学回声和声学回声。
32.隔声实验室由两个相连的混响室组成,在两个混响室之间应有一个安装试件的洞口。33.质量定律对于隔声存在一个普遍的规律,即材料越重(面密度,或单位面积质量越大)隔声效果越好。对于单层密致匀实材料,面密度每增加一倍,隔声量在理论上增加6dB,这种规律即为质量定律。34.吻合谷声波接触隔声材料后,隔声材料除了垂直方向的受迫振动以外,还有沿着板面方向的受迫弯曲振动。在某个特定频率上,受迫弯曲振动将和板固有的自由弯曲振动发吻合,这时隔声材料就非常顺从地跟随入射声弯曲,造成声能大量地投射到另一侧去,形成隔声量的低谷,这种现象被称作吻合效应。35.平方反比定律在自由场(freefield)条件下,话筒或扬声器与音源之间的距离每增加一倍,声音的强度就会下降6分贝。36.哈斯效应如果有两个不同声源发出同样的声音,在同一时间以同样强度到达时,声音呈现的方向大致在两个声源之间;如两个同样的声源中的一个延时5~35ms,则感觉声音似乎都来自未延时的声源;如延迟时间在35~50ms时,延时的声源可被识别出来,但其方向仍在未经延时的声源方向;只有延迟时间超过50ms时,第二声源才能象清晰的回声般听到。这种现象就是哈斯效应。回声消除AEC(AcousticEchoCancellation)一般指的是声学回声消除,其主要用于抑制产品本身发出的声音。北京录播声学回声AEC算法
非线性的声学回声消除是一个很有挑战的研究方向。江苏语音交互声学回声降噪算法
只需要近端采集信号即可,傲娇的回声消除需要同时输入近端信号与远端参考信号。有同学会问已知了远端参考信号,为什么不能用噪声抑制方法处理呢,直接从频域减掉远端信号的频谱不就可以了吗?行为近端信号s(n),已经混合了近端人声和扬声器播放出来的远端信号,黄色框中已经标出对齐之后的远端信号,其语音表达的内容一致,但是频谱和幅度(明显经过扬声器放大之后声音能量很高)均不一致,意思就是:参考的远端信号与扬声器播放出来的远端信号已经是“貌合神离”了,与降噪的方法相结合也是不错的思路,但是直接套用降噪的方法显然会造成回声残留与双讲部分严重的抑制。接下来,我们来看看WebRTC科学家是怎么做的吧。信号处理流程WebRTCAEC算法包含了延时调整策略,线性回声估计,非线性回声抑制3个部分。回声消除本质上更像是音源分离,我们期望从混合的近端信号中消除不需要的远端信号,保留近端人声发送到远端,但是WebRTC工程师们更倾向于将两个人交流的过程理解为一问一答的交替说话,存在远近端同时连续说话的情况并不多(即保单讲轻双讲)。因此只需要区分远近端说话区域就可以通过一些手段消除绝大多数远端回声。
江苏语音交互声学回声降噪算法
深圳鱼亮科技有限公司在智能家居,语音识别算法,机器人交互系统,降噪一直在同行业中处于较强地位,无论是产品还是服务,其高水平的能力始终贯穿于其中。深圳鱼亮科技是我国通信产品技术的研究和标准制定的重要参与者和贡献者。公司承担并建设完成通信产品多项重点项目,取得了明显的社会和经济效益。多年来,已经为我国通信产品行业生产、经济等的发展做出了重要贡献。
ABOUT US
石家庄雪冰制冷设备安装有限公司