一种基于几何约束全局相干场和视觉引导的说话人声源定位方法和系统

    公开(公告)号:CN116087878A

    公开(公告)日:2023-05-09

    申请号:CN202310147501.1

    申请日:2023-02-02

    Abstract: 本发明涉及一种基于几何约束全局相干场和视觉引导的说话人声源定位方法和系统。该方法包括:采用相机几何模型提取几何约束全局相干场线索,以表示声源信号的空间特征;根据与音频信号同步的视频帧的图片样本中的说话人位置标注,生成视觉引导的二值化伪标签;采用卷积神经网络结合全连接网络构成声学网络,声学网络利用几何约束全局相干场线索生成声学位置图谱,计算声学位置图谱与生成的伪标签的均方误差来训练声学网络;采用训练好的声学网络生成声学位置图谱,根据声学位置图谱中的峰值位置确定说话人声源的位置坐标。本发明利用视觉模态和听觉模态之间的互补性和一致性,增强了声学网络对于声源位置的学习能力,能够实现准确的声源定位。

    一种基于空间和频谱时序信息建模的多移动声源定位方法和系统

    公开(公告)号:CN114611546A

    公开(公告)日:2022-06-10

    申请号:CN202210137621.9

    申请日:2022-02-15

    Inventor: 刘宏 杨冰 李一迪

    Abstract: 本发明涉及一种基于空间和频谱时序信息建模的多移动声源定位方法和系统。本发明将直达路径相位差和声源活跃程度信息以加权求和的方式编码到学习目标中,从而指导网络学习具有竞争性和时变性的多移动声源的直达路径相位差特征,避免了多目标回归框架面临的分配歧义以及输出维度不确定问题;通过迭代地检测和定位主导声源来确定多移动声源的位置,降低了多声源之间的相互影响;引入频谱特征提取网络,建立了声源位置与声源身份之间的关联,通过对空间和频谱的时序信息进行建模实现了可靠的多移动声源跟踪。

Patent Agency Ranking