Patent search ap:("北京科技大学") AND inv:"张一帆" Page 1

1.

发明公开
一种说话人提取方法及系统审中-实审

公开(公告)号：CN118865940A

公开(公告)日：2024-10-29

申请号：CN202410848619.1

申请日：2024-06-27

Applicant: 北京科技大学

Inventor： 钱馨园 , 江子扬 , 张一帆 , 殷绪成

IPC: G10L13/027 , G10L13/08

Abstract: 本发明提供一种说话人提取方法及系统，涉及语音识别技术领域，方法包括：获取文本信息和待识别混合音频，所述待识别混合音频中包括目标说话人的目标语音；将所述文本信息和所述待识别音频输入至语音识别模型，确定所述目标说话人，所述语音识别模型包括提示文本提取说话人(PTE)网络和文本语音识别(TSR)网络中的至少一者。本发明通过获取文本信息和待识别混合音频，并将所述文本信息和所述待识别音频输入至语音识别模型，能够同时关注声音的频谱特征和文本信息，又因为所述语音识别模型包括提示文本提取说话人(PTE)网络和文本语音识别(TSR)网络中的至少一者，能够利用混合音频场景下的视觉特性。

Patent Agency Ranking