基于双路径Transformer的生成对抗网络协同手势合成方法及装置

    公开(公告)号:CN118334247A

    公开(公告)日:2024-07-12

    申请号:CN202410477682.9

    申请日:2024-04-19

    Abstract: 本发明公开了一种基于双路径Transformer的生成对抗网络协同手势合成方法及装置,涉及人机交互技术领域。包括:获取文本数据、音频数据以及说话者身份数据,输入到构建好的基于Transformer的跨模态融合网络模型,得到手势合成结果;其中,基于Transformer的跨模态融合网络模型包括:前端单模态编码器模块、跨模态融合模块以及手势翻译模块。本发明引入了一种创新性的多模态融合机制,实现端到端的协同语音手势生成。融合机制通过并行定向跨模态Transformer和交互式级联二维注意力模块的协同作用进行,填补了单个模态的不足,有助于模型将焦点集中在与手势相关的上下文和语音信息上。实现了无需预定义的三维手势生成,而非仅限于简单地预测手势类别,并在实现上取得了最优效果。

    一种基于听觉与触觉的水杯水位检测方法及装置

    公开(公告)号:CN117288294B

    公开(公告)日:2024-06-04

    申请号:CN202311459279.5

    申请日:2023-11-03

    Abstract: 本发明公开了一种基于听觉与触觉的水杯水位检测方法及装置,涉及检测水位技术领域。包括:将听觉数据输入到构建好的听觉特征提取模型进行特征提取得到听觉信息;将触觉数据输入到构建好的触觉特征提取模型进行特征提取得到触觉信息;对听觉信息以及触觉信息进行拼接得到多模态特征;根据多模态特征以及长短期记忆递归神经网络LSTM进行水位回归预测,得到水杯的水位检测结果。本发明引入触觉传感器,通过容器所含液体的增加使触觉传感器变形程度增加判断液体所含多少,结合倒水时的音频,采用神经网络预测液体含量具体的百分比,通过多模态的数据更细致地确定液体含量,提高预测的准确性及在各个环境中的普适性。

    一种基于空间线索的语音-图像跨模态检索方法及装置

    公开(公告)号:CN116821381A

    公开(公告)日:2023-09-29

    申请号:CN202311104574.9

    申请日:2023-08-30

    Abstract: 本发明公开了一种基于空间线索的语音‑图像跨模态检索方法及装置,涉及计算机视觉和语音处理技术领域。包括:将语音信号输入到音频编码器,得到空间相关的声学特征;将图像信息输入到图像编码器,得到场景图像特征;对特征进行CSIR,得到跨模态检索结果。本发明通过使用深度学习和相关算法,能够对图像和语音之间的空间关联性进行分析与建模,从而实现图像和语音之间的跨模态检索。与以往的跨模态检索方法只针对语音‑图像的共同语义信息建模不同,本发明重点关注不同模态之间的空间语义一致性,通过深入研究图像和语音之间的空间属性联系,本发明可以帮助用户更高效地检索相关的图像和语音内容,提供更好的交互体验和信息管理能力。

    一种多模态的表现性语音合成方法及装置

    公开(公告)号:CN116386590B

    公开(公告)日:2023-08-15

    申请号:CN202310613237.6

    申请日:2023-05-29

    Abstract: 本发明公开了一种多模态的表现性语音合成方法及装置,属于语音合成技术领域,方法包括:将噪声语谱图和与噪声语谱图对应的第一无声视频序列输入至噪声掩码编码器,通过噪声掩码编码器获得去噪掩码;将第二无声视频序列输入至多尺度风格编码器,通过多尺度风格编码器提供多尺度的风格嵌入;将文本信息输入至文本编码器,通过文本编码器获得文本信息嵌入;文本信息嵌入序列经过变量适配器的处理,获得帧级别的语音特征;将帧级别的语音特征与去噪掩码相乘,获得去噪后的帧级别的语音特征;将去噪后的帧级别的语音特征与风格嵌入在通道维度上进行拼接;将拼接得到的特征序列输入至解码器,通过解码器合成干净的语谱图。

Patent Agency Ranking