首页 >  新闻中心 > 行业新闻

Share - WeChat

  日前,圣彼得堡国立大学研究团队将语调模型集成至神经网络,使人工智能合成语音的听感更自然、更贴近真人。这一进展有望优化语音助手、人形机器人等设备所使用的文本转语音系统。

  现有语音合成模型往往倾向于生成最常见的单词发音或短语发音变体,难以生成能够传达语义与情感细微差别的语调。同时,若句子各部分的语调组合不当,即便音质生成质量较高,也会影响整体听感。圣彼得堡国立大学的语言学家致力于弥补神经网络的这一短板,其提出的改进方案有效改善了语调不自然、单调的问题。

  模型训练依托圣彼得堡国立大学语音学与外语教学方法系开发的语调分类体系,该体系由该系副教授妮娜 沃尔斯卡娅与系主任帕维尔 斯克雷林教授共同构建。这一分类体系涵盖疑问句、陈述句、祈使句、请求句、呼语句等多种句类,并包含多种音高模式变体。

  圣彼得堡国立大学副教授乌里亚娜 科切特科娃解释称,得益于合理的数据结构与对音高变化的精准标注,模型能够传达丰富的语调细节,从而生成更自然、更具表现力的语音。这一方法提升了合成系统的灵活性,可应用于语音控制、教育软件等多种场景。

  为评估模型训练效果,研究人员邀请42名俄语母语者聆听合成音频并作答。结果显示,受试者普遍认为合成音频听感自然。

  研究团队指出,为进一步提升合成质量,模型仍需精细化调整,考虑情感和风格上的差异。

  (稿件来源:俄罗斯金砖国家电视台 编辑整理:实习记者 姚易安)

2022年7月12日,世界互联网大会国际组织正式成立,从互联网领域的国际盛会发展为国际组织,总部设于中国北京。我们将致力于搭建全球互联网共商共建共享平台,推动国际社会顺应信息时代数字化、网络化、智能化趋势,共迎安全挑战,共谋发展福祉,携手构建网络空间命运共同体。