谷歌黑科技WaveNet，更先进的语音合成

时间：2016-09-25 09:28:27 阅读：375 评论：0 收藏：0 [点我收藏+]

标签：

导读	Google 的 DeepMind 研究实验室昨天公布了其在计算机语音合成领域的最新成果——WaveNet。该语音合成系统能够模仿人类的声音，生成的原始音频质量优于目前的文本转语音系统（text to speech，简称 TTS）。

技术分享

DeepMind 宣称，通过人耳测试，该技术使得模拟生成的语音与人类声音之间的差异缩小了一半。当然，这种测试不可避免地存在主观性。WaveNet 目前还没有被应用到谷歌的任何产品中，而且该系统需要强大的计算能力，近期也无法应用到真实世界场景。

让人类跟机器自由交谈是人机交互研究领域长久以来的梦想。在过去几年，深度神经网络的应用大幅度了提高计算机理解自然语音的能力。然而，运用计算机生成语音（语音合成，或者 TTS 系统）仍然主要依靠拼接式 TTS——先录制单一说话者的大量语音片段，建立一个大型数据库，然后将语音片段合成完整的话语。这种语音合成方式很难对声音加以修饰，无法表达强调或者情感。
技术分享

为了解决语音合成的这一难题，迫切需要运用一种参量改频式（Parametric）TTS。在这种 TTS 系统中，生成数据所需要的所有信息被存储于模型的参数中，语音所传达的内容及语音特征可以通过模型的输入信息得以控制。然而，目前参量改频式 TTS 生成的语音听起来还不如拼接式 TTS 模型生成的语音自然。现有的参量改频式模型通常将输出的信息交给信号处理算法处理，从而生成音频信号。

WaveNet 改变了这种范式，直接用音频信号的原始波形建模，而且是一次处理一个样本。通过这种方式生成的语音不但听起来更加自然，而且使用原始波形还能为任何声音建模，包括模仿任何人的声音，还能生成音乐。在测试中，WaveNet 通过分析古典音乐，生成了一段钢琴曲。

谷歌 DeepMind 的人工智能 AlphaGo 在今年早些时候打败了韩国围棋大师李世石九段，引起了世人的关注。谷歌一直对如何应用其人工智能技术守口如瓶，只是称其已经利用这些技术降低了冷却公司数据中心所需的电量，让从 YouTube 到谷歌广告产品的一系列服务得到了巨大改善。

技术分享

谷歌黑科技WaveNet，更先进的语音合成

标签：

原文地址：http://www.cnblogs.com/linux130/p/5904923.html

踩

(0)

评论一句话评论（0）

分享档案

更多>

2021年07月29日 (22)
2021年07月28日 (40)
2021年07月27日 (32)
2021年07月26日 (79)
2021年07月23日 (29)
2021年07月22日 (30)
2021年07月21日 (42)
2021年07月20日 (16)
2021年07月19日 (90)
2021年07月16日 (35)

周排行