当前位置:智能 > 正文

真假难辨 AI精确复制声音

2019-06-14 10:35:30  来源:网易智能

脸书的研究人员成功克隆了微软总裁比尔·盖茨的声音。

脸书人工智能研究中心的肖恩·瓦斯奎兹(Sean Vasquez)和迈克·刘易斯(Mike Lewis)于本周表示,他们已经努力模仿人类语言有一段时间了。然而,模仿人类语言显然是件难事,当人们听到斯蒂芬·霍金所使用的那套最著名的说话机器发声时,会发现它听起来仍然很不像人类。

但是现在,研究员们似乎已经取得了进展。如果你听了盖茨的克隆所发出的声音,我想你是会同意的。因为它听起来很像比尔·盖茨,你甚至很难分辨出它和他真实声音的区别。

研究人员展示了他们的研究。在这里,机器模仿着盖茨的腔调发声,“请给你珍爱的朋友发一封充满爱意的短信。”其中最不可思议的是,这台机器在说“珍爱(cherish)”时,准确无误地捕捉到盖茨不断上升的语调变化的。

这项技术被称为MelNet,可以用来复制人类的语调。到目前为止,盖茨和其他许多人的声音都被它完美地再现了。瓦斯奎兹和刘易斯说,克隆的音频取自各类Ted演讲。

两位研究人员还表示,直到最近,文本到语音转换软件还不能很好地工作的原因是它使用了波形图记录声音。这些图显示了声音在几秒钟内的音阶变化。如果你听到过盖茨说“珍爱”这个词,就知道他的语气是变化剧烈的。在试图模仿一个人的时候,深度学习机器必须预测到所有这些细微的变化,这很不容易。

瓦斯奎兹和刘易斯说,他们通过使用一种叫做光谱图的东西来训练机器,成功地克隆了声音。

研究人员说:“光谱图的时间轴比波形图的时间轴紧凑几个数量级,这意味着在波形中跨越数万个时间步长的依赖关系在光谱图中只跨越数百个时间步长。这使得我们的光谱图模型能够在数秒内记录各种语音和音乐样本,并保持它们一致性。”

不过,他们也经历了一些挫折。研究小组表示,对他们来说,几乎完美地复制一个句子并不难,难的是复制那些在长达几十秒或几分钟的时间里,显示了情绪变化的复杂语调”。尽管如此,当涉及到人机交互时,研究小组说,在只涉及简短对话的情境中,这项技术可能会带来革命性的变化。(选自:SiliconANGLE作者:James Farrell编译:网易智能 参与:毅立)

推荐阅读

特斯拉:二季度有望打破销售纪录

特斯拉股东大会在美国当地时间2019年6月11日下午2:30如期召开,特斯拉首席执行官(CEO)埃隆·马斯克(ElonMusk)站在山景城计算机历史博物馆的 【详细】

美团宣布品牌升级

6月13日消息,今日美团宣布品牌迭代升级,从此前的蓝色变为黄色。除线上App将变更为黄色外,美团的线下触点和交互入口未来也将整体变为黄色 【详细】

腾讯:基层员工晋升标准放松

自930变革、撤裁中干风波后,腾讯开始下手对其职级体系进行动刀。搜狐科技独家获悉,今日腾讯发内部信称将进行系统性升级,重新定义专业职 【详细】

阿里巴巴准备上市了?已经递交香港上市申请

文 | 搜狐科技 马颖君6月13日,据彭博报道,阿里巴巴已经递交香港上市申请。港交所在上市制度上做出的同股不同权的巨大改革是促使阿里巴 【详细】

李斌回应蔚来百亿融资和亏损

高远 富罗娜蔚来汽车在2019年一季度亏损26亿元的同时,与北京亦庄国投建立了100亿融资的协议令业界相当关注。此前有未经证实的消息说,李 【详细】



科技新闻网版权