音频资料通常只以原作语言广泛传播,而翻译工作成本高昂且不普遍。所以,人们一直梦想着能够将流行的音频资料翻译成当地语言。
除此之外,当音频材料被翻译时,它通常是用一种听起来很普通的声音进行的,与书本(文章等)的预期基调完全不符。
而现在,得益于突破性的新型人工智能技术,这一切都发生了改变。由于人工智能的进步,世界各地的听众现在能够享受多种语言的原汁原味的音频内容,这确实彻底改变音频材料的世界。

使用AI语音生成器翻译成其他语言:电子阅读中声音演员克隆的最明显好处是将有声读物带给不同语言群体。过去,非特定语言母语的人必须适应有声读物语言的声音和情感。理论上,为电子阅读复制声音的过程可以适用于任何语言群体。这可以帮助其他国家的人们感到他们是全球读者的一部分。 通过AI语音传达作者的意图:无论是有意还是无意,人们对于没有直接感受的内容并不感兴趣。现在,得益于声音克隆技术,可以复制特定作者的声音,或者甚至是另一种类型的声音,给书籍带来不同语言群体的人们想要的声音和情感。 提高知名度:当电子书能够覆盖全球更多人口时,它有助于巩固作者在书籍翻译地的知名度。作家能够比以前更容易的方式提高自己的声誉。虽然一直有作家的作品非常出名,受到全球喜爱,但这些人是少数。现在,可以预见将有更多作家可能获得全球的知名度。
为视障人士提供包容性:除了因为偏好而选择听电子书的人之外,为视障人士制作音频对于吸引这些受众也至关重要。通过克隆声音并将其翻译成其他语言,视障人士将能够更准确地想象作者所写的内容。此外,这对于线上学习来说也尤其重要:对于需要以音频形式提供教育材料的人来说,音频必须真实、逼真,才能正确传达信息
2、技术是如何运作?
文本转语音技术:当人们以文本形式阅读书籍时,他们会在脑海中形成作者的声音听起来是什么样的想法。
使用新应用创建自己的音频:AI 语音克隆的另一个好处是能够以任何您选择的方式创建音频。现在有一些应用程序可以让您插入文本,然后从语音的众多方面进行一系列选选择创建自己的音频。
语言和方言:这些应用程序最基本的特点是语言选择。有些应用程序能够为多个不同的语言群体(包括一些相对冷门的语言群体)生成声音。少数民族语言群体的人们不再需要依赖殖民语言或英语等全球性语言来获取文本。
年龄、性别和情绪:老式有声读物的一个问题是,它们通常由一个听起来很普通的声音讲述。选择音频片段的性别的能力很重要,因为它对文本的呈现方式有很大的影响。同样,声音的“年龄”也有很大不同。如果您正在制作儿童故事的音频片段,不可能拥有与成人浪漫小说相同的声音类型。您还可以将不同类型的情感融入音频片段中。传统有声读物最大的缺点之一是它们往往极其单调。使用一些更复杂的应用程序,您可以从各种情感和其他高级功能中进行选择,以创建音频内容,通常还可以使用音效和其他功能。
3、行业面临的挑战
授权同意:在声音克隆世界中,无论是AI叙述的有声书籍还是其他类型的音频内容,最大的问题之一是作者的同意。AI 可以出色地复制人类的声音,但这并不一定意味着相关作者确实希望复制自己的声音。 深度伪造:在最坏的情况下,音频文本将能够产生假声音,而这些假声音并非真正由作者所写。这可能会导致内容不真实,并损害人们的声誉。
准确翻译:由于多种原因,将书籍翻译成其他语言(即使是文本形式)也极具挑战性。除了逐字翻译单词本身之外,译者还要努力为书籍找到合适的短语、语气等,以保留作者自己的语调和原意。
4、如何解决这些问题
与专家合作:当书籍被翻译成其他语言时,出版公司几乎总是寻找翻译目标语言的母语人士。有声读物也是如此。语音克隆制作者需要与其他语言的母语人士密切合作,不仅要测试和验证翻译中使用的语言,还要测试和验证语调、情感、速度以及给定音频翻译中的所有其他内容。
制定具体的、可执行的法规:与其他使用生物识别材料来处理个人数据的行业一样,监管机构需要制定法律来规范语音克隆的使用。需要制定关于同意和版权问题的具体规定,并严格执行。考虑到作者身份是全球性的,而各国政府对其他国家发生的事情的控制能力有限,这可能是一项重大挑战。
多重身份验证:同样,与其他基于生物识别的技术一样,人们在创建人工智能声音时应该有不同级别的身份验证。
