据 The Verge 报道,AI音乐生成器Suno于10月2日推出新功能Speech,可根据脚本或提示描述生成语音,并允许同时生成配音和背景音乐。该功能目前以公开测试形式在Suno网页端和移动端上线。

Suno首席产品官杰克·布罗迪在公告中表示,音乐始终是Suno及其产品的核心,但公司愿景一直延伸到其他人类表达形式。他说,Speech是首个将语音和音乐作为一个整体音轨同时生成的音频模型。

AI语音生成并非新领域。DeepMind已进行十年深度学习语音合成实验,Adobe有文本转语音工具,ElevenLabs自2023年推出以来成为最知名的相关平台之一。Suno此时进入这一领域,可能是为了推动平台多元化,因为其音乐生成器已吸引大量诉讼。

将AI音乐与生成语音配对,是Suno对文本转语音工具的差异化处理。背景音乐可以选择关闭,用户若只需干净语音,可通过开关关闭配乐。Suno设想的使用场景包括为诗歌配上舒缓配乐,或为戏剧化配音和激励性演讲配上更有活力的音乐。

使用该功能时,用户需选择“Create”标签,进入Speech选项。Speech有两种模式:Simple模式允许用户通过提示框描述想要生成的内容,例如“一个海盗船长召集船员”;Advanced模式允许用户输入自定义脚本。高级设置还可调整AI语音的性别、演讲风格以及每次语音生成的多样性。Speech最长时长约为八分钟。

Suno承认该功能远非完美,但表示会根据用户反馈持续改进Speech。布罗迪说:“测试版真的只是测试版。偶尔,英国口音会跑到澳大利亚再跑回来。戏剧性的停顿可能会非常戏剧化。你几乎肯定会发现我们从未想到的用途。”