据TechCrunch报道,语音技术公司ElevenLabs于9月28日(周一)推出ElevenLabs v4和v4 Turbo两款语音模型。新模型支持90多种语言,增强了表达控制,并降低了语音代理的延迟。该公司去年发布v3,并在今年早些时候于华沙的一场活动上预告了新一代模型。

v4采用新架构,ElevenLabs称其可实现更好的控制和更快的语音克隆。用户只需10秒音频即可克隆声音。在创意用途上,模型在处理较长文本时能更好保持声音身份,并在朗读时结合文本语境改变表达方式。v3引入的内联标签在v4中得到扩展,用户可以叠加多个标签,让模型按序列执行。

语言支持从上一版的70种提升至90多种。ElevenLabs称,日语、巴西葡萄牙语、普通话和粤语的质量提升最明显。

在企业通话业务方面,ElevenLabs过去一年快速扩张,超过55%的业务来自大型企业。公司表示,新模型适合语音代理,因为延迟更低,对话更流畅;v4还能在后端大语言模型开始生成答案时即开始生成音频。此外,模型可针对对抗、升级和等待等场景采取不同处理方式,以改善问题解决。

语音模型竞争正在升温。Cartesia、Deepgram、Fish Audio、Boson和WellSaid Labs等初创公司已推出富有表现力的语音模型,谷歌和OpenAI等大公司也在改进语音模型。

资金与经营层面,ElevenLabs今年早些时候从红杉资本融资5亿美元,该轮由红杉资本领投,公司估值110亿美元。已有传闻称其后续融资将把估值推高至220亿美元。公司年化收入运行率从今年年初约3.3亿美元升至超过6亿美元。随着在印度、欧洲和巴西等市场积极招聘,员工人数已超过800人。公司联合创始人兼首席执行官Mati Staniszewski最近接受TechCrunch采访时表示,公司目标是在“未来几年内”上市,但没有承诺具体时间表。