据SiliconANGLE报道,人工智能开发商Stability AI于8月26日宣布完成7600万美元融资,投资方包括索尼音乐集团、环球音乐集团和华纳音乐集团三大唱片公司,以及AMD旗下风投部门AMD Ventures等。
Stability AI总部位于伦敦,2022年因开源图像生成器Stable Diffusion而声名鹊起。此后,该公司扩展了开源模型组合,推出针对3D渲染、视频和音频生成优化的模型。此次三大唱片公司参投,或与其音频生成业务有关。
Stability AI于5月发布了最新音频生成模型系列Stable Audio 3.0。该系列包含三个开源模型和一个通过云端API访问的付费算法,用户可生成最长6分20秒的音频片段。该模型基于扩散Transformer架构,通常需要多步降噪,而Stability AI将工作流压缩为单步以加快生成速度。
当用户提供需要编辑的音频片段时,模型会将其转换为潜在空间表示,这是一种数学结构,能以压缩、硬件高效的形式表示数据。Stable Audio 3.0使用称为语义-声学自动编码器的机制生成潜在空间。Stability AI称,该技术融合Transformer架构元素,可在不降低输出质量的情况下加速推理。
三家唱片公司中有两家与Stability AI保持合作关系。环球音乐集团和华纳音乐集团正与该公司合作开发AI音乐制作工具。去年,Stability AI还与电子游戏开发商艺电公司签署了类似技术合作协议,艺电也参与了本轮融资,希望利用Stability AI的图像生成模型加速游戏设计师的工作。
Stability AI于2024年发布了开源图像生成器Stable Diffusion 3.5,但并未退出图形设计领域。今年4月,它推出了名为Brand Studio的云服务,营销团队可用其生成和编辑视觉素材。
Stability AI表示,将利用本轮融资资金为创意专业人士开发更多产品,并计划扩充应用研究和专业服务团队。