据SiliconANGLE报道,总部位于西雅图的初创公司Nuance Labs于9月15日宣布完成5000万美元A轮融资,用于开发能让AI虚拟人进行更自然面对面交流的基础模型。本轮融资由Lightspeed Venture Partners领投,现有投资方Accel和South Park Commons继续参与,英伟达和Define Ventures新加入。

Nuance Labs联合创始人兼首席执行官Fangchang Ma曾在苹果公司担任人工智能研究员。他在接受Business Insider采访时说,现有语音机器人和AI虚拟人采用迂回方式构建,开发者实际上把多个模型拼接在一起,包括语音转文字模型、生成回复的大语言模型、文字转语音模型,虚拟人还需要第四步来驱动面部动画。这种逐步处理的方式导致回复延迟。

Fangchang Ma表示,这些环节的交接削弱了与真人交流的感觉,虚拟人在对方说话时往往显得僵硬。“如果使用现有的AI虚拟人,它们在听的时候没有反应,或者只是随机做些动作。”他说。

Nuance Labs希望改变这一点。公司开发了一个全双工系统,可同时理解用户音视频流并回传音视频响应。该模型能感知词语、注视、手势、语调和时机,并实时以面部表情和声音表达作出回应。它还会在对话中研究人的行为,从而逐步提升表现,并能在用户仍在说话时表现出理解。Fangchang Ma说:“我们决定建立在一个系统、一个模型上。音频视频输入,音频视频输出。”

该公司已发布模型演示,但仍处于开发阶段。Fangchang Ma说,Nuance的模型能让AI虚拟人与人类进行更自然、更有效的对话,在表情有助于推动结果的场景中效果更好。目标用例包括销售和客户服务、教练、职业培训和教育。例如,用户可以通过视频通话学习新语言或练习面试。

Nuance尚未推出任何产品,仍在调整模型,让对话更加流畅。公司希望今年晚些时候向公众推出首个研究预览。Fangchang Ma说,本轮融资将加速开发工作,公司还将招聘更多研究人员。

Lightspeed Venture Partners的Nnamdi Iregbulem说,改善人们与AI系统互动的方式存在“巨大机会”。“创始团队拥有技术才能和运营能力的罕见组合,他们将其转化为一个实时跟随你的单一模型。”他说,“我们可以看到这将成为各地AI产品的基础层,而这支团队能够把它建起来。”