据TechCrunch报道,英国数字人初创公司Synthesia今年9月在其纽约新办公室为一名记者制作了可互动的数字分身。这是该公司首次为记者、也是首次为企业事务负责人Alexandru Voica之外的人制作数字分身。
Synthesia 总部原在英国,与 D-ID、HeyGen、Colossyan 同属热门数字人创业公司。该公司今年早些时候估值达到 40 亿美元,并称去年年度经常性收入超过 1 亿美元。它让企业用 AI 数字人制作互动培训视频,并在近期推出 Roleplay Sessions,让员工与可回应并给回答打分的互动 AI 数字人练习销售话术等场景。记者此前收到 Voica 的互动虚拟分身链接,该分身被训练来回答关于 Synthesia、其业务和运作方式的常见媒体问题。在纽约办公室开幕活动上,记者被问是否愿意拥有自己的 AI 分身,并当即答应。
制作在 Synthesia 办公室内的小型摄影棚完成。团队为记者拍摄大量照片,并录制两分钟声音,记者须同意这些分身被制作。Synthesia 为记者制作了个人分身,可朗读任何给定脚本,有戴眼镜和不戴眼镜两个版本;同时制作了两个互动分身,能对话和倾听,也有戴眼镜与不戴眼镜版本。整个制作耗时数天。
互动分身被选定训练于记者关于“为什么风投支持的初创公司比非风投支持的初创公司更容易欺诈”的报道,因此只回答与该报道相关的问题。记者询问加入 TechCrunch 前在哪里工作、住在纽约哪里,分身每次都把话题引回那篇报道。其技术组合包括语音转文本、视频、语言和文本转语音模型。语音转文本模型把人说的话转为文字,代理式语言模型理解文字并据此行动,文本转语音模型把回应转为音频,Synthesia 自建视频模型则为说话时的分身提供动画。技术栈包含 Synthesia 自家视频和语音模型,不过公司也允许客户选用 Cartesia、ElevenLabs、Google 或 OpenAI 等实验室的替代方案。企业可选择把分身托管在任何云上,或付费由 Synthesia 托管。
Synthesia 目前构建三类产品:带经典数字人的视频创建与分发平台,用户输入脚本后由数字人复述;名为 Sessions 的代理式平台,人们可在调查或角色扮演中与数字人互动;以及 API 平台,客户可将 Synthesia 视频和语音模型与其他技术服务组合,构建互动数字人或其他产品。
记者先测试个人分身,输入一段关于纽约秋天到来的通用脚本。声音相当准确,也没有带出录音时嗓音的沙哑。非技术背景的朋友觉得有趣又诡异。记者随后展示互动分身,朋友认为声音不太像记者,相似度不如个人分身,但仍接近到有些诡异。记者母亲称其“amazing”,她和父亲不断问“只有他们知道”的问题,模型没有回答,每次都把他们引回那篇风投欺诈报道。