据MarkTechPost于2026年10月5日报道,Yandex公布Sona技术报告,介绍一种将候选生成、预排序和排序合并到单一系统的生成式AI推荐模型。该模型已在Yandex智能音箱上完成为期七天的线上生产实验,并以一个在线服务的Transformer取代超过15个候选生成器、预排序阶段和排序阶段。

传统生产推荐系统多采用级联:候选生成、预排序和重排序分层运行,重排序依赖数百个工程特征。Sona把候选生成和排序统一到一个共享用户表示上,编码器每次请求只读取一次听众历史,解码器生成候选,排序模块用同一编码器状态打分。报告称,Sona不使用手工工程特征,输入为日志事件字段和学习的语义ID。在Yandex智能音箱上,播放可在用户未先选择艺术家、流派或情绪时开始,团队称其为纯推荐设置。

Sona的语义分词器把每首曲目表示为3个离散代码。一个冻结多模态大语言模型仅用预填充模式读取前90秒梅尔频谱及标题、艺术家和标签,再由4层细化Transformer通过InfoNCE对齐收听行为,残差K-means量化为3个各32000条目的码本。报告称,该方案使Recall@1000从CLMR基线的0.8111升至0.8524。编码器关注8192个历史事件,其中最近2048个事件经7层自注意力,较早事件只经交叉注意力和1个全历史层,以约一半推理成本保留大部分质量。2层解码器用宽度1024的约束束搜索输出语义ID元组,目录前缀树阻止无效前缀;4层交叉注意力的排序模块为扩展出的曲目打分。

排序模块从冻结教师排序器学习。教师是0.6B参数Transformer,在一年互动事件上先进行下一项预测预训练,再进行多头排序微调;移除预训练后,加权配对准确率从0.6215降至0.6153。团队称其蒸馏方法为Rollout Distillation:训练时当前解码器生成束候选,教师为其和日志曝光打分,排序模块以平均绝对误差回归。联合损失为L = L_NTP + L_rollout + L_impression,两个损失都更新共享编码器;服务时教师被移除。训练保持在线,事件以15分钟窗口聚合成会话,新权重每10分钟到达服务端。端到端延迟中位数45分钟、p99为60分钟,服务运行在NVIDIA Triton并达到41%模型FLOPs利用率。

最终实验在线上流量中运行7天,每个分桶随机选择15%用户。报告列出的变化均具统计显著性,且相对于生产控制组:活跃用户(主要指标)+4.53%,总收听时长+6.30%,点赞+11.42%,“重复”命令+17.99%,深度参与用户+7.37%。这些增益叠加在此前部署保留的改进之上。在活跃用户上,Sona的提升是Argus此前在该界面实现的+1.93%增量的2.35倍。

Sona并非首个投入生产的端到端生成式推荐系统。快手OneRec已服务单一编码器-解码器模型,Meta的HSTU生成式推荐器在2024年把推荐重新表述为用户行为序列转导。报告称,Sona结合的是完整级联替换、不使用手工工程特征以及经过在线验证的蒸馏排序器。