据 MarkTechPost 报道,Perplexity Research 发布一项后训练研究,在 Perplexity Computer 内用真实用户会话训练模型,其中包含失败会话,方法是拒绝采样微调结合提示引导自蒸馏。线上 A/B 测试中,两个已训练检查点之间的工具调用失败率从 2.24% 降至 1.77%,团队称这是统计显著的 21.2% 相对下降。
Perplexity 未发布后训练权重或训练代码,该模型只作为 Perplexity Computer 内的一个模型选项运行;基座模型 GLM 5.2 已在 Hugging Face 公开。
标准拒绝采样微调只判断会话是否成功并模仿成功会话,但成功结果不代表每一步都正确:智能体可能从一次错误的工具调用中恢复并最终给出正确答案,模仿整条轨迹会强化那次错误,直接丢弃失败会话也会丢掉本可避免的错误证据。
Perplexity 团队把问题拆成两个决定:哪些会话值得模仿,哪些轮次值得纠正。成功会话中的非错误轮次用交叉熵损失模仿;任何会话中带已验证提示的错误轮次用 Kullback-Leibler 散度损失纠正;其余轮次保留在输入中作为上下文但不计算损失。成功会话同时提供模仿和纠正目标,失败会话只提供纠正目标。
提示是简短的纠正指令,依据模型已有信息。例如一次搜索调用把 recency_filter 设为“year”,而 schema 只允许“day”“week”“month”,提示会指出失败调用、附上校验错误,并建议允许取值或省略该字段。纠正部分用在策略自蒸馏:训练器在记录的同一轮次上把同一 GLM 5.2 检查点跑两次,教师端看到提示,学生端看不到,两端都用教师强制,不生成替代答案;教师被分离出的下一 token 概率通过前向 KL 作为软目标。总损失为交叉熵项加 λ 乘 KL 项,再除以被模仿 token 数,λ 设 0 即退回标准监督微调。交叉熵项不可省,否则教师和学生可能通过忽略上下文达成一致。
数据管线取用由 GLM 5.2 服务、符合训练条件的 Computer 会话,含个人身份信息的会话和选择退出的用户被排除。一个 LLM 评判保留 5 分难度量表上评分为 4 或 5 的任务,两个 LLM 评判都认可最终交付才算成功;用户反馈由三个 LLM 评判定位责任轮次,至少两个同意,因为投诉前最后一个助手轮次只有约一半时间是根因。每条提示还对照犯错前可获得的信息检查,以减少后见偏差。例如用户询问 Paychex 上的“w3”,模型以为是 W-2 笔误并搜索了错误表格,提示针对更早的理解而非最终答案。
提示在训练前就已生效:在 985 个留出的工具错误轮次上,未改动基座模型避开原失败的比例从 75.1% 升至 93.7%,采取纠正动作的比例从 60.6% 升至 82.3%。用户反馈轮次中,有显式证据时修复或回到正轨的比例从 40.0% 升至 75.0%,推断意图时从 32.5% 升至 80.0%。离线工具错误率方面,原始 GLM 5.2 为 2.79%,仅做拒绝采样微调的检查点为 1.35%,再加在策略自蒸馏的检查点为 0.87%。Perplexity 说明这些检查点使用不同训练数据,不是匹配的消融实验;在 BrowseComp、SpreadsheetBench 等任务级基准上结果参差不齐。
线上结果范围更窄。每个 A/B 条件约 10 万名用户。早期检查点与原始 GLM 5.2 的失败率为 2.82% 对 2.94%,差异不显著;较晚检查点之间的比较得到前述 21.2% 的显著下降,推理时不使用提示。强烈不满比例从 2.58% 变为 2.54%,同样不显著。Perplexity 没有在线把较晚检查点与原始 GLM 5.2 直接对比。