据MarkTechPost于8月30日发布的一份基准测试,在面向语音与实时智能体推理API的首字时延(TTFT)评测中,Baseten提供的gpt-oss-120b(高负载配置)以0.23秒的中位时延成为表现最快的模型。但评测同时指出,TTFT仅是延迟预算的第一环,用户真正感知的是首个完整句子生成时间(TTFS),而非首token。

该评测对语音栈中的LLM、语音转文本、文本转语音及语音转语音各环节进行了分层测量。由于语音合成模型必须获得完整子句才能开始生成音频,TTFT只决定生成何时启动,输出速度(tokens/秒)则决定首句完成快慢。LiveKit在其部署文章中主张,TTFS才是用户实际感受到的指标。这意味着,若某提供商只赢下TTFT而输掉输出速度,整体体验仍会显得迟缓。

延迟预算方面,LiveKit给出一次语音交互的典型分配:语音识别(STT)约100至200毫秒,流式LLM约300至500毫秒,语音合成(TTS)约100至200毫秒,WebRTC网络开销约50至150毫秒,端到端目标为700毫秒至1.2秒。Pipecat联合创始人Kwindla Hultman Kramer建议将中位数语音到语音延迟控制在800毫秒,概念验证可放宽至1500毫秒。Daily的测量显示,人类典型对话响应约为500毫秒,超过800毫秒就会感到不自然,这要求语音环路整体低于1500毫秒,相当于为文本模式LLM留出约700毫秒的TTFT预算。

评测方法上有几个关键变化:Artificial Analysis已将默认工作负载从1k输入token改为10k,更贴近生产环境;测试在Google Cloud us-central1-a区域运行,结果包含网络延迟;对于推理模型,TTFT计入的是首个推理token而非答案token;测量从请求发送到收到首个可用token;同时TTFT在不同运行间波动较大,供应商可能在不改变模型名的情况下调整推理栈或权重。

具体榜单中,除Baseten外,DeepInfra的Nemotron 3 Ultra以0.28秒位列第三,Cohere的North Mini Code为0.32秒。高吞吐量供应商的表现同样值得注意:Cerebras的gpt-oss-120b(高负载)TTFT为0.49秒,但输出速度高达1697 tok/s;Groq的gpt-oss-20b(高负载)TTFT为0.82秒。这显示出硅谷供应商在吞吐量上占优,但语音场景更需要在低TTFT与合理输出速度之间取得平衡。