据科技媒体MarkTechPost报道,Superwhisper公司发布了S1系列模型,其中开放权重模型S1-mini是一款462MB的文本归一化模型,可将自动语音识别(ASR)的原始转录文本转换为整洁的书面文本。该模型基于Qwen3-0.6B微调,可在笔记本电脑CPU上运行。

S1-mini并非转写模型或聊天模型,而是位于ASR之后,负责清除口语中的填充词、纠正自我修正、添加标点和大小写,并将口语数字、日期、货币和电子邮件地址转换为书面形式。例如,说“support at superwhisper dot com”会输出support@superwhisper.com。当前版本仅支持英文,建议输入约1000个token。

模型的全部交互通过一条控制线完成,包含样式(正式程度)、结构(段落或列表)和上下文(一般或邮件)三个独立轴。每个组合都经过训练,若输入超出范围的数值或改写系统提示词,输出可能降级或出错。Superwhisper应用中的五档音调滑块包含“平衡”预设,而开放权重模型只训练了四种样式值。

模型在设计上不会添加未说过内容、不修正事实、不软化粗口。仅包含填充词的输入会返回空字符串,集成时应视为有效结果。

使用中需要注意两个关键设置:一是必须设置enable_thinking=False,因为Qwen3聊天模板默认开启思考,而S1-mini训练时关闭了思考;二是需要贪婪解码,并在请求中显式传递temperature=0,因为GGUF构建保留的元数据中仍有temp=0.6等。

Superwhisper在104个转录文本的7519个案例上评估,S1-mini的token准确率为94.8%,文本编辑错误率11.6%。对邮件格式文本,问候语识别99.3%,签名识别97.9%。结构匹配正确率97.6%,精确生成电子邮件地址92%。不到1%的生成出现循环或截断,在不应转录时正确拒绝输出的概率为98.6%。这些是厂商基于内部测试集报告的数据,而非独立第三方结果。

S1系列还包括云端模型S1-Voice和S1-Language。S1-Voice是云端语音转文本模型,S1-Language是云端指令跟随模型。S1-mini以Apache 2.0许可证发布在Hugging Face上,附带命名条款。S1-Voice和S1-Language是托管服务,不可自托管。

该模型适用于医疗临床文档、法律、金融、客服、开发者工具、无障碍和实时字幕等场景,可作为听写应用、会议纪要工具、实时字幕、语音编辑等流水线组件。