据Hugging Face博客9月2日消息,IBM时间序列基础模型Granite已与Confluent数据流平台集成,用户可直接在Apache Flink内调用该模型对实时流数据进行预测与异常检测。该服务首先在Confluent Cloud的AWS区域开放,随后将推出支持本地和混合环境的Confluent Platform版本。

传统预测通常按场景逐个定制模型,每类模型需要数月专家工作。时间序列基础模型则在大规模不同信号上预训练,可泛化到从未见过的数据序列,给定一段测量窗口即可预测后续走势。IBM围绕模型提供预测、异常检测、相似性搜索、分类、补值和优化等能力,需求规划、欺诈分析或工艺工程等岗位的非数据科学专家也能在自有数据流上直接使用。

博文举例说,巧克力工厂的一条调温产线对温度、速度和吞吐量每几秒采样一次,此前只按固定阈值监控。接入基础模型后,系统可预测晚班产量,使计划员提前发现缺口;对照正常行为识别缓慢漂移;匹配工厂历史中相似运行批次,并针对可控参数进行条件预测。该模型可复制到所有产线,无需数据科学团队参与。

IBM在对外提供前已将这些模型用于自身产品和运营,并与水泥、钢铁、纸浆造纸、食品和电信等行业设计伙伴进行验证。博文称,预测准确率每提高一个百分点带来的价值可达数百万,生产力提升5至10倍,原本依赖专家的分析工作现在由掌握决策的领域专家完成。该系列模型的下载量已超过4400万次。

Confluent负责提供实时业务数据、治理和下游分发。Flink可以管理每个序列的状态和容错,使模型能取得所需历史数据,无需为每次调用单独建立数据存储或查询数据库。Confluent Cloud的原生推理接口支持在Flink SQL中直接调用Granite模型,不要求用户管理模型服务基础设施或额外凭证。博文认为,这种模式把实时智能放到数据所在处。信号价值随时间衰减,例如泵当天发现偏移可生成一个维修工单,若推迟一周则可能变成停机事故。