据SiliconANGLE报道,亚马逊云科技(AWS)上周正式全面推出Amazon CloudWatch Omni,并将其定位为下一代CloudWatch。该产品基于OpenTelemetry、内嵌AI、以应用为中心,可脱离AWS管理控制台运行,目标是把可观测性从“系统是否在运行”推进到回答“代理为什么那样做”。
数十年来,可观测性行业主要回答一个问题:系统是否在运行。代理式AI打破了这一模式。一个代理可以返回干净响应、达到延迟目标且不抛错误,却仍给客户错误答案、调用错误工具或从过期知识库取数。按传统指标,系统是健康的;但对业务而言,唯一重要的指标已经失败。AWS引用IDC预测称,到2029年部署的代理将超过10亿个。没有运维团队能人工审查如此多非确定性行为。
Omni的核心并非仪表盘,而是评估引擎。它捕获每一次追踪,内置17个评估器,对一致性、有用性、忠实性和路由正确性等指标打分。团队可在演练场比较提示词版本,从生产流量构建测试数据集,并自动捕捉回归。评估器也可持续对实时流量运行,使质量漂移像CPU飙升一样被标记。延迟和错误率无法说明答案是否正确,评分可以。
索尼是早期采用者。索尼AI加速部门高级总经理Masahiro Oba表示,在索尼,企业级代理式AI平台现在支持数百个概念验证和生产工作负载,在这一规模下,可观测性和评估不可或缺;借助Amazon CloudWatch Omni,他可以从单条追踪直接进入评估、AI分析、比较或数据集创建。Oba称,组装评估数据集往往是业务侧瓶颈,而基于实时追踪的一键数据集创建消除了这一瓶颈。
许多企业卡住的不是构建单个代理,而是治理数十或数百个代理,它们由不同团队构建,对“好”的定义也不同。
Omni让开发者离开控制台。开发者可在Visual Studio Code、Cursor和Kiro中获得原生扩展,在本地运行代理时看到追踪,无需AWS账户。运维人员获得独立Web体验,可通过Okta和Microsoft Entra ID等现有身份提供商单点登录。两者共享同一数据层,开发者调试的追踪与运维人员调查的是同一条。AWS承认其控制台面向基础设施管理员,而非如今承担运营责任的站点可靠性工程师、AI工程师和应用所有者。在集成开发环境中与开发者会合,并由Claude Code和Codex等AI编码助手设置插桩,可将质量工作前移到修复问题成本最低的环节。
统一数据层是另一差异点。许多初创公司能追踪大语言模型调用,而Omni让代理追踪、应用遥测和基础设施信号都存放在同一个CloudWatch数据存储中。一次调查可以从代理收到错误工具结果开始,转向受容量限制服务的API错误,最后落到数据库连接池耗尽。在多数企业,这需要三个工具、三个团队和大量会议来串联。AWS DevOps Agent在调查会话中默认启用,用于关联信号并保存完整调查历史。
Capital One是设计合作伙伴。Capital One云平台与韧性工程管理副总裁Parvez Naqvi表示,Capital One运营着金融服务领域最大的可观测性足迹之一;作为Amazon CloudWatch Omni设计合作伙伴,他们帮助塑造了一个AI驱动的统一可观测性解决方案,使工程师能在单一界面获得拓扑感知智能和对所有遥测的自然语言查询,并通过OpenTelemetry实现完整数据所有权。对银行等受严格监管行业,数据可移植性至关重要,这要求数据所有权。捕获的调查历史也被低估,在受监管行业中,它是AI事件如何被处理的审计证据。