8月28日,OpenAI公布自研推理芯片Jalapeño的性能数据,显示每瓦AI工作提高约1.5至1.9倍。此前一周,Cursor向全部付费计划开放Origin早期测试,而Anthropic的Claude技术栈也因多项用户体验问题被集中讨论。这些事件表明,AI Agent的规模化正在同时撬动推理算力、模型上下文与代码托管基础设施。
据雷峰网报道,OpenAI公开的数据显示,Jalapeño在GPT-OSS 120B、DeepSeek R1 670B和Kimi K2.5 1T上的峰值吞吐位置每瓦完成的工作提高约1.5至1.9倍,端到端延迟降低约1.7至3.6倍;在交互速度要求较高的区间,性能提升约2.1至4.1倍。芯片额定功耗700W,测试中持续功耗未超过550W。这些数据在Reddit上引发与NVIDIA Rubin的对比,但看法并不一致:有人认为Jalapeño已进入Rubin的效率区间,也有人认为测试条件、软件优化和平台形态未对齐,目前无法直接分高下。
数据背后是推理负载的结构性变化。据雷峰网报道,Jalapeño未采用将Prefill和Decode拆到不同硬件的激进路线,而是强调模型状态和KV Cache的放置与数据局部性。NVIDIA在Hot Chips 2026上展示了另一种选择:将Groq 3 LPU引入Vera Rubin系统,GPU负责Prefill,低延迟Decode交给LPU;Google则将TPU 8分为面向训练的8t和面向推理的8i,后者配置了更多HBM和SRAM。这些设计均指向同一瓶颈:当大模型进入持续服务阶段,内存带宽与数据移动比矩阵算力更紧迫。
Agent让推理负载进一步复杂化。据雷峰网报道,Claude Code原定8月19日结束的+50%周额度加成被延长至8月31日,Hacker News上有用户抱怨“并不复杂的任务”很快耗掉额度。原因在于Agent任务按“模型判断—调用工具—继续判断”循环执行,每次工具返回都会进入上下文,长任务每步所需处理的状态不断累积。Claude Code的上下文压缩可能丢失关键约束,被压缩的历史会改变后续判断。与之类似,OpenAI CEO奥特曼在播客中承认,Sora视频生成太吃compute,同一时期Codex优先级更高。据雷峰网分析,Sora的算力集中在连续且独占的视频生成路径中,而Codex的Agent工作流将算力碎片化,可通过缓存、批处理和工具等待复用GPU,因此两者的扩张速度出现差异。
代码托管也在为Agent改变。8月17日,GitHub出现大范围服务异常,部分时段Web与API请求错误率接近20%。当日,Cursor向全部付费计划逐步开放Origin早期测试,将repository、PR、checks、review、merge和Automations纳入统一体系,明确为“agent scale”设计。据雷峰网报道,Origin在6月演示中展示单仓库22.6 commit/s,而人类开发者的提交节奏慢得多。Origin还通过收购Graphite强化stacked PR和merge queue能力,并提供“Detach from GitHub”迁移路径。这显示出代码仓库的主人正从人变成Agent,现有协作基础设施需要适应高频、并发的机器行为。