据MarkTechPost报道,一项开源课程研究显示,AI代理系统的性能关键可能不在模型选择,而在运行框架。在LangChain的Terminal-Bench实验中,仅更换框架而保持模型不变,一个编码代理从约第30名跃升至前5名。这一结果将问题焦点转向如何运行代理循环。Paul Iusztin通过Decoding AI发布的开源课程《从头构建编程代理》,用Python构建了一个名为Decode的代理,并区分了三种运行模式,每种模式具有不同的延迟特征,因此适配不同的推理提供商。

Decode的核心是一个无界面的无头框架,其中运行着所有代理共享的循环:大模型选择动作,工具执行,观察结果反馈回上下文窗口。代理本身很小,Decode中仅有约20行Pydantic AI定义,而Claude Code泄露的源码中核心循环约150行,其余部分如记忆、技能、沙箱、权限、LSP反馈和压缩都是框架内容。围绕这一核心,三种模式通过不同接口实现。

第一种是交互在线模式。终端UI连接到同一进程中的实时会话,事件通过异步生成器流式返回。此模式的难点在于转向控制:在工具调用进行中输入消息会破坏当前回合。Decode采用转向队列和优先级门控,将输入缓冲并在安全边界注入,例如模型请求前或回合结束前。用户可按键控制转向、排队后续操作或协作中止。由于人类在逐字阅读输出,该模式受延迟限制,适合使用低延迟托管API。

第二种是远程离线模式。该模式保持无头框架,通过代理运行时在服务器上运行。Decode使用Kitaru和ZenML,部署于GCP,代理在Modal上执行。没有人在实时观看,任务队列并行分发到多个框架,各自生成代码合并请求。运行时逐步记录进度,中途崩溃的沙箱可从最后记录步骤恢复,等待人工输入的运行会冻结且不消耗算力。此模式追求单位成本的吞吐量而非首字延迟。

第三种是异步在线模式。实时会话将工作交给任务队列后立即返回,后台工作流并行执行大模型调用并在稍后回传结果。用户在线但不逐步骤查看。队列持有工作,因此运行可超出启动它的客户端生命周期。这种模式适用于Slack触发的代理和后台代码审查,计费方式接近批处理而非聊天。

成本模型随延迟需求变化,差异显著。以1000份文档、每份3万输入token和约500输出token为例,按前沿API每百万输入3美元、每百万输出15美元计算,成本约97美元。由于每份文档前缀不同,提示缓存无法降低费用。而在服务器无GPU上以每秒约3000 token批处理,同样工作不到3小时GPU时间,成本约13美元。反向情况同样尖锐:Decode默认模型Qwen3.6 35B在单个H200上运行,Modal定价为每秒0.001261美元,约每小时4.54美元。若交互代理空闲等待人工确认消耗10小时,将增加约45美元费用。这表明交互模式按token付费是因为人在等待,而离线与异步模式按GPU小时付费是因为目标是吞吐量且需避免空闲。

另一个维度是无服务器与预留容量的比较。Modal的分析显示,预留容量按峰值率收取整个合同费用,无服务器则跟随需求曲线。当峰值与平均值的比率超过预留折扣时,无服务器更便宜。Modal报告称推理、训练和代理开发的典型折扣为2至5倍,而峰值平均比为5至10倍,行业调查显示预留容量利用率低于30%,常低于10%。