据MarkTechPost报道,AWS旗下Strands Agents团队发布通用型开源智能体运行框架Strands Harness,以Apache 2.0协议提供Python和TypeScript版本,可本地运行或部署到云服务商,并以一行代码启动。团队称,在6项基准测试中,使用相同Claude或GPT模型时,该框架的Token成本比其他运行框架低28%,准确率接近。
Strands Harness所解决的问题是,开发者在Claude Code或Codex中验证智能体想法后,用自己的循环重建时往往遇到困难。该框架把Strands Harness SDK中的循环、工具、上下文处理、记忆和恢复等原语打包为可工作的默认配置。按文章描述,create_harness()返回的智能体可通过Amazon Bedrock、Anthropic、OpenAI、Google、Ollama或LiteLLM调用当前推理模型,内置shell、文件读写编辑和网络工具,将体积较大的工具结果卸载到文件并缓存请求中可复用的部分,支持跨运行长期记忆并通过会话ID恢复对话,还会把开放式子任务交给内置助手智能体,并用清单跟踪多步工作。它发现Agent Skills时会自动加载。捆绑的skills文件可帮助编码智能体生成面向AWS、GCP、Azure、Cloudflare和Modal的部署配置。
基准测试方面,Strands Agents团队在Amazon EC2上通过Harbor进行分布式评测,Harbor来自Terminal-Bench创建者。分数取ALFWorld、ContextBench、GAIA、WebShop、τ²-bench和Terminal-Bench 2.1六项基准的平均值,成本为每任务平均美元。对比对象包括Claude Code、Codex、oh-my-pi、OpenCode和DeepSeek Harness。文章脚注称,纳入DeepSeek Harness后,整体节省数字为28%。DeepSeek Harness整体Token效率最高,比Strands Harness便宜约14%,但在每项基准上得分都更低。图表中最高得分点是Claude Opus 5搭配Strands Harness,接近85%。
最直接的对比使用Claude Fable 5在Terminal-Bench 2.1上运行,每个框架89次试验。Strands Harness成本为56.29美元,准确率69.7;oh-my-pi成本86.83美元,准确率69.7;OpenCode成本73.42美元,准确率66.3;Claude Code成本248.05美元,准确率61.8;DeepSeek Harness成本40.30美元,准确率59.5。与Claude Code相比,Strands Harness成本低77%,得分高7.9个百分点;oh-my-pi准确率相同但成本高54%;DeepSeek Harness更便宜,但落后10.2个百分点。团队还称,另有两个开源运行框架在成本和准确率上表现良好。
效率来源方面,Strands Harness默认提供提示缓存和上下文管理。团队称上下文管理在很大程度上同时驱动Token效率和准确率。其规则包括:工具结果超过约1500 Token会被截断;上下文使用超过85%时触发摘要压缩;窗口溢出时在循环内进行上下文恢复。文章提到,HarnessTax研究比较Claude Code、Codex CLI和Pi在7个模型上的表现,发现运行框架选择对成功率影响很小,而同一模型可在最高5倍成本下达到类似成功率。Strands研究人员称,后续将发表关于其基准测试的论文。
使用方式上,可通过pip install strands-harness或npm install @strands-agents/harness安装,按名称选择模型,或指向本地Ollama模型。示例代码为from strands_harness import create_harness,然后agent = create_harness(model="litellm/openai/gpt-5.6-sol")。Strands CLI可用于用自然语言原型化智能体。在演示中,智能体被要求添加Playwright MCP服务器并测量一篇博客文章的视频加载延迟,运行/export后导出包含Playwright MCP的Python或TypeScript压缩包。CLI本身基于Strands Harness。Strands工程师Gautam Sirdeshmukh还用它构建了一个远程启动Strands Harness运行的桌面应用。用户可覆盖任何默认设置、替换模型、添加工具,或替换组件直至Strands Harness SDK。由于该框架是库依赖,笔记本上原型化的智能体与嵌入生产环境的是同一个。