据量子位于2026年10月9日报道,联想天禧AI自主研发的专业代码智能体框架TianxiCode配合DeepSeek-v4.1-Flash,在国际软件工程评测SWE-bench-Live(Lite分榜)中以71%的问题解决率排名全球第一,并正式通过官方审核。
SWE-bench-Live被描述为当前全球软件工程领域的权威动态评测基准,区别于考查简单语法或单函数生成的传统代码测试。该评测以真实GitHub项目中的问题为基础,评估模型与智能体生成代码补丁、修复问题的能力,并提供可复现的执行环境。官方还设立“Verified”核验机制,参评方案须提交全链路智能体运行轨迹,由官方团队审查评测输入、信息隔离环境,并排查是否向智能体泄露标准答案、测试用例或结果。TianxiCode与DeepSeek-v4.1-Flash通过审查并获得“Verified”认证。
量子位在报道中比喻称,在此次组合中,DeepSeek-v4.1-Flash承担“大脑”角色,负责阅读代码、理解语义和构思解法;TianxiCode则相当于工程师的眼、手、工具箱以及工作流规范。报道称,若缺乏顶层智能体架构的系统协同,即便调用顶级闭源模型,面对真实工程难题也常常难以解决。
TianxiCode在实际软件工程场景中展现出三项能力。其跨文件多跳检索与精准上下文管理,旨在大规模代码库中定位缺陷根因;自驱动规划与多轮工具调用,使其能够列出排错计划,运行测试、翻阅日志、比对修改记录,并在遇到阻碍时调整思路继续排查;闭环补丁生成与测试驱动自愈,则让其在隔离环境中运行代码,发现报错或功能破坏后自我反思与修改,直至补丁通过项目验收。量子位在报道中称,这些能力体现了天禧AI以自研工程架构驱动模型潜能的路径。
联想天禧AI表示,TianxiCode是其聚焦代码生成、工程开发的代码智能子能力,未来将应用到联想AI硬件产品中,并持续推动技术成果向开发者实际工具链沉淀。量子位在文末注明,该文由联想提供,量子位获授权转载,观点归原作者所有。