据MarkTechPost报道,NVIDIA已发布TensorRT Model Connect(TRTMC)公开预览版。这是一个开源项目,可将受支持的Hugging Face或本地检查点通过两条命令转换为端到端的TensorRT推理,中间无需经过ONNX导出步骤。构建产生的带版本号的.bundle工件可通过原生C++任务API运行,使推理能在C++服务、嵌入式应用或机器人技术栈中执行,运行时无需PyTorch。

该项目采用Apache-2.0许可证,以一组按模型系列组织的参考实现形式提供,而非单一通用转换器。据NVIDIA介绍,整个项目——包括模型实现、性能调优、测试、集成和文档——均在人工指导与审查下,使用OpenAI Codex代理构建。设计上,TRTMC将构建和运行时用带版本号的工件分离:Python负责检查点解析和TensorRT引擎构建,原生C++配置则执行推理。少数混合配置会调用辅助Python可执行文件,并在清单中显式声明该依赖。应用通过generate()、transcribe()、generate_image()、embed()、solve()等任务API调用,无需维护转换阶段和逐模型的集成代码。trtmc inspect命令可显示bundle的类型、模型家族、精度、运行时身份和引擎,便于审计。

性能数据方面,截至2026年7月29日的GB300快照覆盖76个家族的105个配置,其中102个配置比其声明的参考值快超过5%。快速开始示例为构建并运行Qwen3-0.6B:先运行trtmc build命令,指定精度bf16、最大缓存长度16384和输出文件名,再运行trtmc run命令携带提示词即可。同一bundle可在C++中用trtmc::load("./qwen3-0.6b.bundle")加载。

当前发布的轮子仅支持Linux aarch64,Python 3.10或3.12,glibc 2.39或更新版本,以及TensorRT 11.1.0.106。x86_64用户需通过Docker源码构建方式使用。NVIDIA认为,该工具最适合已拥有自有推理栈的团队,如NVIDIA生态内的初创公司、机器人和设备公司,以及中大型企业的平台或推理团队;对于以Python服务为主的小团队,收益不大。受监管的企业宜等待带标签的正式版本发布后再标准化采用。适用行业包括机器人及自主机器、工业检测与制造、车载计算、医疗设备、国防航天边缘系统及媒体处理等需要推理内嵌于C++二进制的场景。NVIDIA对比了传统PyTorch到ONNX或TorchScript再到TensorRT及逐模型C++集成的路径,指出新方案消除了导出缺口、重复的模型集成以及跨多个转换工件的验证分散等问题。