据Hacker News上的Show HN帖子,General Instinct联合创始人Guanming于9月22日发布InstinctFlash,一个面向机器人模型的高性能服务框架,采用AGPL-3.0许可。该框架宣称可在NVIDIA Jetson Thor上实时运行5B世界行动模型,并在部分模型上取得最高33.78倍加速。
据该帖介绍,在Jetson Thor上,仅靠运行时优化,InstinctFlash带来约1.2倍至7.9倍加速;若结合蒸馏后的少步扩散调度器,LingBot-VA最高加速33.78倍,推理步骤从原来的25个视觉步骤和50个动作步骤降至2个视觉步骤和4个动作步骤。在50个Robotwin2.0任务上,每个配置评估了1153个回合,LingBot-VA搭配InstinctFlash在2/4步设置下成功率为90.5%,基线在25/50步设置下成功率为92.1%。
该框架目前支持8个VLA和世界行动模型家族,包括pi0.5和NVIDIA Cosmos Policy,覆盖RTX 4090、RTX 5090和Jetson Thor。发布者称,用户只需提供微调后的检查点,InstinctFlash会处理其余工作,并通过Python运行时或兼容OpenPI的WebSocket服务器暴露加速后的模型。
发布者解释,开发InstinctFlash的原因是机器人策略部署中反复遇到同一问题:模型能力不断提升,但推理速度常常过慢,无法满足期望的控制回路。针对pi0.5,混合精度GEMM和CUDA图可加快计算并减少启动开销;针对Cosmos,缓存可避免扩散步骤间的重复计算。世界行动模型的扩散去噪步骤依赖前一步,这促使其开展少步蒸馏。
InstinctFlash的优化涉及六个方面:图方面包括CUDA图捕获、内存规划以及将预填充与重复执行分离;缓存方面跨扩散步骤和预测调用复用KV与条件状态;注意力方面为不同模型架构提供专用注意力路径;内核方面针对特定后端和张量布局使用融合操作与内核;精度方面采用FP8和混合精度执行;模型方面对扩散和动作生成进行少步蒸馏。
发布者称,三星、西门子以及其他机器人初创公司的团队已使用InstinctFlash,对VLA、WAM和基于扩散的世界模型进行加速。该项目现已在GitHub上开放访问,发布者同时附上在Jetson Thor上实时运行的5B世界行动模型演示视频,并提供更多实现细节和基准测试的博客链接。