据MarkTechPost报道,加州大学伯克利分校的一个研究团队近日发布了CUA-Lite,一个面向计算机操作智能体(CUA)的开源平台。该平台的设计思路侧重基础设施而非单一模型:研发者认为,训练和评测一个计算机操作智能体需要智能体、环境、轨迹数据以及配套的评估训练框架四部分,而目前这些部分分散在多个互不兼容的独立代码库中。CUA-Lite将桌面、浏览器和移动端环境统一到同一个动作空间、同一套数据模式和同一条命令之下,并声称可在任何Docker主机上运行,无需虚拟机专用硬件支持。

平台最具体的贡献是Lite.OSWorld。原本OSWorld基准为每个任务提供一台完整的QEMU/KVM虚拟机,依赖大多数托管基础设施并不具备的嵌套虚拟化能力。CUA-Lite将同一任务套件和评估器复现为普通Docker容器中的GNOME桌面环境。据该平台公布的数据,Lite.OSWorld的运行时内存从OSWorld虚拟机的4.1GB降至0.9GB,冷启动时间从29.9秒降至23.8秒,并行实例数约为原版的4.6倍。团队表示,在13个模型上,Lite.OSWorld的评分与OSWorld虚拟机评分一致,因此容器内获得的评分或训练信号可以迁移到真实基准上。该统一底座还衍生出Lite.ScaleCUA、Lite.CUAGym和Lite.CUAWorld等沙盒环境,其中Lite.CUAWorld覆盖约40个应用程序,平台宣称总计包含超过3万个可验证任务。

在数据层面,CUA-Lite推出名为LiteSample的统一监督学习模式,每个环境、智能体和任务类型共用该模式,并以parquet文件和图片形式提供。已有包括Aguvis、OpenCUA、ScaleCUA、GUI-360、GUIOdyssey和Multimodal-Mind2Web在内的十余个既有数据集被预处理为该格式,并免费发布在Hugging Face上。团队还用前沿教师模型在上述沙盒中滚动生成了新的数据集,用于蒸馏到较小的学生模型。针对不同模型家族对脚手架要求不同的问题,框架内置了按模型适配的转换器,可将统一LiteSample打包为各模型各自的训练格式,并支持历史压缩以在单次前向中共享多个步骤。

平台通过lite.gym接口连接智能体与环境,每个平台使用单一动作空间。目前内置超过10种智能体,涵盖GPT、Claude、Gemini、Qwen3-VL、UI-TARS、Fara-7B、MAI-UI等模型,并集成了超过15个基准,包括桌面端的OSWorld、OSWorld-2、WindowsAgentArena、CUABench,浏览器端的WebArena、VisualWebArena、MiniWoB、WebVoyager、Online-Mind2Web、WebGym,移动端的AndroidWorld、AndroidLab、MobileWorld、MobileGym,以及定位评估的ScreenSpot-Pro和OSWorld-G。用户只需替换脚本中的模型与环境参数即可切换任务。该统一循环也支持训练:监督微调部分,文档记载在两张GPU上用Qwen3-VL-2B-Instruct在Lite.ScaleCUA桌面轨迹上微调,将Lite.OSWorld评测集上的平均回合回报从0.138提升至0.237;强化学习部分,环境内评分的rollout驱动基于Slime的GRPO更新,并给出了覆盖28个应用、416个移动任务的MobileGym示例。需要说明的是,该结果是单一配置下的报告值,并非独立复现。

该平台可在任意Docker主机上部署,但仓库目前没有明确附带许可证,用户在使用前需自行核实商业条款。相关项目页面、GitHub代码仓库和Hugging Face数据集均已公开发布。