据MarkTechPost报道,Cantina Security与Yeta Labs发布开放权重模型apex-flash-1,专门用于漏洞研究,并已在Hugging Face上以MIT许可证公开。该模型是对Z.ai GLM-5.3-Flash的强化学习微调版本,在60项留出漏洞任务中解决40项,pass@1为66.7%。
apex-flash-1总参数量为321.3B,依据其Hugging Face safetensors元数据。GLM-5.3-Flash基座是混合专家模型,激活参数量为18B。模型卡称,apex-flash-1可在vLLM、SGLang或Transformers上部署,但BF16精度下约需640GB GPU显存。
训练方面,Cantina使用GRPO方法,结合rank-256 LoRA和选择性全参数训练。数据由50个真实漏洞案例构建出150项任务,每个案例有三种变体:引导式白盒、聚焦式白盒和聚焦式黑盒。按模型卡说明,授权、身份与范围缺陷占案例的72%,会计与数值精度缺陷占18%,时间验证、业务规则和SSRF覆盖其余部分。RL推演在Codex智能体框架内、接近生产环境的软件与协议环境中运行。
Cantina从20个留出漏洞案例中选取60项任务进行评估,每个模型运行一次,成本按供应商定价估算。apex-flash-1解决40/60,pass@1为66.7%,成本约2.38美元;GLM-5.3-Flash基座解决36/60,通过率60.0%,成本约4.56美元;Claude Opus 5 High解决43/60,通过率71.7%,成本约74.68美元。Opus多解决3项任务,但每次运行成本约为apex-flash-1的31倍,折合每个解决任务约0.06美元对1.74美元。上述数字均为公司报告,且基于内部基准。
Cantina将apex-flash-1定位为由更大模型编排的工作模型,而非编排器。模型卡列出的目标能力包括代码阅读、工具使用、漏洞利用开发和验证。随模型还发布一个实验性的apex-flash-1-abliterated变体,拒绝行为经过修改,但未单独评估。Cantina给出的理由是,防御方需要能够在本地运行和控制的强能力模型。
相关对比信息显示,Aikido Security的Altar-1基于修剪后的GLM-5.3,采用专家剪枝与量化,主要面向气隙自主渗透测试,在32个CVE内部集上录得60.4%召回率;Cisco Foundation-Sec-8B-Reasoning基于Llama 3.1 8B,面向SOC分流和威胁防御,使用自定义许可。Cantina的模型则定位为智能体漏洞研究的工作模型。