据量子位报道,北京中关村学院7名博士生用一个暑假,从零训练出7B大模型ZGCM-1,并将模型权重、训练代码、各阶段数据配方、中间checkpoint和训练日志公开。团队称,希望让其他研究者可以追溯和复现整个训练流程。

在通用评测中,ZGCM-1与Qwen3-8B等同规模模型表现相近;在部分数学推理和搜索评测中,它可与Qwen3-235B-A22B、GLM-5.1等更大规模模型比较。项目称,ZGCM-1在14项推理评测的同规模模型比较中处于领先地位,部分搜索和工具调用任务也显示较小模型的潜力。

这7人最初因兴趣凑到一起,两人来自人工智能方向,两人来自网络方向,另外三人分别来自化学、生物和网安。平时他们多是在现成模型上做微调,看技术报告后仍对数据选择、训练排错和方法留存存有疑问,于是在一次吃火锅时决定自己从头训练一次。老师起初半信半疑,先给了一些算力;团队先复现已有项目、快速迭代小模型,跑通流程后获得更多资源。

真正训练7B模型后,他们发现数据、算法、训练、集群、评测等每项都相当于大厂一个专项团队的工作。数万亿token来自不同来源,质量参差不齐,清洗、去重、检查格式和核对分布的工作量超出七人承受范围。团队于是组建数百个Agent,分出做数据、跑实验和做评测的子团队,并搭建类似论坛的任务发布与汇报系统,由研究者提出目标、设定约束和做关键判断,Agent推进具体工作。

在数据处理上,Agent能依据人给出的质量要求编写清洗脚本,检查数据分布并自动调整规则和阈值。在实验环节,Agent可提交任务、监控日志、定位故障、调整配置,还能发现存储与数据传输瓶颈,优化训练框架的I/O流程。团队还通过自研ZGent平台,把会议讨论、研发决策和计划积累为共享上下文,并把验证过的脚本、工作流和debug经验沉淀为可复用Skill。

团队将研发过程拆成11类任务,按L1到L5自主性框架评级。结果显示,实验监控和部署达到L4,即人给定目标与约束后,Agent可独立规划、执行并根据反馈调整;模型架构和学习算法设计仍在L2,更多是帮助实现已有方案、运行预设实验。研究什么、关键设计怎么选,仍需人主导。

训练并非因此顺利。一次训练中loss仍在下降,模型能力却出现明显退步。团队追查到底层数据分片和shuffle环节,发现实际送进训练的数据比例发生波动。此后他们更密集保存中间checkpoint,追踪知识、数学、代码和推理等能力变化,并建立ACE原子能力评测体系,把能力拆成18类、183项,以2503个探针检查。内部分布式评测系统中,一轮诊断约需两三分钟。

为解决长推理、搜索和多轮工具调用的上下文成本,团队采用局部注意力与全局注意力结合的架构,在训练中把上下文从16K逐步扩展到64K、256K。据量子位报道,在256K上下文下,该设计相较全注意力方案带来约3.94倍吞吐提升,KV Cache占用降至约六分之一。团队还结合Muon和FP8改善训练效率,用延迟缩放与TWEO抑制极端激活值;在16K预训练中达到相同loss的效率,相比标准BF16/AdamW基线提高约4.2倍。

SFT阶段,更严格的质量筛选让样本减少约44.9%,整体评测表现反而有所提升,但并非每项能力都同步受益。团队还发现,长思维链数据比例过高会损害指令遵循,Agent数据也不能脱离通用能力单独训练。这些结论来自实验反复修正。

模型训练完成后,团队把权重、中间checkpoint、训练代码、数据配方和日志一并开放。他们认为,最终权重能让人使用模型,而过程记录可以让其他研究者追踪能力如何形成、检查改动带来什么。目前团队已开始尝试400B、500B规模模型,准备继续验证7B阶段方法在更大规模上的可用性。项目由北京中关村学院与中关村人工智能研究院的何纪言指导,由AI核心学部、软件智能研究所、未来实验室师生共同完成。