2026年9月21日,开发者在Hacker News的Show HN板块发布名为Mini-AGI的动态持续学习模型,称其可在8GB显存条件下训练,并采用动态增删专家的混合专家(MoE)架构以及单条连续数据流、批大小为1的训练方式。项目代码已在GitHub公开,模型权重尚未发布。

作者在帖子中称,项目源于对消费级硬件无法训练10亿参数以上规模模型的不满。他认为现有模型虽然可以推理和微调,但训练过程往往无法由个人完全控制。他希望全程掌握模型在训练中接触的数据,使其与自身目标一致,而非受制于企业。

为此,作者提出两项设计。第一是使用包含大量专家的MoE,在训练过程中动态添加和剪枝专家,任一时刻只启用其中一小部分;参数总量因此只受磁盘空间限制,专家按需加载和卸载。第二是批大小为1、在单一连续数据流上训练,从而不必存储大型随机批次及其梯度,降低对显存的占用。作者称,经过与Claude的头脑风暴,他找到了一种可行路径,并在数周后得到当前结果。

作者承认在项目制作过程中使用了AI,并表示如果没有AI,完成这样的项目对他而言几乎不可能。他同时发布了完整训练运行的样本和目前的缩放定律图,称后者看起来很有前景。

据作者介绍,模型仍在读取其选定的78亿字符训练语料,权重尚未出炉,按当前读取速度还需约数周时间。训练数据以每段3.2万字符的连续交错文本作为单一流输入,作者将其类比为人的阅读方式。项目配置被描述为较为简单,使用者可以克隆代码并运行观察。该帖子在Hacker News获得33点,有4条评论。