据MarkTechPost报道,一个名为Fly Language Model(FLM)的公开聊天机器人把完整保留的MaleCNS v1.0果蝇连接组接入冻结的LiquidAI LFM2.5-1.2B-Instruct骨干模型。开发者称其为世界首个Fly Language Model,并提到一个名为GPF(Generative Pre-trained Fly)的架构,但明确不宣称自己是首个基于连接组的语言模型。该系统可在本地部署,nftechie/flm仓库以MIT许可发布,在Python 3.12的macOS或Linux上运行,可使用MPS、CUDA或CPU,无需API密钥。
实际上,这是一个接在语言模型上的储备池计算机。MaleCNS图中有166,700个保留节点和25,582,938条有向边参与计算。图、骨干模型以及随机输入输出投影全部固定,只训练一个278,528参数的读出层,约占1,170,340,608个骨干参数的0.0238%。每个token,固定的高斯投影把2,048维token嵌入压到128个通道,每个储备池节点以随机符号接收一个通道。整个图随后按 x=tanh(W(0.6x+0.4Bc)) 更新,其中W保存经入度归一化的解剖接触计数。状态被池化到128个箱,经过两个训练得到的无偏置矩阵U(128乘128)和V(2,048乘128),再通过冻结的词表头投影,作为有界残差加到骨干logits上。残差在词表坐标上的RMS上限为0.25。
在32段新冻结的SmolTalk日常对话、共1,236个目标token上,三个拟合种子给出的结果为:冻结骨干NLL为1.381995;果蝇读出为1.359816±0.000110;直接输入读出为1.359328±0.000108;重新标记且不重训为1.381265±0.000802;无边为1.381995。果蝇读出把骨干改善0.0222 nat/token,困惑度从3.98降至3.90。但直接输入对照把同样的128通道token投影直接送入相同读出层而不经过图,在全部3个种子中都更好,每token相差0.000488 nat。配对自助法区间为+0.00000502到+0.00104,不支持存在果蝇特异的增益。
另外两个对照也重要。把W置零会精确移除残差,复现骨干的逐token损失,说明图确实参与计算。不重训而重新标记节点身份后,NLL回到基线附近,表明读出层依赖的是其学到的接口对齐,而非果蝇拓扑优于随机布线。研究报告还证明,该递归每token至多把初始状态差异收缩0.6;10个token后该上界为0.00605,20个token后为0.0000366。堆入166,700个细胞并未带来长时记忆,上下文仍来自骨干。
研究报告引用了更早的原型ngxson/fly-hf。该原型使用MaleCNS中49,393个细胞的中央脑子集作为储备池,在无预训练骨干的情况下用TinyStories训练,并明确不宣称是首个基于连接组的语言模型。FLM的不同在于规模,即使用完整保留图,以及冻结骨干设计,使语言能力来源可识别。研究工件仍保持私有,结果尚不能独立复现。