据量子位8月31日报道,来自普林斯顿大学、蚂蚁集团和斯坦福大学的研究团队发布了一项名为AQuA的量化研究Agent系统,让自主研究系统在自我改进循环中持续进化的同时,通过严格的隔离机制保证回测结果经得起检验,避免数据泄漏或反复查看测试集导致的过拟合。
AQuA由两套独立系统组成,Part I研究符号化因子,Part II研究可训练模型。它们使用不同的Agent、记忆和候选空间,但遵循相同的研究原则:让通过验证的实验进入下一轮决策,同时把数据路径和评价规则留在循环之外。实验中,Part I在加密资产五分钟级数据上得到约0.190的组合验证集Spearman IC;Part II在美股未来30分钟收益预测上取得+0.0843的逐股票IC,转化后的多空策略在计入双边换手成本后,样本外Sharpe最高达到+2.50,2021至2025年间策略每年的Sharpe都为正。
论文附录记录了一次早期失败,解释了AQuA当前架构的来源。当时Agent可以直接编写特征代码,另一个Agent负责检查前视偏差。在一次实验中,候选特征“盘中成交量参与率”在文字描述上只依赖已经发生的成交,审查Agent据此放行,但代码中的分母实际是当天从开盘到收盘的总成交量,导致下午尚未发生的成交量进入分母。重新划分评估窗口后,效果没有保留。这次失败使团队放弃了“再增加一道模型审查”的思路,转而限制Agent只能组合预先登记的因果算子和模型组件,从数据路径上杜绝这类泄漏。
AQuA区分了两个泄漏入口。一是生成过程,特征、标签、归一化或数据变换一旦能访问预测时点之后的信息,实验便失去意义。系统在自主循环启动前固定数据切分、特征、标签和评价器,Agent不能改写数据加载器和评价逻辑。二是选择过程,搜索阶段只向Agent返回验证集分数,最终测试窗口在配置确定后才运行,结果不返回给Agent继续调参。Part II中,2010至2019年用于训练,2020年作为隔离带,2021至2025年才是最终测试窗口。
Part I由AI Manager调度六个专业Agent,分别负责数据质量、市场事件、机制提出、统计检验、交易含义检查和证据保存。论文展示的一轮研究从未平仓合约快速下降后的价格反弹是否容易失败开始,最终表现较好的单因子IC约为0.026至0.037,20轮自主研究后组合验证集Spearman IC上升至约0.190。Part II则预测每只美股未来30分钟收益,每轮实验只提交一个配置差异,固定数据路径和评价器让模型变体可以直接比较。最终混合时序模型在同一评价器下达到+0.0843的逐股票IC,强于GRU基线的+0.0613;按双边换手成本2 bps计入后,样本外Sharpe为+2.15,加入波动率控制后升至+2.50。
AQuA把可信度放在研究环境本身,而不是Agent对自身推理的解释上。研究者不必逐句判断Agent的推理是否可信,可以把主要精力放在定义数据、可接受的实验动作、候选比较规则和进入下一轮研究的资格。这种设计思路也可迁移到自动调参、材料发现、药物筛选等需要Agent反复调用评价器的场景,通过隔离生成过程和选择过程来防止研究失真。