据TechCrunch AI报道,AI基准测试初创公司Vals上个月完成4000万美元A轮融资,由Andreessen Horowitz领投。这家2024年成立、总部位于旧金山的公司,试图以不公开测试材料、按法律金融编程等行业任务评估模型的方式,回应现有基准测试落后于模型进步的问题。

Vals此前已获8VC和Bloomberg Beta领投的种子轮。公司联合创始人拉扬·克里希南现年25岁,曾在Palantir实习,在斯坦福大学读本科期间为微软和该校人工智能实验室工作。克里希南称,Vals源于他对基准测试落后于行业发展的观察:一批能力强的新模型快速进入市场,而学术基准未能跟上这一前沿进展。他认为,AI正被整合进社会各个部分,基准测试应验证模型能否做到公司宣称能做到的事。

在旧金山Folsom街一栋曾作为大型酿酒厂的两层旧砖楼中,Vals与多家初创公司共用办公空间。克里希南说,历史上评估常以抽象方式衡量智能,例如模型是否知道足够信息以通过律师资格考试。Vals希望与这类做法区分。许多基准测试系统提供公开测试,公司可能针对这些测试训练模型,从而在考试中作弊;Vals不公开具体测试材料。

Vals的评估不只衡量通用知识,还考察模型完成法律、金融、编程等特定行业复杂任务的能力。克里希南表示,他们关注模型的真实影响,即能否在每个领域产出与人类同等质量的产品。他称,评估也会检查负面结果,分析如果这些模型在世界上失控,可能带来哪些负面影响。

Vals衡量的能力范围仍在扩大。除较传统行业外,公司还在推进更独特的领域。克里希南说,他们有一个关于递归自我改进的基准,并在心理健康、网络安全、生物安全和武装冲突法方面开展一些工作,以理解如何将日内瓦公约适用于模型。

企业付费请Vals测试模型,这看似奇怪:为什么公司要花钱知道自己模型表现不佳?但有效测量有助于企业排查问题并持续改进。克里希南将这种收入模式比作学生付费参加SAT考试。这些评估也正成为企业收购新AI模型时的关键决策因素。

Vals近期披露,其当前收入是去年的八倍。公司年初仅有8人,现已增至25人。克里希南说,随着公司成长,计划搬到更大的办公室,并再招聘10到15人。公司最近还启动了一个项目,向联邦机构提供模型评估。

克里希南认为,Vals的基准测试体系将成为AI公司思考业务增长和建立公众信任的未来方式。他称,AI公司正开始上市,SpaceX已经上市,Anthropic预计今年晚些时候上市,他怀疑OpenAI很快也会上市。随着AI模型成为经济核心并更广泛扩散,他认为Vals所做的基准和评估将推动模型使用,并成为这些公司提交公开文件或谈论未来AI投资时的核心部分。