据SiliconANGLE报道,总部位于美国内华达州里诺的AI推理设备开发商Positron AI Inc.于当地时间9月10日宣布完成8.75亿美元融资,估值升至50亿美元,为今年2月的五倍。公司计划用这笔资金推进以LPDDR5X内存替代HBM的Titan推理设备和自研芯片Asimov的量产。

本轮融资由NEA、Atreides Management、Valor Equity Partners、Andra Capital、SemiAnalysis Capital以及网景公司联合创始人吉姆·克拉克领投,另有十多家机构投资者参与。

大语言模型推理需要在显卡计算电路和内存电路之间频繁搬运数据,速度由内存带宽衡量,带宽越高推理越快。服务器级显卡通常配备HBM,这是目前市场上内存带宽最高的RAM类型。但HBM供应远低于需求,用于将HBM内存与显卡计算电路集成的互连器件也短缺。

Positron称其绕开了这一供应链瓶颈。公司制造的推理设备用主要面向智能手机的LPDDR5X替代HBM。LPDDR5X比HBM更容易获得且成本更低,但内存带宽明显较低,通常意味着推理速度更慢。Positron称已找到弥合性能差距的方法。

该公司称,多数AI加速器对其HBM模块内存带宽的利用率不足30%;Positron的推理设备可释放LPDDR5X超过90%的吞吐量,硬件利用率的提升弥补了理论峰值性能的差距。

旗舰系统Titan最多配备18.4TB LPDDR5X,可提供23.68Tbps内存带宽。Positron称,凭借大容量内存池,单台Titan设备可运行参数规模达32万亿、上下文窗口为100亿token的大语言模型。

Titan使用名为Asimov的自研芯片执行推理计算。该处理器围绕脉动阵列构建,由一组相同计算模块组成,每个模块带有就近内存。Asimov用就近内存存储大语言模型权重。脉动阵列由针对激活函数优化的模块支持,激活函数决定大语言模型哪些神经网络参与推理任务。Asimov还集成CPU核心,作为“可编程逃生通道”,接管芯片其他模块未优化的任务。

每台Titan设备最多可搭载8颗Asimov芯片。客户可将多套系统连接成最多16384个加速器的集群。

Titan和Asimov尚未量产。Positron称,模拟数据显示,由其芯片驱动的服务器机架每美元可处理的token数量最多可达英伟达Blackwell GB300 NVL72设备的26倍。

Positron首席执行官Mitesh Agrawal表示:“我们现在的重点是让Asimov流片、将Titan投入生产,并扩大制造规模以满足我们面前的需求。这笔融资让我们有资源做到这一点。”

Positron预计今年年底使用台积电3纳米节点流片Asimov,2027年下半年跟进量产。同时,公司将扩大Titan设备制造,重点是从合作伙伴处获得LPDDR5X供应承诺。