9月10日,IBM与NASA发布开源人工智能模型NASA-IBM Lunar Foundation Model,并在Hugging Face上线,同时公开一套月球数据集。该模型用于分析过去数十年积累的PB级月球观测数据,识别对NASA建立月球持续人类存在关键的地质特征。
据TechRadar报道,模型由IBM和NASA研究人员在多模态NASA数据集上训练,数据集随模型一同发布。此前科学家常依赖人工分析或低分辨率、任务专用AI模型,这类方法计算需求高,且往往达不到详细地理分析所需精度。新基础模型让研究人员不必为每个潜在问题单独构建模型,而可以用同一个模型研究多种月球地质特征。
模型已经表现出实际用途。TechRadar称,它在识别陨石坑和火山特征方面更为准确,并显著降低定位潜在冰沉积的误差。Engadget报道,NASA和IBM将模型与微软训练的高分辨率图像视觉系统SwinV2-B对比,在冰沉积定位任务中误差减少23%;在陨石坑识别和分类基准测试中,模型使用一半训练数据,表现比SwinV2-B高19%。
Engadget还称,8月5日SpaceX猎鹰9号火箭撞击月球后,IBM把撞击图像输入模型,模型首次尝试就正确识别出撞击位置是一处新陨石坑,尽管它与已有陨石坑高度重叠。IBM Research欧洲、英国和爱尔兰总监Juan Bernabe-Moreno说,模型“工作得非常好”。
训练该模型面临特殊困难。Bernabe-Moreno解释,地球观测图像有大气散射带来的环境光,阴影边缘较柔和;月球阴影呈刀刃般锐利且漆黑,被拍摄的阴影像素不携带信息,同一陨石坑在不同图像中可能看起来完全不同。传统计算机视觉训练常遮住图像一部分,再让模型根据学习到的模式重建缺失部分,但月球上许多陨石坑从轨道看极为相似,IBM按传统方式训练时遭遇“完全失败”。研究团队随后把月球像橘子一样分成多个楔形,将训练用楔形与测试用楔形完全分开,使模型获得一致性。
TechRadar称,数据集是首个统一、公开可用并可直接用于机器学习的月球数据缓存,汇集4项任务、9台仪器的30多个空间对齐图层,包括数万张图像和地图,来自NASA的月球勘测轨道飞行器LRO和GRAIL任务。Engadget称,数据集还包含日本SELENE任务的图像和仪器数据。Bernabe-Moreno说,数据被组织成网格,每个像素成像数据对应其他模态数据,社区现在拥有超过200万个数据点的共注册数据集。他指出,AI模型会被其他模型取代,真正创造AI模型产业的是数据。
TechRadar指出,识别月球冰沉积尤其关键,因为水和氧对建立月球基地、甚至为未来火星任务制造火箭燃料都不可或缺。扫描不规则月海斑块等火山特征,有助于了解月球火山历史和热演化,并帮助识别着陆及其他表面作业地点。研究陨石坑可提供月球历史、不同地形年龄、地质结构乃至早期月球内部化学成分的信息,同时帮助排除陡坡和巨石等危险,寻找安全着陆点。
IBM与NASA合作已超过五十年,包括阿波罗任务。Bernabe-Moreno说:“揭开月球的奥秘需要从海量科学数据中学习的能力。NASA-IBM月球基础模型为科学家提供大规模探索月球的基础,连接不同仪器的观测,揭示孤立时难以看到的模式,并提供全球研究界可以构建的开放平台。”两家机构认为,该模型可帮助未来宇航员安全导航、寻找必需资源,并让科学家更好地理解月球地质历史。