原始卫星影像必须经过"AI就绪化"处理才能发挥作用。为此,科学家通常需要收集地面真实测量数据,可能需要融合来自多个传感器的数据并校正不一致性,还可能需要执行各种其他任务来构建准确反映物理世界的数据集。随着环境AI变得越来越复杂,这些流程只会更具挑战性。展望未来,最大的突破可能并非来自更好的算法,而是来自更好的数据工程。
![]()
在环境AI领域,一大挑战在于没有任何单一数据集包含研究人员所需的全部信息。例如,卫星影像提供了广阔的地理覆盖范围,但许多环境特征必须通过结合其他多个互补数据集才能推导得出。每个数据点都是拼图的一块,数据可以是地形、土壤成分、历史天气模式,也可以是野外观测。所有这些数据都有助于使数据达到AI可用的标准——这正是AI能够发现仅凭卫星影像难以(甚至不可能)检测到的模式的原因。
准备数据集只是整个流程的一部分。研究人员必须用它来训练机器学习模型,并将模型预测与已有的数据(如新的野外观测)进行比较。这有助于揭示模型在哪些地方准确、哪些地方仍需改进。这些发现会被反馈到数据集中,然后再重新训练模型。这是一个迭代过程。随着时间推移,这一循环会稳步提升数据质量和预测准确性。这也是环境AI即使在底层算法没有重大变化的情况下仍能持续进步的原因之一。
构建AI就绪环境数据集的规模与复杂度
从美国陆军工程研发中心(ERDC)与美国林务局(USFS)近期的一项合作中,可以窥见构建AI就绪环境数据集的规模与复杂性。该联合项目旨在创建一个预测森林结构与组成的全球框架,方法是将他们所称的全球最大规模之一的野外测量数据集与卫星观测数据相结合。
美国境内超过35.5万个实测森林样地,正在与约17万亿个30米分辨率卫星图片,以及气候、地形、土壤等其他环境数据集进行整合。目标不只是绘制森林分布图,而是让AI模型能够估算从未被直接勘测过的地区的树木种类、直径、生物量和森林组成等特征。
![]()
该项目也体现了挑战的规模。通过将最大规模之一的森林资源清查数据与卫星观测及其他环境数据集相结合,研究人员希望构建出能够在从未被直接勘测的地区预测森林特征的AI模型。
"可以把它想象成在不必逐一探访每棵树的情况下,构建地球上每片森林的高清3D地图。"签约资深研究地球科学家Gabe Powell表示,"首先,我们从那数十万片USFS森林清查样地中获取'地面真值'。然后,我们收集数TB的全球环境数据,来解释这些森林样地中存在的结构和组成。"
"为了确保在难以进入的区域也能正常运行,我们的全球解释变量来自卫星,包括气候、地形、土壤类型和可用光照等。"
林业领域取得的进展可以推广到其他功能和行业。我们看到,同样的技术正越来越多地用于支持精准农业、基础设施规划、洪水与野火预测、碳核算、生物多样性监测以及灾害响应。在每一个场景中,挑战都在于如何将海量原始卫星影像和环境观测数据转化为AI可以信赖的数据集。
![]()
随着卫星星座持续壮大,收集影像正变得越来越容易。更难的部分在于将这些影像与其他数据源整合,并对照真实世界观测进行验证。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.