准确的时空交通预测对于路径规划、交通信号控制和城市管理等任务具有重要意义。为了降低跨城市部署的训练成本,近年来的研究开始探索能够在未见城市上进行零样本预测的时空基础模型。然而,现有时空基础模型大多依赖单一模态的交通时序数据,难以充分刻画真实交通场景中的复杂背景信息。随着遥感影像、兴趣点(POI)等多模态城市数据越来越容易获取,利用这些背景信息增强跨城市交通预测成为一种有前景的方向。
本文提出一种面向多模态时空交通预测的基础模型 MoST。MoST 能够在不同城市、不同模态可用性的场景下,利用任意可获得的模态信息进行零样本预测。针对跨城市多模态数据中常见的模态缺失、模态噪声以及局部空间模式差异问题,MoST 设计了多模态精炼模块(Multi-modality Refinement Module)和多模态引导的时空预测模块(Multi-modality-guided Spatio-Temporal Prediction Module)。前者自适应选择任务相关且可靠的模态,后者利用多模态背景信息动态选择空间专家,从而捕捉区域特定的局部时空依赖。实验结果表明,MoST 在五个真实交通数据集上取得了优于现有基线的预测性能,并展现出较强的跨城市泛化能力。
作者: Ronghui Xu, Jihao Chen, Jingdong Tian, Chenjuan Guo, Bin Yang
机构: 华东师范大学
关键词: 多模态学习,时空预测,基础模型
论文链接: https://doi.org/10.1145/3770854.3780162
代码链接: https://doi.org/10.5281/zenodo.18143317
动机
交通预测模型通常需要在每个城市或数据集上单独训练,这使得模型部署成本较高,也限制了模型在新城市中的应用。时空基础模型试图通过大规模跨城市预训练,学习可迁移的时空规律,从而在目标城市没有额外微调的情况下完成预测。相比传统端到端模型,这类方法更适合跨城市部署。
但真实交通系统并不仅由历史交通时序决定。不同区域的遥感影像、地理位置和人类活动信息往往能揭示交通产生的背景条件。例如,学校附近、居民区附近和高速路附近的交通模式可能具有完全不同的早晚高峰规律。具有相似背景的区域,即使位于不同城市,也可能呈现相似的交通模式。因此,将多模态城市背景引入时空基础模型,有助于模型学习更稳定、更可迁移的交通规律。
挑战
构建多模态时空交通预测基础模型主要面临两个挑战:
(1)跨城市多模态数据的可用性和质量存在显著差异。 在不同城市中,可获得的模态类型并不总是一致。例如,低活跃区域可能缺少足够的 POI 或人类活动信息;即使某一模态存在,它也未必对当前预测任务有帮助。遥感影像在人造结构清晰的区域可能提供丰富背景,但在大面积绿地或水域附近可能噪声较多;人类活动数据在人流密集区域更有效,而在高速路或低密度区域可能较为稀疏。若简单融合所有模态,低质量或低相关性的模态反而可能干扰预测。
(2)局部空间模式高度依赖区域背景,影响跨城市泛化。 交通流在商业区、居民区、学校周边和高速路附近的空间依赖范围和变化趋势并不相同。传统基于固定图结构或固定空间卷积的模型容易绑定到训练城市的传感器拓扑,在未见城市中难以适应新的空间结构。因此,模型需要根据当前区域的背景信息,动态选择适合的空间建模方式。
方法
为应对上述挑战,我们提出多模态时空交通预测基础模型 MoST。整体框架包含两个核心组件:多模态精炼模块和多模态引导的时空预测模块。
多模态精炼模块用于处理不同城市中模态可用性不一致、模态质量不稳定的问题。MoST 分别对遥感影像、地理位置、人类活动文本和交通时序进行编码,并将它们投影到统一的嵌入空间中。对于缺失模态,模型通过模态状态矩阵进行掩码;对于存在但质量较低的模态,模型进一步估计其任务相关性和不确定性,并以信噪比(SNR)作为是否保留该模态的依据。为了使模态选择过程可训练,MoST 使用 Gumbel-Sigmoid 结合直通估计器进行近似,并通过对比学习促使模型将噪声模态与缺失模态区分开,从而学习到更加稳健的模态选择策略。
多模态引导的时空预测模块用于刻画区域特定的局部空间依赖。MoST 认为,相似城市背景下的传感器往往具有相似的空间交通模式。因此,模型利用精炼后的多模态表示来激活不同的空间专家。具体来说,MoST 同时设计了模态共享专家和路由专家:模态共享专家根据被保留的模态激活,路由专家则根据融合后的多模态表示为每个传感器选择最合适的专家。每个空间专家只关注目标传感器及其 Top-k 近邻,通过交叉注意力建模局部空间相关性,生成空间感知的时序片段表示。最后,非自回归 Transformer 解码器结合时间表示和空间感知表示,输出未来交通状态预测。
实验结果
整体表现
本文在五个真实交通数据集上进行了实验,包括 Taxi-NYC、Taxi-CHI、SD、GBA 和 GLA。实验同时覆盖出租车需求预测和交通流预测两类任务,并采用 MAE 和 RMSE 作为主要评价指标。在长周期预测设置中,模型使用过去 10 天的数据预测未来 3 天的交通状态;在零样本设置中,目标数据集完全不参与训练,仅用于测试模型的跨城市泛化能力。
实验结果表明,MoST 在零样本设置下整体优于大多数端到端模型和现有时空基础模型。与依赖单一模态的 OpenCity 相比,MoST 在五个数据集上均取得更低的预测误差。例如,在 Taxi-NYC 上,MoST 的零样本 MAE 为 2.41,优于 OpenCity 的 3.93;在 SD 数据集上,MoST 的零样本 MAE 为 25.69,也优于 OpenCity 的 32.95。值得注意的是,在部分数据集上,MoST 的零样本结果甚至接近或超过了一些全监督训练的端到端模型,说明多模态背景信息能够有效提升模型的迁移能力。
消融实验
为了验证各模块的有效性,本文设计了多个 MoST 变体,包括移除模态选择器、移除专家路由机制,以及仅保留交通时序数据的版本。结果显示,完整 MoST 始终取得最优表现。移除模态选择器会带来性能下降,说明并非所有可用模态都应被无差别使用,低质量模态确实可能影响预测。移除混合专家机制后,模型对局部空间模式的刻画能力下降。仅使用时序数据时性能下降最明显,进一步说明多模态空间背景对于跨城市时空预测具有重要作用。
模态缺失与短期预测
为了评估 MoST 在现实部署中的鲁棒性,本文进一步测试了推理阶段缺失不同模态时的表现。结果表明,缺失任意单个辅助模态都会造成一定性能下降,其中缺失遥感影像带来的影响较为明显,说明遥感数据对区域背景理解具有较大贡献。当所有辅助模态均不可用、仅保留交通时序数据时,模型性能继续下降,但仍保持在可接受范围内,说明 MoST 能够适应不同城市中模态可用性不一致的情况。
在短期预测实验中,MoST 也展现出较强性能。在 Taxi-CHI 数据集的 12 步零样本预测设置下,MoST 的 MAE 为 2.96、RMSE 为 11.71,优于 OpenCity、UrbanGPT 等时空基础模型,也优于 PatchTST、DLinear 和 iTransformer 等全监督时间序列模型。这表明多模态设计不仅有助于长期预测,也能提升短期交通状态建模能力。
案例分析
本文还通过案例分析展示了模态选择机制的可解释性。对于一个位于居民区且邻近公园的遥感影像,MoST 会选择该图像模态,因为这类区域通常包含较规律的通勤交通模式,能够为预测提供有价值的背景线索。相反,对于主要由绿地和湖泊组成、缺少明显人造结构的遥感影像,MoST 倾向于不选择该模态,因为它对人类移动规律和交通变化的解释能力较弱。这说明 MoST 并不是简单地“使用更多模态”,而是尝试判断哪些模态真正有助于当前区域的预测。
结论
本文提出了多模态时空交通预测基础模型 MoST,用于在跨城市场景下利用任意可用的上下文模态进行交通预测。MoST 通过多模态精炼模块自适应过滤低信噪比模态,通过多模态引导的空间专家机制捕捉区域特定的局部空间依赖,从而提升模型在未见城市中的预测精度和泛化能力。基于五个真实交通数据集的实验结果表明,MoST 能够在零样本、短期预测、模态缺失等多种设置下保持优越且稳健的表现,展示了多模态基础模型在城市时空预测任务中的潜力。