传统语言模型通常依赖地址、类别和文本描述等静态元数据来构建兴趣点(POI)表示。然而,一个地点既有纸面上的身份信息,也有现实中的功能节奏。据 Google Research 介绍,其新提出的 Mobility-Embedded POIs(ME-POIs)框架通过引入公开基准数据集中的聚合匿名移动模式——如到达时间、停留时长和周边移动轨迹——为文本表示补充动态信号,使模型能够捕捉城市 POI 随时间变化的活动规律。
从输出预测到输入特征的转变
以往的地理空间 AI 研究几乎只将移动模式用于预测用户下一个访问的地点。ME-POIs 将移动数据从输出预测任务转变为定义地点本身的输入特征。该框架通过自监督方法,把文本描述与大规模匿名移动模式结合,生成同时编码地点身份与动态功能的数值向量(嵌入),从而为下游系统提供预丰富的地点表示,减少重复计算开销。
三步构建流程
ME-POIs 通过三个步骤将原始地理点转化为可用的数学签名:
- 访问对齐:模型将对特定 POI 的聚合访问作为基础数据点,分析到达窗口、离开趋势和典型停留时长。时间编码器将这些序列映射到稠密向量空间,建立覆盖一年周期和不同星期的“功能质心”。
- 空间多尺度访问传播:针对本地小店或新开店铺等访问数据稀疏的“长尾”问题,框架在街道、街区和更广泛社区等多个空间尺度上观察相邻地点,将数据丰富邻居的聚合访问模式统计性地迁移至稀疏地点,使其在缺乏直接记录时仍能获得区域节奏信息。
- 文本-移动协同:框架并未丢弃文本描述,而是通过最大化余弦相似度,将高级语言嵌入与新生成的移动向量对齐。这种混合方式保留了结构语义(例如从文本得知某地售卖食物),同时吸收运营上下文(例如从移动签名判断其是午餐场所还是深夜餐厅)。
实验设计与结果
研究团队在洛杉矶和休斯顿两个文化差异明显的大都市区进行了测试,训练阶段使用一组已观测地点,随后在完全未见的地点上评估五项下游任务:营业/关闭时间预测、价格水平分类、永久关闭检测、访问意图分类以及繁忙度预测。基线包括纯文本嵌入模型(如 Gemini embeddings)、现有轨迹模型(如 TrajGPT)及多种混合变体。
结果显示,整合 ME-POIs 后,在未见测试地点上的预测表现持续优于纯文本和纯移动基线。具体而言,访问意图预测的相对增益最高达 81.9%,价格水平分类提升 75.1%,繁忙度估计准确率提高 24.7%。值得注意的是,在价格水平分类等任务中,仅使用移动数据的模型超过了仅使用文本的语言模型,表明人群在某地的集体行为有时比正式标签更具描述力。
适用范围与定位
据文章说明,ME-POIs 聚焦于对世界进行聚合层面的理解,无法得出关于个体用户的结论,也不用于个性化场景。该框架属于更广泛的 Google Earth AI 计划的一部分,旨在创建将行星数据转化为可操作情报的地理空间模型与数据集。此项工作由 Google Research 的 Neha Arora 与南加州大学的 Cyrus Shahabi 教授及博士生 Shang Ling Hsu 共同完成。
