我們推出了一個動態且結合移動資訊的框架,讓 AI 模型能夠理解地點隨時間變化的活動節奏。透過此框架,AI 模型能顯著提升對真實世界屬性的預測,例如營業時間、價格水準和繁忙程度。
人工智慧在透過文字理解世界方面取得了驚人的進展。然而,要建立真正理解實體世界的 AI 模型,它們不僅需要理解文字,還必須捕捉建成環境的動態、真實世界功能。每個地點都有兩種截然不同的特徵:其書面上的身份,以及其實際的功能節奏。
傳統語言模型通常透過嚴重依賴靜態元數據來建立地點(通常稱為「興趣點」或 POI,無論是商家還是公園、地標等)的表示。它們成功分析地址、業務類別和文字描述。儘管像 Gemini 這樣的世界級語言模型在處理文字數據方面非常熟練,但透過整合城市環境的真實世界功能動態,其地理空間表示可以得到顯著豐富。將語義標籤與移動數據結合,可以使這些模型有效捕捉城市中 POI 獨特的時間活動節奏。
為了展示這種互補能力,我們引入了「移動嵌入式興趣點」(Mobility-Embedded POIs, ME-POIs),這是一個新穎的框架,可改善語言模型衍生的基於文字的地點表示。ME-POIs 利用公開基準數據集,整合了聚合且匿名的移動模式,例如到達時間、停留時間和周圍的移動模式。
ME-POIs 不再將地點視為一組靜態的文字,而是使用自監督學習方法,將文字描述與來自公共基準的大規模匿名移動模式(捕捉環境全天候的聚合空間活動足跡)融合。
透過這種方式,模型建構了一個數值向量表示(一種數學「簽名」,技術上稱為嵌入向量),它同時編碼了地點的身份及其動態功能。將 ME-POIs 與先進的文字模型整合,提供了情境優勢,在預測造訪意圖方面相對提升了 81.9%,在價格水準分類方面提升了 75.1%,在未曾見過的地點的繁忙程度估計準確度方面提升了 24.7%。
ME-POIs 框架如何運作?透過提供地點的預先豐富表示,ME-POIs 框架使 AI 模型能夠更容易地對許多不同屬性,例如營業時間、目標價格水準和當前業務狀態,進行準確推斷,而無需每次都從頭計算這些屬性。為了建立一個對地點有更深理解的模型,我們必須區分地點的身份(其名稱和類別)和其功能(其聚合的造訪足跡)。
在先前的地理空間 AI 研究中,移動模式幾乎專門應用於預測用戶將造訪的下一個興趣點。相比之下,ME-POIs 框架將移動性從一個輸出預測任務轉變為定義地點本身的輸入特徵。但如何將原始地理點轉換為一個清晰且在數值上有用的數學簽名(或嵌入向量)呢?我們透過三步驟流程來實現:造訪對齊、空間多尺度造訪傳播以及文字-移動協同。
造訪對齊:模型將對特定興趣點的聚合造訪視為基本數據點。它分析時間到達窗口、離開趨勢和典型的停留時間。時間編碼器不計算簡單平均值,而是將這些時間序列映射到一個密集的向量空間。這個過程建立了一個「功能中心點」,一個獨特的多維簽名,它映射了與該特定地點相關的聚合匿名移動模式,涵蓋了一年週期和不同星期幾的數據。
解決數據稀疏性的「長尾問題」:地理空間數據科學中一個持續存在的挑戰是「長尾問題」。雖然著名地標、大型購物中心和受歡迎的市中心連鎖店產生了大量的造訪數據,但絕大多數當地企業,小型社區精品店、專業維修店或新開的咖啡館,卻面臨嚴重的數據稀疏性。以前,當模型遇到一個幾乎沒有或沒有記錄造訪的地點時,它會錯誤地假設該地點沒有活動,導致預測錯誤。
ME-POIs 透過一種新穎的空間多尺度造訪傳播機制解決了這個問題。該架構認識到造訪通常受區域限制;一條高檔購物街上的小型精品店與其鄰居共享系統性的行為特徵。該框架在多個空間尺度上觀察相鄰地點:即時街道、街區和更廣泛的社區。然後,它將繁忙、數據豐富的鄰居的聚合造訪模式統計性地傳播到附近的稀疏地點。
透過從活躍區域學習區域「節奏」,模型將智慧的地理先驗知識庫應用於較小的商店,使其即使在數據中很少出現或沒有出現時也能學習到一些關於它們的資訊。
文字-移動協同:ME-POIs 框架不僅沒有丟棄文字描述,反而豐富了它們。它透過最大化餘弦相似度,將高階語言嵌入向量(從 Gemini 等先進模型中提取的標準向量表示)與新生成的移動向量對齊。我們將移動信號直接疊加在語言表示之上,創建了對地點或業務更全面的視圖。
這種混合方法確保模型保留結構語義(例如,從文字描述中得知某地販售食物),同時吸收其操作情境(例如,從其移動簽名中得知它作為午餐地點還是深夜餐廳)。
實驗:為了評估 ME-POIs 是否真正實現了對實體地點的廣義、與屬性無關的理解,我們在兩個大型、文化上截然不同的都會區:洛杉磯和休士頓進行了廣泛測試。我們評估了該框架的五個不同任務。至關重要的是,為了證明模型發展出通用智慧而不僅僅是記憶局部模式,我們在觀察到的地點集合上訓練了該框架,然後要求它預測完全未曾見過的地點的屬性。
這五個下游任務如下:營業/關閉時間預測:我們的地點嵌入向量能否幫助我們推斷出業務的確切時間表?價格水準分類:我們的地點嵌入向量能否僅根據移動情境幫助我們區分豪華高端精品店和二手店?永久關閉檢測:企業通常在業主更新線上資料或提交眾包報告之前很久就「熄燈」並永久關閉。
我們的嵌入向量能否幫助我們標記這些已關閉的業務?造訪意圖分類:我們的嵌入向量能否幫助我們估計某地點的聚合搜尋和導航興趣?此任務作為衡量地點整體受歡迎程度的代理。繁忙程度預測:預測企業未來的客流量密度和高峰時段動態。
為了建立基準,我們將 ME-POIs 框架與標準純文字嵌入模型(如 Gemini 嵌入向量)、現有的基於軌跡的地理空間模型(如 TrajGPT)以及混合變體進行了比較,以精確隔離移動模式為方程式增加了多少價值。
結果:實驗結果令人驚訝,證實將真實世界的移動數據添加到現有文字模型中提供了顯著的「情境優勢」。在評估模型在未曾見過的測試地點的性能時,ME-POIs 的整合帶來了實質性的準確度提升,在所有預測任務中始終優於純文字和基於移動的基準。
除了超越標準基準外,一個最顯著的發現出現在比較僅使用移動數據訓練的模型與僅能存取文字元數據的模型時。在某些情況下,例如價格水準分類,僅使用移動數據的模型甚至超越了純文字語言模型。這揭示了城市動態一個引人入勝且常被低估的真相:我們在實體地點的集體行動往往比用於標記它的正式文字更具描述性。
結論:透過成功超越靜態數位標籤,ME-POIs 框架展示了一種新的方式,使 AI 能夠建模和理解實體世界。重要的是要強調,這個框架專注於聚合地理解世界上的事物,它無法對個別用戶或任何個人化資訊得出結論。也就是說,ME-POIs 框架可以提供地點或業務的整體表示,捕捉它在廣泛人群和時間範圍內的造訪方式;它不能用於個人化。
相反,它的力量在於創建豐富的地點聚合數值簽名,從而減少下游系統在需要對這些地點進行推斷時的計算負擔。
最終,ME-POIs 為真正理解城市節奏的 AI 模型奠定了基礎。它也是我們更廣泛的 Google Earth AI 工作的一部分,旨在創建地理空間模型和數據集,將行星數據轉化為可操作的智慧。
致謝:我們感謝本論文的共同作者:Neha Arora (Google Research),以及南加州大學 (USC) 的 Cyrus Shahabi 教授和博士生 Shang Ling Hsu。


