幾個月前,麻省理工學院 Senseable City Lab 的研究人員發表了一項關於紐約市污染的研究,其中採用了一些新方法。例如,他們利用機器學習識別了城市中 331 個交通攝影機中出現的車輛類型,並估計了每輛汽車的排放量。
如果有足夠的攝影機,這些視覺 AI 技術就能以史無前例的精確度和規模來監測排放。此外,現今的視覺 AI 還能解決都市規劃師的各種問題,例如:交通堵塞的確切原因是什麼?不同路口最危險的環節在哪裡?廣場或公園的哪些區域最吸引人潮?
在各個城市中,更多的影像意味著更多的數據、更深入的洞察,但也伴隨著對隱私和公平性的更多擔憂。麻省理工學院研究員兼視覺 AI 與城市研究新書的合著者 Fábio Duarte 表示:「我們可以將這些數位影像視為數據,並量化城市的特徵。」
他補充說:「透過電腦視覺技術,每張影像都是一個資料集,但我們必須謹慎使用。」儘管都市研究者長期以來都利用視覺分析來輔助思考,但現在這種可能性已達到前所未有的程度。麻省理工學院學者兼新書合著者 Martina Mazzarello 說:「每個人都在觀察城市環境並試圖獲得一些見解,但如果我們能大規模地做到這一點,並在各地獲得洞察呢?」
這些學者在 Routledge 本月出版的新書《How AI Sees the City: Urban Visual Intelligence》中探討了這些主題。本書的作者包括麻省理工學院 Senseable City Lab 的首席研究科學家兼副主任 Duarte、研究科學家兼全球倡議負責人 Mazzarello、實踐教授兼 Senseable City Lab 創始人兼主任 Carlo Ratti,以及北京大學遙感與地理信息系統研究所助理教授 Fan Zhang。
Ratti 提到書中描述的兩位關於城市動態的傑出思想家,Kevin Lynch 和 William H. Whyte,並表示:「像 Kevin Lynch 和 William H. Whyte 這樣的偉大都市研究者向我們展示了『觀察』城市的非凡價值。」他進一步指出:「今天,視覺 AI 為我們提供了在此傳統基礎上發展的新方法,使我們能夠以過去不可能達到的規模和細節水平來觀察城市。」
「How AI Sees the City」這本書源於 2004 年成立的 MIT Senseable City Lab 的工作,該實驗室利用數據更好地理解城市動態。正如作者在書中討論的,視覺呈現塑造我們對城市思考方式的歷史悠久,從羅馬人建造大理石地圖,到攝影技術的引入,都產生了具影響力的城市影像。例如,19 世紀巴黎的豪斯曼改造,或紐約市下東區貧民窟的擁擠景象。
近年來,一些學者利用視覺研究來更好地理解城市形態,其中包括前麻省理工學院教授 Lynch,他 1960 年的著作《The Image of the City》影響了許多學者。以其著作《The Organization Man》聞名的社會學家 Whyte,後來也成為一位密切審視公共空間的都市研究者。
透過將 AI 明確地置於這些視覺城市研究的連續體中,作者們強調了一個觀點:儘管 AI 可能非常強大,我們仍可將其主要視為服務人類目的的工具,以設計和完善城市形態。Duarte 表示:「麻省理工學院的 Kevin Lynch 當時只使用紙和筆,而我們現在可以利用視覺 AI,將他所做的工作規模化,同時也能觀察城市的不同面向。」
將視覺 AI 應用於都市規劃的可能性非常廣泛,從排放量到交通流量、安全性、街道活動和人行道的更佳影像等等。這本書還探討了例如城市綠化。雖然衛星影像可以顯示城市有多少樹木覆蓋和綠地,但來自手機和其他來源的幾乎無處不在的影像,也能揭示人們在日常生活中看到綠色的程度,這是影響幸福感的一個因素。
Zhang 表示:「視覺 AI 的真正潛力不僅僅是電腦可以查看數百萬張影像。它在於我們能夠將這些影像中可見的事物,街道、建築、綠地、交通、公共空間,與關於城市如何運作以及人們如何體驗它們的更宏大問題聯繫起來。」
AI 更好的影像辨識甚至延伸到城市內部空間。Senseable City 最近的一項研究,利用全球 40 萬個 AirBnB 房源的影像顯示,與某些說法相反,室內設計風格並未在全球範圍內變得更加同質化,反而反映出顯著的地理差異。
Mazzarello 說:「無論是什麼,我們都可以從所見之物中學習,然後將其應用為都市設計師、規劃師、政策制定者和公民。它可以是我們的眼睛,也可以是帶有電腦的攝影機,但最終都是相同的方法論,而我們現在正努力優化這些工具的使用方式。」
如果視覺 AI 在城市研究中的潛力巨大,那麼其隱憂也同樣令人擔憂。在《How AI Sees the City》一書中,作者們概述了這項技術的多個潛在問題,包括廣泛視覺監控的侵擾性,以及 AI 系統可能加劇偏見的潛力。
無處不在的攝影機安裝,很快就會引發對監控的擔憂。倫敦作為閉路電視的早期採用者,每平方英里約有 210 個攝影機。然而,全球攝影機密度最高的十個城市中,有八個在中國;上海每平方英里擁有超過 5,000 個攝影機。此類監控行為已在世界其他地區引發爭議,今年美國也出現了關於交通攝影機用途的激烈辯論。
在評估密集錄影可能帶來的安全效益時,作者們寫道:「這些效益必須與個人自由的顯著侵蝕,以及持續監控系統中固有的濫用潛力進行權衡。」
同時,AI 系統也可能強化社會偏見,導致產生的數據不僅反映潛在現實,也強化了對人、社區和整個城市的既有觀念。如果 AI 模型是針對多數人口群體進行訓練的,它們可能無法以相同的方式評估少數群體。
Duarte 表示:「我們需要教導 AI 如何『看見』,而根據你如何教導它,它將會看到文化中根深蒂固的事物。AI 並非中立。」
不過,Mazzarello 補充說:「我們的眼睛也不是中立的。每個工具都必須以正確的方式引導,並以最佳的方式進行訓練。」
其他學者也對《How AI Sees the City》讚譽有加。倫敦大學學院的 Michael Batty 稱其為一本「引人入勝的書」,「展示了我們如何開始詮釋都市設計的世界,並提出了利用城市分析、AI 和大型語言模型來改進設計的方法。」
最終,儘管作者們認為部署視覺 AI 以深入了解我們的城市、其運作方式以及如何改進具有巨大價值,但只要謹慎並獨立思考,進步是可能的。正如他們在書中總結的:「我們應該明智、批判且富有創造性地探索這項技術。」



