OlmoEarth Studio 是我們用於建構地球觀測模型的平台,現已支援計算並匯出嵌入向量。這些向量是由我們的開源 OlmoEarth 基礎模型產生,能將地球觀測資料壓縮成緊湊的數值表示。其原始碼和模型權重已與研究論文一同公開,社群可以詳細檢視這些嵌入向量的生成方式。
嵌入向量是利用 OlmoEarth 的一個快速且具成本效益的切入點,它們支援從相似性搜尋到分割,再到無監督探索等多種下游任務。地表特徵相似的區域會產生相似的向量,而特徵差異大的區域則會產生相距甚遠的向量。OlmoEarth 嵌入向量在我們的基準測試和獨立評估中都展現了強勁的性能。
匯出的 Cloud-Optimized GeoTIFFs (COGs) 輕巧且易於分享。您可以透過 Studio 的使用者介面或 API,選擇感興趣的區域、時間範圍、編碼器變體、解析度和影像來源,即可獲得一個可隨意使用的 COG 檔案。如果您的應用程式需要更高的性能,Studio 也支援監督式微調 (SFT)。
OlmoEarth Studio 的使用者現已可使用自訂計算的嵌入向量。如果您有興趣取得存取權限,請與我們聯繫。關於如何使用公開的 OlmoEarth 模型來計算您自己的嵌入向量,相關說明可在此處找到。
在 Studio 中計算嵌入向量
OlmoEarth 嵌入向量在全球結構上,展現了來自 110 萬個樣本的季節性 Sentinel-2 影像。圖中顏色表示在經 PCA 降維的嵌入空間中,15 個 k-means 聚類的結果。
在 Studio 中計算嵌入向量的流程與其他任何預測任務相同。首先配置模型並執行,然後下載結果。有幾個參數可以自訂輸出:
- 感興趣區域:繪製或上傳任何多邊形;Studio 會處理影像擷取和分塊。
- 時間範圍:1 到 12 個月週期。
- 編碼器變體:Nano (128 維,1.4M 參數)、Tiny (192 維,6.2M 參數) 或 Base (768 維,89M 參數)。
- 空間解析度:每像素 10 公尺、20 公尺、40 公尺或 80 公尺。
- 影像來源:Sentinel-2 L2A、Sentinel-1 RTC 或兩者皆可。
Studio 提供的 COG 檔案,每個波段代表一個嵌入維度。向量以有符號 8 位元整數 (int8) 儲存,數值範圍從 -127 到 +127,其中 -128 保留給無資料值。若要還原浮點向量,請參考 olmoearth_pretrain 中的 dequantize_embeddings 函數。
由於所有計算都是按需進行,而非從預先計算的全球檔案庫中提取,因此您的嵌入向量能精確反映您所關心的條件。您可以生成每月嵌入向量,以捕捉季節性動態,而不僅僅是年度快照。
OlmoEarth 嵌入向量的應用
以下範例均使用 OlmoEarth-v1-Tiny (192 維) 嵌入向量,解析度為 40 公尺,並搭配 Sentinel-2 L2A 複合影像(大多數範例為年度影像;變化偵測則為月度影像)。Tiny 是一個輕量級編碼器,但仍具有高效能;在您自己的應用中,可以選擇更大的變體,但會增加計算和儲存成本。
相似性搜尋:尋找「更多類似項目」
選擇一個查詢像素,提取其嵌入向量,然後計算與其他所有像素的餘弦相似度。結果會是一個熱力圖,顯示地景與您的查詢像素最相似和最不相似的區域。
這個查詢點位於加州默塞德市中心附近。城市建築和道路走廊清晰地亮起,而農業地塊則保持黑暗。模型無需任何標籤即可區分建成區和農田。
將查詢切換到一個小的農業區域,我們將查詢向量定義為該區域內嵌入向量的平均值,然後提取相似度最高和最低位置的 Sentinel-2 影像,以觀察模型將哪些區域視為相似或不相似。
最相似的區塊(0.89 及以上)都是帶有灌溉農田的農業地塊。最不相似的區塊(約為零)則是一個周圍有裸地的機場、一個有乾燥地形的水庫,以及乾旱的牧場。這無需訓練資料,無需標籤,僅僅是嵌入空間中的點積運算。
少樣本分割:為地景標記
相似性搜尋告訴您「哪裡與此相似?」,但有時您需要對整個區域進行離散標記。由於這些表示法已經非常豐富,一個簡單的線性分類器只需極少量的標記像素,就能生成一張完整的土地覆蓋圖。
為了驗證這一點,我們在越南金甌(一個沿海紅樹林地區)僅標記了 60 個像素(每類 20 個)。我們使用 ESA WorldCover 2021 作為三種類別(紅樹林、水體、其他)的標籤來源,隨機抽取每類 20 個像素,訓練了一個帶有特徵標準化的邏輯迴歸模型,並預測了該區域的所有像素。
僅憑 60 個標記像素,該分類器就生成了一張連貫的地圖,加權 F1 分數達到 0.84。紅樹林、潮汐水道和開放水域在整個區域內被清晰地劃分出來。分類器很快達到飽和:將標籤數量從 30 增加到 300,準確度幾乎沒有變化,因為嵌入向量已經完成了大部分繁重的工作。
分析的核心僅需幾行 Python 程式碼:
```python
import rasterio
import numpy as np
from sklearn.pipeline import make_pipeline
from sklearn.preprocessing import StandardScaler
from sklearn.linear_model import LogisticRegression
Load the 192-band embedding COG exported from Studio
with rasterio.open("embeddings.tif") as ds:
emb = ds.read().astype(np.float32) # (192, H, W)
C, H, W = emb.shape
X = emb.reshape(C, -1).T # (H*W, 192)
Train on labeled pixels, predict everywhere
clf = make_pipeline(StandardScaler(), LogisticRegression(max_iter=2000))
clf.fit(X[train_idx], labels[train_idx])
prediction = clf.predict(X).reshape(H, W)
```
這是一種線性探測 (linear probe),是基礎模型的標準評估方法。一個 192 維的邏輯迴歸模型能夠從如此少的標籤中恢復土地覆蓋邊界,這意味著 Tiny 編碼器在預訓練期間已經組織了這些生態區分。更大的變體 (Base, 768 維) 甚至能編碼更豐富的表示。
如果您有實地多邊形、野外調查點或粗略的現有地圖,您可以訓練一個類似的分類器,為您感興趣的區域生成一張完整的地圖。
變化偵測:發現地景變動
由於 Studio 能夠以任何時間解析度(從每月到每年)生成嵌入向量,您可以直接比較兩個時間段,以識別地表條件發生變化的區域。
下圖中,我們計算了加州布特縣同一區域在 2023 年 9 月和 2024 年 9 月的 Sentinel-2 月度嵌入向量,並測量了每個像素的餘弦距離。2024 年 7 月至 9 月的 Park Fire 燒毀痕跡立即清晰可見。這無需任何標籤或訓練,只需兩個嵌入 COG 檔案和幾行 Python 程式碼。
無監督探索:洞察模型所見
有時您沒有查詢位置或參考標籤,只是想了解嵌入向量中存在哪些結構。主成分分析 (PCA) 是一種簡潔的方法:將其降維至三個維度,映射到紅/綠/藍 (R/G/B),並顯示為偽彩色影像。相似的嵌入向量會自動獲得相似的顏色。
荷蘭的弗萊福蘭省是一個圍墾而成的圩田地景,擁有規則的農業地塊網格。PCA 偽彩色影像以高保真度重現了這些邊界。不同的作物類型、水體和城市區域各自呈現出獨特的色調。嵌入向量在未被告知何為地塊或作物的情況下,已經內化了地景結構。
這種無監督的視圖是一種快速了解模型在您感興趣區域中捕捉到哪些結構的方式。
從匯出到洞察
相似性搜尋、少樣本分割、變化偵測和 PCA 探索都是對標準網格資料進行的簡單操作,可在幾秒鐘內完成。其強大之處源於嵌入向量:這些學習到的表示法將地球觀測資料壓縮成向量,從多個感測器和數百萬個訓練範例中捕捉每個位置的豐富資訊。
自訂嵌入向量匯出功能現已推出。建立專案、配置嵌入模型,然後計算您的嵌入向量。匯出的 GeoTIFF 檔案可與任何地理空間工具配合使用:QGIS、GDAL、rasterio 或您自己的腳本。
若要重現本文中範例的端到端程式碼,請參閱嵌入向量教學,其中包含相似性搜尋、少樣本分割、變化偵測和 PCA 視覺化的工作程式碼。若想無需任何本地設定即可動手操作,請嘗試 Colab 筆記本。
進一步探索:微調
本文中的所有範例都使用了凍結的嵌入向量,沒有進行任何特定任務的訓練。嵌入向量是利用 OlmoEarth 的絕佳切入點:它們能快速、經濟高效地產生結果,在資源受限的環境中表現良好,並且易於分享。
對於需要更高性能的應用,OlmoEarth Studio 也支援 SFT(監督式微調),即根據您自己的標籤訓練一個特定任務的模型頭部,這通常會優於對凍結特徵進行線性探測。
限制
儘管我們一直在努力改進預訓練方法,但使用上述技術檢查嵌入向量在您特定用例中的品質仍然很重要。性能也取決於輸入影像的品質,複合期間持續的雲層覆蓋、大氣偽影或缺失的觀測值都可能影響最終的向量。
Sentinel-2 L2A 影像來自歐洲太空總署,透過 Microsoft Planetary Computer 存取。紅樹林參考資料使用 ESA WorldCover 2021 v200。全球聚類視覺化使用了 OlmoEarth-v1-Base (768 維) 模型,搭配季節性 Sentinel-2 複合影像,圖塊大小為 8,並在 110 萬個預訓練樣本上進行實例級嵌入。



