作者:Chen Huang, Xianhang Li, Vimal Thilak, Etai Littwin, Josh Susskind基於圖像的聯合嵌入預測架構(Image-based Joint-Embedding Predictive Architecture, I-JEPA)透過遮罩特徵預測,為視覺自監督學習提供了一種有前景的方法。

然而,由於遮罩位置固有的視覺不確定性,特徵預測仍具挑戰性,並可能無法學習到語義表徵。在這項工作中,我們提出了文本條件式JEPA(Text-Conditional JEPA, TC-JEPA),它利用圖像描述(image captions)來降低預測的不確定性。

具體來說,我們使用一個細粒度文本條件器(fine-grained text conditioner)來調節預測的圖像區塊特徵(patch features),該條件器會對輸入文本詞元(text tokens)計算稀疏的交叉注意力(cross-attention)。

透過這種條件化,圖像區塊特徵變得可以作為文本的函數來預測,因此更具語義意義。我們展示了TC-JEPA能提升下游任務(downstream performance)的表現和訓練穩定性,並具有良好的擴展潛力(scaling properties)。

TC-JEPA還提供了一種僅基於特徵預測的全新視覺語言預訓練範式(vision-language pretraining paradigm),在多樣化任務上,特別是那些需要細緻視覺理解和推理的任務上,其表現優於對比學習方法(contrastive methods)。

相關閱讀與更新。影片聯合嵌入預測架構(Video Joint Embedding Predictive Architectures, V-JEPA)透過使用指數移動平均(EMA)更新的教師模型,在潛在空間中預測遮罩區域,從而學習可泛化的現成影片表徵。

雖然EMA能防止表徵崩潰,但它使可擴展的模型選擇變得複雜,並將教師和學生架構耦合。我們重新審視了遮罩潛在預測,並證明凍結的教師模型就已足夠。具體來說,我們(i)訓練一個…閱讀更多。目前存在兩種競爭性的數據表徵自監督學習範式。聯合嵌入預測架構(Joint Embedding Predictive Architecture, JEPA)是一類架構,其中語義相似的輸入被編碼成彼此可預測的表徵。

JEPA框架下一個近期成功的做法是自蒸餾(self-distillation),其中一個線上編碼器被訓練來預測目標編碼器的輸出,有時會使用…閱讀更多。