視覺標記器將高維度的原始像素映射成壓縮表示,供下游模型使用。除了壓縮之外,標記器還決定了哪些資訊被保留以及如何組織。影片標記化的一個事實標準方法是將影片表示為時空 3D 網格標記,每個標記捕捉原始訊號中對應的局部資訊。這要求使用這些標記的下游模型(例如文字轉影片模型)必須學習「逐像素」預測所有低階細節,無論影片本身的複雜程度如何,導致學習複雜度很高。
我們提出了 VideoFlexTok,它以由粗到細的方式,用可變長度的標記序列來表示影片。其中,最初的標記(自然地)捕捉抽象資訊,例如語義和運動,而後續的標記則添加了更精細的細節。生成式流解碼器能夠從任何標記數量重建出逼真的影片。這種表示結構允許根據下游需求調整標記數量,並在相同預算下編碼比基準模型更長的影片。
我們在類別和文字轉影片生成任務上評估了 VideoFlexTok,結果顯示與 3D 網格標記相比,它能帶來更高效的訓練。例如,它能以小 5 倍的模型(11 億參數對比 52 億參數)達到可比的生成品質(gFVD 和 ViCLIP 分數)。最後,我們展示了 VideoFlexTok 如何在不產生過高運算成本的情況下實現長影片生成。
透過在 10 秒、81 幀的影片上訓練文字轉影片模型,僅使用 672 個標記,比可比較的 3D 網格標記器少了 8 倍。
影片模型中的標記化,通常透過區塊化(patchification)進行,會產生過多且冗餘的標記。這嚴重限制了影片的效率和可擴展性。儘管近期基於軌跡的標記器透過將影片時長與標記數量解耦,提供了一個有前景的解決方案,但它們依賴於複雜的外部分割和追蹤管線,這些管線既慢又與任務無關。
我們提出了 TrajTok,這是一個端到端的影片標記器模組。
這項工作是與瑞士洛桑聯邦理工學院(EPFL)合作完成的。
圖像標記化透過提供比原始像素更高效處理的壓縮離散表示,推動了自迴歸圖像生成的重大進展。儘管傳統方法使用 2D 網格標記化,但像 TiTok 這樣的最新方法表明,1D 標記化可以透過消除網格來實現高品質的生成。



