撰寫者:Kedar Tatwawadi, Parisa Rahimzadeh, Zhanghao Sun, Zhiqi Chen, Ziyun Yang, Sanjay Nair, Divija Hasteer, Oren Rippel機器學習編解碼器相較於傳統硬編碼編解碼器的一大優勢,在於它們能夠直接針對人類視覺系統進行優化。
儘管具備此潛力,但目前尚未提出兼具感知品質與實用性的影像編解碼器。本研究旨在彌補此一差距。我們全面探討了影響實用機器學習影像編解碼器設計的關鍵模型選擇,這些選擇同時針對感知品質和執行時間進行優化,其中包含多項新穎的消融技術。接著,我們對數百萬種骨幹網路配置進行了效能感知神經架構搜尋,以找出能在達到目標裝置端執行時間的同時,最大化由感知指標衡量的壓縮效能的模型。
我們結合了多種優化措施,建構出一個新的編解碼器,顯著提升了速度與感知品質之間的權衡。根據嚴謹的主觀使用者研究,相較於 AV1、AV2、VVC、ECM 和 JPEG-AI,它能節省 2.3–3 倍的位元率;相較於最佳的機器學習編解碼器替代方案,則能節省 20–40% 的位元率。
同時,在 iPhone 17 Pro Max 上,它能以 230 毫秒的速度編碼 12MP 影像,並以 150 毫秒的速度解碼,這比大多數頂級基於機器學習的編解碼器在 V100 GPU 上運行的速度還要快。相關閱讀與更新。為了提供豐富的互動體驗,為具身對話代理生成自然的頭部動作以配合語音是必要的。
大多數先前的研究透過使用客觀指標將生成的頭部動作與單一真實資料進行比較來評估其品質。然而,許多合理的頭部動作序列都可以伴隨一個語音表達。在這項工作中,我們研究了頭部動作感知品質的變化……閱讀更多深度生成模型(deep generative models)的最新進展,促成了神經臉部影片壓縮編解碼器的發展,其使用的頻寬比工程編解碼器少一個數量級。
這些神經編解碼器透過扭曲來源影格並使用生成模型來彌補扭曲來源影格中的缺陷,從而重建當前影格。因此,扭曲是使用少量關鍵點而非密集的流場進行編碼和傳輸……閱讀更多



