💡 每日 AI 概念:王者歸來:xLSTM 架構解析
如果你在 2015 年左右訓練序列模型,那麼你對世界的整個心智模型都是由長短期記憶(LSTM)網路所塑造的。LSTM 由 Sepp Hochreiter 和 Jürgen Schmidhuber 在 1990 年代發明,是深度學習領域無可爭議的主力。它翻譯我們的文字、識別我們的語音,並為第一代大型語言模型提供動力。
隨後是 2017 年,「Attention Is All You Need」論文發表,整個 AI 生態系隨之轉向。我們捨棄了 LSTM 深刻而優雅的架構,轉而採用 Transformer 暴力且高度平行化的矩陣乘法。Transformer 贏得了硬體彩券,因為它讓我們能夠將整個序列映射到 GPU 網格上,並一次性進行訓練。
此文章僅限付費訂閱者閱讀。



