隆重介紹 talkie:一款來自1930年代的13B復古語言模型

這是 Nick Levine、David Duvenaud 和 Alec Radford(因 GPT、GPT-2 和 Whisper 而聞名)的新專案。

talkie-1930-13b-base (53.1 GB) 是一個「使用2600億個1931年前的歷史英文文本詞元訓練而成的13B語言模型」。

talkie-1930-13b-it (26.6 GB) 是一個檢查點,它「使用從1931年前參考文獻中提取的指令-回應對新穎資料集進行微調」,旨在驅動聊天介面。您可以在此處試用。

這兩個模型都採用 Apache 2.0 授權。由於基礎模型的訓練數據完全超出著作權保護範圍(美國目前的著作權截止日期是1931年1月1日),我希望他們日後也能發布訓練數據。

關於這點的更新:Nick Levine 在 Twitter 上表示:

未來將發布更多關於語料庫的資訊(並盡力分享數據或至少是重現數據的腳本)。

他們的報告提出了這類模型的一些引人入勝的研究目標,包括:

  • 這些模型預測未來的能力如何?「我們計算了1931年前文本訓練的13B模型對歷史事件簡短描述的驚訝程度」
  • 這些模型能否發明超出其知識截止日期的事物?「正如 Demis Hassabis 所問,一個訓練到1911年的模型能否像愛因斯坦在1915年那樣,獨立發現廣義相對論?」
  • 它們能否被教導程式設計?「圖3(左側)顯示了此類測試的一個早期範例,衡量了1931年前文本訓練的模型在給定一些 Python 程式示範範例後,編寫新正確程式的能力。」

我長期以來對我稱之為「純素模型」(vegan models)的興趣濃厚,這些大型語言模型完全使用授權或著作權過期的數據進行訓練。我認為這裡的基礎模型符合條件,但聊天模型由於依賴非純素模型協助微調,因此並非完全純粹,我的重點如下:

首先,我們從具有規律結構的歷史文本中生成了指令-回應對,例如禮儀手冊、書信寫作手冊、食譜、字典、百科全書以及詩歌和寓言集(參見圖7),並使用簡單的聊天格式對我們的基礎模型進行微調。

接著,為了提高指令遵循能力,我們生成了涵蓋不同類型任務的合成提示詞,例如文件摘要、回應直接資訊請求以及連貫地進行多輪對話。然後,我們對這些提示詞生成的輸出進行了線上直接偏好優化,並使用 Claude Sonnet 4.6 作為評審。

最後,我們進行了另一輪監督式微調,這次是針對拒絕採樣的 Claude Opus 4.6 與 talkie 之間的多輪合成聊天,以消除其對話能力中持續存在的粗糙之處。

訓練 talkie 的一個主要挑戰是避免意外污染,無論是來自潛入訓練語料庫的1931年後文本,還是來自現代大型語言模型在微調過程中為聊天模型引入時代錯置的知識。

我最近撰寫了關於 Mr. Chatterbox 的文章,這是一個類似的復古語言模型專案,它也必須求助於現代大型語言模型來創建合成對話,以協助訓練聊天模型。

talkie 團隊渴望最終超越這一限制:

儘管我們已嘗試對 talkie 進行後訓練,使其不受現代影響,但帶有 AI 回饋的強化學習不可避免地會以時代錯置的方式塑造 talkie 的行為。(7B 版本的 talkie 在強化學習後開始以清單形式說話。)隨著規模擴大,我們希望能夠使用我們的復古基礎模型本身作為評審,以實現一個完全自舉的、符合時代的後訓練流程。

我忍不住用我的經典測試提示詞來試用 talkie 演示:

生成一張騎自行車的鵜鶘的 SVG 圖片

它回答道:

一張騎自行車的鵜鶘的 SVG 圖片於1860年生成。鵜鶘被描繪成棲息在馬鞍上,長喙向前,雙腿跨在把手上。這個想法是基於鵜鶘有時被看到在萊茵河畔騎馬捕魚的事實。