All signals
研究ResearchOpenAI Blog約 11 分鐘
OpenAI 模型『小鬼』現象:意外行為的根源與解決之道
OpenAI 的 GPT-5.1 及後續模型在生成內容中頻繁提及「小鬼」等生物,引發了團隊的關注。經過調查,發現此現象源於「書呆子」人格特質的訓練中,獎勵機制意外地鼓勵了這類比喻。OpenAI 透過移除該人格特質、調整獎勵訊號並過濾訓練資料,成功解決了這個模型行為問題,並強調理解模型意外行為的重要性。

OpenAI 的 GPT-5.1 及後續模型在生成內容中頻繁提及「小鬼」等生物,引發了團隊的關注。經過調查,發現此現象源於「書呆子」人格特質的訓練中,獎勵機制意外地鼓勵了這類比喻。OpenAI 透過移除該人格特質、調整獎勵訊號並過濾訓練資料,成功解決了這個模型行為問題,並強調理解模型意外行為的重要性。

覺得值得一看?分享給朋友。
以上為 AI 自動翻譯導讀。原文版權歸 OpenAI Blog 所有, 建議透過「閱讀原文」前往原始網站,以取得最完整資訊並支持原作者。