AI Safety

OpenAI 的「哥布林」之謎:獎勵機制如何悄悄塑造模型行為

OpenAI 公開調查 GPT-5.1 以來模型頻繁提及「哥布林」等生物的現象,發現源於「Nerdy」個性訓練的獎勵訊號,並因回饋迴圈擴散。本文拆解根因、傳播機制與教訓,對產品開發者與 AI 學習者深具啟發。

OpenAI 的「哥布林」之謎:獎勵機制如何悄悄塑造模型行為 — 文章封面

如果你最近用過 ChatGPT,可能注意到模型偶爾會冒出「哥布林」或「小妖精」這類字眼。這不是單純的幽默感,而是 OpenAI 在 2026 年 4 月 29 日公開調查的「哥布林之謎」:一個從 GPT-5.1 開始悄悄蔓延的語言習慣,最終指向獎勵機制如何意外塑造模型行為。

從 175% 的增長到「Nerdy」個性的線索

OpenAI 在官方部落格〈Where the goblins came from〉中說明,GPT-5.1 發布後,「goblin」在 ChatGPT 中的使用率上升了 175%,「gremlin」則上升 52%。起初這看起來只是無害的小怪癖,但到了 GPT-5.4,情況加劇,內部分析發現一個關鍵關聯:這些生物詞彙高度集中在選擇「Nerdy」個性的使用者回應中。

「Nerdy」個性只佔所有 ChatGPT 回應的 2.5%,卻貢獻了 66.7% 的「goblin」提及。OpenAI 檢查該個性的系統提示詞,發現它鼓勵「俏皮、書呆子氣、用語言削弱自以為是」的風格,而這正是生物比喻的溫床。

獎勵訊號的意外放大與回饋迴圈

OpenAI 使用 Codex 比較強化學習訓練期間的輸出,發現「Nerdy」個性的獎勵訊號明顯偏好含有「goblin」或「gremlin」的輸出——在 76.2% 的資料集中,這些詞彙能獲得較高獎勵。這解釋了為何該風格在「Nerdy」提示下被強化,但無法解釋為何在沒有該提示時也出現。

追蹤訓練過程後,OpenAI 發現當「Nerdy」條件下的提及率上升時,非「Nerdy」樣本也以相近比例上升,顯示行為透過遷移擴散。這形成一個回饋迴圈:獎勵俏皮風格 → 部分範例含特殊詞彙 → 詞彙在 rollouts 中更頻繁 → 這些 rollouts 被用於監督式微調 → 模型更習慣使用該詞彙。

OpenAI 也發現其他「tic words」,如浣熊、巨魔、食人魔和鴿子,而青蛙大多屬正常使用。這顯示問題並非單一詞彙,而是整個「生物類比」傾向被過度獎勵。

修正措施與對產品開發者的啟示

OpenAI 在 3 月推出 GPT-5.4 後退役了「Nerdy」個性,移除對生物詞彙的獎勵訊號,並過濾含這些詞的訓練資料。但 GPT-5.5 在根因發現前已開始訓練,因此在 Codex 測試時,員工立刻注意到哥布林傾向,OpenAI 加入了開發者提示指令來抑制。

這個案例對產品開發者有三點啟示:

  • 獎勵設計需謹慎:即使看似無害的風格獎勵,也可能意外放大特定語言模式,並透過遷移擴散到其他情境。
  • 監控「小怪癖」:當模型出現異常但非致命的行為時,值得追蹤其分佈與來源,而非僅當作趣事。
  • 建立調查工具:OpenAI 因此開發了新工具來稽核模型行為,這對任何依賴 LLM 的團隊都是重要投資。

結語:理解怪癖背後的機制

OpenAI 強調,這個調查展示了「獎勵訊號如何以意想不到的方式塑造模型行為」,以及「模型如何將獎勵泛化到無關情境」。對產品開發者而言,這提醒我們:模型的每個行為都有其原因,而找到根因才能有效修正。下次當你的模型出現奇怪的語言習慣時,不妨想想——是不是某個獎勵訊號在背後推了一把?

參考來源

本文由 AI 協助自上述來源整理,經人工審核後發布。

這篇內容對你有幫助嗎?

支持本站繼續整理實用的 AI 文章、教學與開發筆記。

請我喝杯咖啡
分享X電郵