[RSCH] 6 分鐘閱讀OraCore 編輯部

CreativeInstruct 讓 LLM 保留創意

CreativeInstruct 用 instruction tuning 保住 LLM 的創意與多樣性,還能維持品質,並在部分下游 RL 設定中帶來提升。

分享 LinkedIn
CreativeInstruct 讓 LLM 保留創意

怎麼讓 LLM 在 post-training 之後,還保有創意?

CreativeInstruct 用 instruction tuning 讓 LLM 保留創意與多樣性,同時不犧牲品質。

  • 研究機構:arXiv 摘要未明確標註
  • 核心數據:70.3% 的案例
  • 突破點:學會 [StartCreativity] 區段

這篇論文要解的,是一個很常見、也很棘手的 LLM 問題:模型經過 post-training 之後,通常會更穩、更像樣,但也更容易變得保守、單調。對寫作、故事生成、腦力激盪,甚至某些需要多樣輸出的強化學習流程來說,這種收斂都可能是缺點。

CreativeInstruct 的主張很直接:創意不一定要在對齊或優化品質的過程中被犧牲掉。它想做的,不是把模型變成另一個專門的創作模型,而是讓同一個 checkpoint 同時保留品質與多樣性。

這篇論文想修什麼痛點

訂閱 AI 趨勢週報

每週精選模型發布、工具應用與深度分析,直送信箱。不定期,不騷擾。

不會寄垃圾信,隨時可取消。

作者先從一個大家都熟的現象切入。post-training 常常會提升能力,但也會縮小輸出分布。白話一點,就是模型回答更工整、更像標準答案,可是驚喜感下降了。對需要創意變化的任務來說,這不是小問題。

CreativeInstruct 讓 LLM 保留創意

摘要點名了兩類場景。第一類是明確的 creativity tasks,例如 story generation。第二類是隱性的用途,例如 reinforcement learning。這代表作者不是只把「創意」理解成文學風格,而是把它視為模型在後續流程中能否保有探索空間的一部分。

對開發者來說,這個痛點很實際。太保守的模型,做內容生成時容易重複,做 agent 時容易路徑單一,做下游最佳化時也可能少了可探索的變異。你拿到的是更穩的答案,但未必是更好的生成器。

CreativeInstruct 怎麼運作

這篇方法的核心,是 instruction tuning,但它多了一個關鍵設計:模型會學到特殊的 [StartCreativity] spans。摘要的說法是,這些 spans 會把生成往更有創意、也更接近 base model 的方向推,同時盡量保住 post-trained 模型的品質。

換句話說,它不是靠推理時再疊一層控制器,也不是靠多模型組合去拼出創意。而是把這種行為直接寫進訓練流程裡。這點對實作很重要,因為它代表方法目標是單一 checkpoint 的行為塑形,而不是 inference-time 的臨時拼裝。

摘要還提到一個額外貢獻:它定義了一個基於 graph edit distance 的 structural diversity metric。這個指標想捕捉的是敘事結構層級的差異,而不只是字面上有沒有換詞。因為兩段輸出即使表面不同,甚至語意差不多,故事骨架還是可能一樣;這個 metric 就是要看得更深一層。

這裡的技術重點很清楚:CreativeInstruct 不只是在訓練模型「比較會寫」,而是在訓練模型保留「不同寫法」的空間。它把創意當成可學習、可控制的屬性,而不是偶然冒出來的副作用。

論文實際證明了什麼

摘要裡最強的主張,是在 narrative generation 上,CreativeInstruct 的多樣性可以追上,甚至超過多模型基線,以及那些把多模型輸出蒸餾後的版本。更重要的是,它做到這件事時,沒有犧牲品質,也不需要在推理階段動用多個模型。

CreativeInstruct 讓 LLM 保留創意

人類評估的數字也很直接:標註者在 70.3% 的案例中,認為 CreativeInstruct 的輸出比 post-trained LLM 更有創意。這是摘要裡唯一明確公開的人評數字;如果你期待更完整的 benchmark 表格,這份摘要沒有提供。

論文還把這個 checkpoint 帶去做下游強化學習測試。摘要寫到,當 GRPO 套在 CreativeInstruct 上時,相較於套在 post-trained checkpoint 上,AMC 大約提升 4%,MATH 大約提升 5 個百分點。這裡同樣要保守看待:摘要沒有給出更完整的 benchmark 細節,我們只能報告它明確寫出的結果。

這個結果的意義,不只是「創意看起來比較好」。作者想傳達的是,保留創意本身,可能也能幫助後續最佳化。也就是說,creative checkpoint 不只是內容生成的風格選項,還可能是下游優化更好的起點。

對開發者有什麼影響

如果你在做 LLM 產品,這篇最值得注意的地方,是它把一個老問題講得很清楚:越追求可靠,模型越可能變窄。CreativeInstruct 提供的是另一種訓練思路——不用在品質和多樣性之間二選一,而是試著一起保住。

這對幾種工作流都可能有用。做內容生成時,它可能減少千篇一律的輸出。做 agent 系統時,它可能讓模型有更多替代方案可選。做 RL 或 iterative optimization 時,它暗示一個較有創意的起始 checkpoint,可能比過度對齊過的 checkpoint 更適合作為底座。

  • 它是訓練時方法,不是推理時多模型 orchestration。
  • 它用結構層級的 diversity metric,而不只看表面字詞差異。
  • 它暗示創意保留,可能對下游 RL 有幫助。

限制與還沒回答的問題

不過,這份摘要給的資訊也有明顯邊界。它有一個人評數字、兩個下游 RL 數字,但沒有公開完整 benchmark 細節。摘要也沒有交代完整訓練配方、資料規模,或算力成本

所以,工程上不適合把它當成「一套通吃所有場景」的現成解法。更合理的看法,是把它視為一種值得試的訓練策略。真正要落地時,還會想知道它跨領域是否穩定、creative spans 的設計對結果有多敏感、以及額外調整成本高不高。

即便如此,方向已經很明確。CreativeInstruct 想把「有創意,而且有用」變成模型的第一級特性,而不是對齊之後不小心留下來的副作用。對做生成系統的團隊來說,這是一個很實際、也很值得追的設計目標。

總結來說,這篇論文證明了一件事:LLM 不一定要為了品質而放棄多樣性。它提出一個具體做法來保留創意,用更結構化的方式衡量它,還顯示這種 checkpoint 甚至可能幫到下游 RL。