[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"article-creativeinstruct-llms-quality-creativity-diversity-zh":3,"article-related-creativeinstruct-llms-quality-creativity-diversity-zh":30,"series-research-2af77412-f711-4abb-915d-5b7d1b5275a7":75},{"id":4,"slug":5,"title":6,"content":7,"summary":8,"source":9,"source_url":10,"author":11,"image_url":12,"cover_image":12,"category":13,"language":14,"translated_content":11,"related_article_id":15,"keywords":16,"key_takeaways":23,"views":27,"created_at":28,"published_at":29,"topic_cluster_id":11},"2af77412-f711-4abb-915d-5b7d1b5275a7","creativeinstruct-llms-quality-creativity-diversity-zh","CreativeInstruct 讓 LLM 保留創意","\u003Cp>怎麼讓 \u003Ca href=\"\u002Ftag\u002Fllm\">LLM\u003C\u002Fa> 在 post-training 之後，還保有創意？\u003C\u002Fp>\u003Cp data-speakable=\"summary\">CreativeInstruct 用 instruction tuning 讓 LLM 保留創意與多樣性，同時不犧牲品質。\u003C\u002Fp>\u003Cul>\u003Cli>\u003Cstrong>研究機構\u003C\u002Fstrong>：arXiv 摘要未明確標註\u003C\u002Fli>\u003Cli>\u003Cstrong>核心數據\u003C\u002Fstrong>：70.3% 的案例\u003C\u002Fli>\u003Cli>\u003Cstrong>突破點\u003C\u002Fstrong>：學會 [StartCreativity] 區段\u003C\u002Fli>\u003C\u002Ful>\u003Cp>這篇論文要解的，是一個很常見、也很棘手的 LLM 問題：模型經過 post-training 之後，通常會更穩、更像樣，但也更容易變得保守、單調。對寫作、故事生成、腦力激盪，甚至某些需要多樣輸出的強化學習流程來說，這種收斂都可能是缺點。\u003C\u002Fp>\u003Cp>CreativeInstruct 的主張很直接：創意不一定要在對齊或優化品質的過程中被犧牲掉。它想做的，不是把模型變成另一個專門的創作模型，而是讓同一個 checkpoint 同時保留品質與多樣性。\u003C\u002Fp>\u003Ch2>這篇論文想修什麼痛點\u003C\u002Fh2>\u003Cp>作者先從一個大家都熟的現象切入。post-training 常常會提升能力，但也會縮小輸出分布。白話一點，就是模型回答更工整、更像標準答案，可是驚喜感下降了。對需要創意變化的任務來說，這不是小問題。\u003C\u002Fp>\n\u003Cfigure class=\"my-6\">\u003Cimg src=\"https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786343577690-m544.png\" alt=\"CreativeInstruct 讓 LLM 保留創意\" class=\"rounded-xl w-full\" loading=\"lazy\" \u002F>\u003C\u002Ffigure>\n\u003Cp>摘要點名了兩類場景。第一類是明確的 creativity tasks，例如 story generation。第二類是隱性的用途，例如 \u003Ca href=\"\u002Ftag\u002Freinforcement-learning\">reinforcement learning\u003C\u002Fa>。這代表作者不是只把「創意」理解成文學風格，而是把它視為模型在後續流程中能否保有探索空間的一部分。\u003C\u002Fp>\u003Cp>對開發者來說，這個痛點很實際。太保守的模型，做內容生成時容易重複，做 \u003Ca href=\"\u002Ftag\u002Fagent\">agent\u003C\u002Fa> 時容易路徑單一，做下游最佳化時也可能少了可探索的變異。你拿到的是更穩的答案，但未必是更好的生成器。\u003C\u002Fp>\u003Ch2>CreativeInstruct 怎麼運作\u003C\u002Fh2>\u003Cp>這篇方法的\u003Ca href=\"\u002Fnews\u002Fusage-limits-chatgpt-enterprise-edu-controls-zh\">核心\u003C\u002Fa>，是 instruction tuning，但它多了一個關鍵設計：模型會學到特殊的 \u003Ccode>[StartCreativity]\u003C\u002Fcode> spans。摘要的說法是，這些 spans 會把生成往更有創意、也更接近 base model 的方向推，同時盡量保住 post-trained 模型的品質。\u003C\u002Fp>\u003Cp>換句話說，它不是靠推理時再疊一層控制器，也不是靠多模型組合去拼出創意。而是把這種行為直接寫進訓練流程裡。這點對實作很重要，因為它代表方法目標是單一 checkpoint 的行為塑形，而不是 \u003Ca href=\"\u002Ftag\u002Finference\">inference\u003C\u002Fa>-time 的臨時拼裝。\u003C\u002Fp>\u003Cp>摘要還提到一個額外貢獻：它定義了一個基於 graph edit distance 的 structural diversity metric。這個指標想捕捉的是敘事結構層級的差異，而不只是字面上有沒有換詞。因為兩段輸出即使表面不同，甚至語意差不多，故事骨架還是可能一樣；這個 metric 就是要看得更深一層。\u003C\u002Fp>\u003Cp>這裡的技術重點很清楚：CreativeInstruct 不只是在訓練模型「比較會寫」，而是在訓練模型保留「不同寫法」的空間。它把創意當成可學習、可控制的屬性，而不是偶然冒出來的副作用。\u003C\u002Fp>\u003Ch2>論文實際證明了什麼\u003C\u002Fh2>\u003Cp>摘要裡最強的主張，是在 narrative generation 上，CreativeInstruct 的多樣性可以追上，甚至超過多模型基線，以及那些把多模型輸出蒸餾後的版本。更重要的是，它做到這件事時，沒有犧牲品質，也不需要在推理階段動用多個模型。\u003C\u002Fp>\n\u003Cfigure class=\"my-6\">\u003Cimg src=\"https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786343573106-swip.png\" alt=\"CreativeInstruct 讓 LLM 保留創意\" class=\"rounded-xl w-full\" loading=\"lazy\" \u002F>\u003C\u002Ffigure>\n\u003Cp>人類評估的數字也很直接：標註者在 70.3% 的案例中，認為 CreativeInstruct 的輸出比 post-trained LLM 更有創意。這是摘要裡唯一明確公開的人評數字；如果你期待更完整的 \u003Ca href=\"\u002Ftag\u002Fbenchmark\">benchmark\u003C\u002Fa> 表格，這份摘要沒有提供。\u003C\u002Fp>\u003Cp>論文還把這個 checkpoint 帶去做下游強化學習測試。摘要寫到，當 GRPO 套在 CreativeInstruct 上時，相較於套在 post-trained checkpoint 上，AMC 大約提升 4%，MATH 大約提升 5 個百分點。這裡同樣要保守看待：摘要沒有給出更完整的 benchmark 細節，我們只能報告它明確寫出的結果。\u003C\u002Fp>\u003Cp>這個結果的意義，不只是「創意看起來比較好」。作者想傳達的是，保留創意本身，可能也能幫助後續最佳化。也就是說，creative checkpoint 不只是內容生成的風格選項，還可能是下游優化更好的起點。\u003C\u002Fp>\u003Ch2>對開發者有什麼影響\u003C\u002Fh2>\u003Cp>如果你在做 LLM 產品，這篇最值得注意的地方，是它把一個老問題講得很清楚：越追求可靠，模型越可能變窄。CreativeInstruct 提供的是另一種訓練思路——不用在品質和多樣性之間二選一，而是試著一起保住。\u003C\u002Fp>\u003Cp>這對幾種工作流都可能有用。做內容生成時，它可能減少千篇一律的輸出。做 agent 系統時，它可能讓模型有更多替代方案可選。做 RL 或 iterative optimization 時，它暗示一個較有創意的起始 checkpoint，可能比過度對齊過的 checkpoint 更適合作為底座。\u003C\u002Fp>\u003Cul>\u003Cli>它是訓練時方法，不是推理時多模型 orchestration。\u003C\u002Fli>\u003Cli>它用結構層級的 diversity metric，而不只看表面字詞差異。\u003C\u002Fli>\u003Cli>它暗示創意保留，可能對下游 RL 有幫助。\u003C\u002Fli>\u003C\u002Ful>\u003Ch2>限制與還沒回答的問題\u003C\u002Fh2>\u003Cp>不過，這份摘要給的資訊也有明顯邊界。它有一個人評數字、兩個下游 RL 數字，但沒有公開完整 benchmark 細節。摘要也沒有交代完整訓練配方、資料規模，或算力\u003Ca href=\"\u002Fnews\u002Fkimi-k3-gpu-api-cost-comparison-zh\">成本\u003C\u002Fa>。\u003C\u002Fp>\u003Cp>所以，工程上不適合把它當成「一套通吃所有場景」的現成解法。更合理的看法，是把它視為一種值得試的訓練策略。真正要落地時，還會想知道它跨領域是否穩定、creative spans 的設計對結果有多敏感、以及額外調整\u003Ca href=\"\u002Fnews\u002Fdeepseek-codex-ai-coding-costs-reset-zh\">成本\u003C\u002Fa>高不高。\u003C\u002Fp>\u003Cp>即便如此，方向已經很明確。CreativeInstruct 想把「有創意，而且有用」變成模型的第一級特性，而不是對齊之後不小心留下來的副作用。對做生成系統的團隊來說，這是一個很實際、也很值得追的設計目標。\u003C\u002Fp>\u003Cp>總結來說，這篇論文證明了一件事：LLM 不一定要為了品質而放棄多樣性。它提出一個具體做法來保留創意，用更結構化的方式衡量它，還顯示這種 checkpoint 甚至可能幫到下游 RL。\u003C\u002Fp>","CreativeInstruct 用 instruction tuning 保住 LLM 的創意與多樣性，還能維持品質，並在部分下游 RL 設定中帶來提升。","arxiv.org","https:\u002F\u002Farxiv.org\u002Fabs\u002F2608.07460",null,"https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786343577690-m544.png","research","zh","d26d3c47-b7f3-4598-a877-e7be8c67cf67",[17,18,19,20,21,22],"LLM","instruction tuning","creativity","diversity","graph edit distance","reinforcement learning",[24,25,26],"CreativeInstruct 透過 instruction tuning 與 [StartCreativity] spans，讓模型保留創意與多樣性。","摘要只公開少量數字：70.3% 人評案例，以及 GRPO 在 AMC、MATH 的提升。","這方法的價值在於單一 checkpoint 就能兼顧品質與創意，不必依賴多模型推理。",0,"2026-08-10T06:32:27.403714+00:00","2026-08-10T06:32:27.382+00:00",{"tags":31,"relatedLang":34,"relatedPosts":38},[32],{"name":17,"slug":33},"llm",{"id":15,"slug":35,"title":36,"language":37},"creativeinstruct-llms-quality-creativity-diversity-en","CreativeInstruct teaches LLMs to stay creative","en",[39,45,51,57,63,69],{"id":40,"slug":41,"title":42,"cover_image":43,"image_url":43,"created_at":44,"category":13},"01ff45d6-76b3-4cdb-99bf-95d620b383fb","coinrag-fine-grained-kv-cache-reuse-rag-zh","CoinRAG 用細粒度 KV 快取加速 RAG","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786345391816-qqol.png","2026-08-10T07:02:33.206316+00:00",{"id":46,"slug":47,"title":48,"cover_image":49,"image_url":49,"created_at":50,"category":13},"69b80aa9-fd04-4b88-aadd-c5ebdb9a5be8","mirrorworld-mirror-reflection-video-diffusion-zh","MirrorWorld 讓鏡中倒影更一致","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786341773135-zkin.png","2026-08-10T06:02:26.712866+00:00",{"id":52,"slug":53,"title":54,"cover_image":55,"image_url":55,"created_at":56,"category":13},"3fa5a446-8c57-4050-8677-57969a8249e3","claude-4-5-ai-progress-still-accelerating-zh","Claude 4.5 證明 AI 進步還在加速","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786257168178-wg32.png","2026-08-09T06:32:26.842354+00:00",{"id":58,"slug":59,"title":60,"cover_image":61,"image_url":61,"created_at":62,"category":13},"32185438-867e-45f5-a048-b23ed209d20b","mage-vl-compressed-video-token-pipeline-zh","Mage-VL把视频Token壓到25%","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786170811727-2ctz.png","2026-08-08T06:33:05.78696+00:00",{"id":64,"slug":65,"title":66,"cover_image":67,"image_url":67,"created_at":68,"category":13},"04a3925a-33c0-4954-89b7-41e51365cc40","astra-turns-long-math-tasks-into-multi-agent-work-zh","Astra 把長任務拆成多代理工作","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786088000695-2qtf.png","2026-08-07T07:32:51.483837+00:00",{"id":70,"slug":71,"title":72,"cover_image":73,"image_url":73,"created_at":74,"category":13},"01da4d83-b580-43fe-a4aa-0e4285e056c0","evidence-linked-feature-engineering-heart-failure-zh","心衰 EHR 特徵工程可追證據","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786086179831-hiwd.png","2026-08-07T07:02:30.845188+00:00",[76,81,86,91,96,101,106,111,116,121],{"id":77,"slug":78,"title":79,"created_at":80},"f18dbadb-8c59-4723-84a4-6ad22746c77a","deepmind-bets-on-continuous-learning-ai-2026-zh","DeepMind 押注 2026 連續學習 AI","2026-03-26T08:16:02.367355+00:00",{"id":82,"slug":83,"title":84,"created_at":85},"f4a106cb-02a6-4508-8f39-9720a0a93cee","ml-papers-of-the-week-github-research-desk-zh","每週 ML 論文清單，為何紅到 GitHub","2026-03-27T01:11:39.284175+00:00",{"id":87,"slug":88,"title":89,"created_at":90},"c4f807ca-4e5f-47f1-a48c-961cf3fc44dc","ai-ml-conferences-to-watch-in-2026-zh","2026 AI 研討會投稿時程整理","2026-03-27T01:51:53.874432+00:00",{"id":92,"slug":93,"title":94,"created_at":95},"cf046742-efb2-4753-aef9-caed5da5e32e","adaptive-block-scaled-data-types-zh","IF4：神經網路量化的聰明選擇","2026-03-31T06:00:36.990273+00:00",{"id":97,"slug":98,"title":99,"created_at":100},"53a0dc54-0371-4e40-8d5e-74e94a73840c","geometry-aware-similarity-metrics-for-neural-representations-zh","超越距離測量：用微分幾何重新理解神經網路","2026-03-31T06:01:01.241968+00:00",{"id":102,"slug":103,"title":104,"created_at":105},"fee7d472-a775-4b1d-bbc2-1e8bca1bbf8b","on-the-fly-repulsion-in-the-contextual-space-for-rich-divers-zh","讓AI繪圖更有創意：用排斥力提升生成多樣性","2026-03-31T06:01:25.439673+00:00",{"id":107,"slug":108,"title":109,"created_at":110},"a9901203-d69b-447b-8854-15d14eab32b4","vision-aided-beam-prediction-cnn-eca-zh","影像輔助波束預測升級 CNN","2026-04-01T10:00:25.8073+00:00",{"id":112,"slug":113,"title":114,"created_at":115},"b55e7dd4-0a24-4b3d-804d-b0309a03f498","triple-band-fss-mimo-antenna-sub-6-ghz-zh","三頻 FSS MIMO 天線瞄準 sub-6 GHz","2026-04-01T13:18:36.857305+00:00",{"id":117,"slug":118,"title":119,"created_at":120},"f68290bd-e7f3-4b30-ba22-dcd4e0130a66","openclaw-1299-repos-eight-weeks-analysis-zh","OpenClaw 1299 個 Repo 的資料解讀","2026-04-02T05:03:45.208411+00:00",{"id":122,"slug":123,"title":124,"created_at":125},"ed9f80eb-eb02-4d35-8ad4-0ddf428751dd","beam-coherence-aware-combining-mmwave-mimo-zh","毫米波 MIMO 的雙階合併法","2026-04-02T05:27:26.897188+00:00"]