[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"article-autodesign-meta-harness-optimization-posters-zh":3,"article-related-autodesign-meta-harness-optimization-posters-zh":29,"series-research-3a451f17-5483-4c4f-930c-3e58a97760a1":72},{"id":4,"slug":5,"title":6,"content":7,"summary":8,"source":9,"source_url":10,"author":11,"image_url":12,"cover_image":12,"category":13,"language":14,"translated_content":11,"related_article_id":15,"keywords":16,"key_takeaways":22,"views":26,"created_at":27,"published_at":28,"topic_cluster_id":11},"3a451f17-5483-4c4f-930c-3e58a97760a1","autodesign-meta-harness-optimization-posters-zh","AutoDesign：讓海報生成自己變強","\u003Cp data-speakable=\"summary\">78.32 分是 AutoDesign 在 PosterBench 的最高成績，靠的是可學習的 harness。\u003C\u002Fp>\u003Cul>\u003Cli>\u003Cstrong>研究機構\u003C\u002Fstrong>：arXiv 摘要未明確標註\u003C\u002Fli>\u003Cli>\u003Cstrong>核心數據\u003C\u002Fstrong>：78.32 PosterBench 分數\u003C\u002Fli>\u003Cli>\u003Cstrong>突破點\u003C\u002Fstrong>：遞迴優化 harness\u003C\u002Fli>\u003C\u002Ful>\u003Cp>AutoDesign 不是單純把論文內容丟給模型排版。它想解的是更實際的問題：怎麼讓多模態輸入，像學術論文，穩定變成結構化、可讀的海報，而且不要只靠一次寫死的 prompt 或固定流程。\u003C\u002Fp>\u003Cp>這篇摘要的重點很明確：系統本身要能從經驗中變好。也就是說，AutoDesign 把 paper-to-poster 生成看成一個長跨度的 agentic 設計問題，讓「做海報的流程」也能被優化，而不是只優化單次輸出。\u003C\u002Fp>\u003Ch2>這篇論文在補哪個洞\u003C\u002Fh2>\u003Cp>摘要先指出，現有的多模態到結構化輸出流程太靜態。它們可以先產出一版結果，但不太會像人類設計流程那樣，把過去的嘗試變成可重用的經驗，然後再往上疊代。\u003C\u002Fp>\n\u003Cfigure class=\"my-6\">\u003Cimg src=\"https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786687383071-oaq0.png\" alt=\"AutoDesign：讓海報生成自己變強\" class=\"rounded-xl w-full\" loading=\"lazy\" \u002F>\u003C\u002Ffigure>\n\u003Cp>這個問題在長跨度任務特別明顯。系統得做很多決策，還要反覆修正前面的步驟，最後輸出還要保持一致。論文挑 paper-to-poster 當例子很合理，因為它不只是摘要壓縮，還要抽內容、組織資訊、控制版面，最後做成視覺化成果。\u003C\u002Fp>\u003Cp>AutoDesign 的做法是把任務拆成兩層。第一層是實際執行設計工作的 code \u003Ca href=\"\u002Ftag\u002Fagent\">agent\u003C\u002Fa>。第二層是 \u003Ca href=\"\u002Ftag\u002Fmeta\">meta\u003C\u002Fa>-harness optimizer，\u003Ca href=\"\u002Fnews\u002Fcbdc-governance-standards-stakeholder-roles-zh\">負責\u003C\u002Fa>看 rollouts 的回饋，然後改善引導 agent 的 harness。\u003C\u002Fp>\u003Cp>這裡的重點不是單一模型多厲害，而是整個工作流能不能越做越順。對做 agent 系統的開發者來說，這很像把「編排邏輯」本身也納入訓練或優化範圍。\u003C\u002Fp>\u003Ch2>方法到底怎麼運作\u003C\u002Fh2>\u003Cp>論文把 AutoDesign 描述成一個對齊人類設計先驗的框架。白話一點，就是它希望系統遵循人類覺得合理的設計偏好，而不是只盯著某個單一分數硬衝。\u003C\u002Fp>\u003Cp>真正的核心機制是遞迴改善。meta-harness optimizer 會利用 rollout feedback，持續把 code agent 推向更好的 harness。摘要沒有把每個實作細節全講完，所以比較安全的理解是：這個 harness 不是固定 prompt，也不是一次寫死的流程，而是能根據自己的嘗試結果再修。\u003C\u002Fp>\u003Cp>這種設計和一般「一個模型做完全部事情」的思路不太一樣。AutoDesign 把控制邏輯拉出來，讓它成為可優化的對象。對長流程任務來說，這通常比只換更強的 base model 更接近問題本身。\u003C\u002Fp>\u003Cp>為了驗證這件事，作者做了兩個 \u003Ca href=\"\u002Ftag\u002Fbenchmark\">benchmark\u003C\u002Fa>。第一個是 PosterBench，包含 100 篇論文、橫跨五個學科的 Main Track。第二個是 PosterBench-\u003Ca href=\"\u002Fnews\u002Fgemini-3-7-flash-launch-coding-gains-zh\">mini\u003C\u002Fa>，提供 10 篇論文的共享子集，方便做更受控的比較。\u003C\u002Fp>\u003Cp>這種設計有兩個用意。大版面看的是廣度，能觀察系統在不同論文類型上的表現。mini 版則是用來做更可比的配置測試，避免每次評估都被\u003Ca href=\"\u002Fnews\u002Fvdbbench-cost-benchmark-vector-databases-zh\">資料\u003C\u002Fa>差異干擾。\u003C\u002Fp>\u003Ch2>論文實際證明了什麼\u003C\u002Fh2>\u003Cp>最醒目的結果，是 AutoDesign 在 PosterBench Main Track 拿到 78.32 分，摘要說這是最高分，而且比封閉式商業系統 \u003Ca href=\"\u002Ftag\u002Fclaude-design\">Claude Design\u003C\u002Fa> 高 7.45 分。\u003C\u002Fp>\n\u003Cfigure class=\"my-6\">\u003Cimg src=\"https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786687374280-sk23.png\" alt=\"AutoDesign：讓海報生成自己變強\" class=\"rounded-xl w-full\" loading=\"lazy\" \u002F>\u003C\u002Ffigure>\n\u003Cp>這個數字很重要，因為它不是只贏某一個小設定，而是直接站上摘要宣稱的最佳成績。對研究來說，這代表 learned harness 不只是理論上可行，而是能在實際海報生成任務上拉開差距。\u003C\u002Fp>\u003Cp>論文也測了七組受控的 code-agent-model 配置。結果是，只要加入學到的 DesignHarness，表現就會一致變好。平均 PosterBench Score 從 54.99 提升到 67.39，提升幅度是 12.4%。\u003C\u002Fp>\u003Cp>這種一致性比單點高分更值得注意。因為很多 agent 方法只在特定 prompt 或特定模型上看起來很強，一旦換環境就掉分。摘要宣稱 AutoDesign 在多組配置下都有效，這讓它更像一個可移植的設計方法，而不是只靠調參撐起來的 demo。\u003C\u002Fp>\u003Cp>AutoDesign 也跑了一個全自動的長跨度迴圈。那個設定下，它做了 253 次 tool calls、11 次 editing turns，花 40 分鐘，成本低於 3 美元，最後在人類評估中達到平均 conference-poster 品質。\u003C\u002Fp>\u003Cp>另外還有一個 system-blind 的人類研究。摘要說 AutoDesign 在受評系統裡拿到最高的人類偏好。不過這裡沒有公開完整的研究流程、樣本數或偏好差距，所以只能知道方向正面，不能把它解讀成更細的統計結論。\u003C\u002Fp>\u003Cp>整體來看，這篇論文證明的不是「模型會畫海報」，而是「讓 harness 從 rollout feedback 學習」這件事，確實能改善長流程、多步驟的生成任務。\u003C\u002Fp>\u003Ch2>對開發者有什麼影響\u003C\u002Fh2>\u003Cp>如果你在做的不只是單輪問答，而是需要工具、修正、重試和輸出整形的 agent，這篇最值得看的其實是 harness。實務上，harness 包含指令、工具、回圈控制和修正邏輯，常常比 base model 更決定系統能不能把事做完。\u003C\u002Fp>\u003Cp>AutoDesign 提醒了一件事：harness 不一定要永遠手寫死。它可以被 feedback 驅動，持續往更好的方向修。這對做文件轉換、多模態摘要、自動排版，或任何需要反覆逼近結構化結果的流程，都有參考價值。\u003C\u002Fp>\u003Cp>這篇也順便說明，agent 類 benchmark 不能只看一個分數。作者同時用了較大的 benchmark、共享 mini 子集、多組受控配置和人類評估，這樣才比較接近真實系統會遇到的情況。\u003C\u002Fp>\u003Cp>對開發者來說，這代表你在 debug agent 時，不能只盯模型本體。很多時候卡住的，是 orchestration、迴圈設計，或是工具使用順序。AutoDesign 的觀點是：如果 harness 能學，整個 pipeline 就有機會變得更穩。\u003C\u002Fp>\u003Ch2>限制和還沒回答的問題\u003C\u002Fh2>\u003Cp>摘要給了很強的 headline，但也留下不少空白。它沒有完整說明 harness 的表示方式，也沒有詳細交代內部優化演算法。對外部讀者來說，最難判斷的是這個 learned harness 到底有多容易搬到別的任務。\u003C\u002Fp>\u003Cp>另一個限制是，摘要沒有提供 PosterBench 以外的 benchmark 數字，所以目前看不出它對其他多模態設計問題的泛化能力。也就是說，這篇目前證明的是 paper-to-poster 場景，不是所有 agentic design 場景都能直接套用。\u003C\u002Fp>\u003Cp>人類研究雖然結果正向，但摘要沒有提供研究規模和方法細節，所以還不能進一步判斷偏好差距有多穩、是否容易受任務設定影響。\u003C\u002Fp>\u003Cp>如果把它放回工程實務，這篇最實際的訊號是：當你的 agent pipeline 很脆，不一定只是 base model 不夠強，也可能是 harness 沒有被設計成可學習、可迭代的系統。AutoDesign 提供了一個把這件事做成方法的例子。\u003C\u002Fp>\u003Cp>它不是在說所有工作流都該自我進化，但它確實把「靜態編排」往「自適應 agent 設計」推了一步。對要做多步驟、多工具、多輪修正的開發者來說，這是很值得注意的方向。\u003C\u002Fp>\u003Ch2>結論\u003C\u002Fh2>\u003Cp>AutoDesign 把論文轉海報變成一個測試 self-improving harness 的場景，結果顯示 harness 本身確實會左右最終品質。這篇的價值不只在於分數更高，也在於它把「怎麼設計 agent 的工作流」這件事，拉到可以被系統化優化的層級。\u003C\u002Fp>\u003Cp>對\u003Ca href=\"\u002Ftag\u002F台灣開發者\">台灣開發者\u003C\u002Fa>來說，這篇最實用的啟發很直接：如果你正在做 agent、文件生成或多模態工作流，別只看模型選哪個。真正決定成敗的，往往是那個看起來不起眼、但會不斷影響結果的 harness。\u003C\u002Fp>","AutoDesign 用可學習的 harness 把論文轉海報做得更好，在 PosterBench 拿下 78.32 分，並超過 Claude Design。","arxiv.org","https:\u002F\u002Farxiv.org\u002Fabs\u002F2608.13560",null,"https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786687383071-oaq0.png","research","zh","62360ad1-f133-491c-9389-966b8d532d46",[17,18,19,20,21],"AutoDesign","PosterBench","harness optimization","agentic systems","paper-to-poster",[23,24,25],"AutoDesign 用可學習的 harness 改善論文轉海報任務，PosterBench 最高分達 78.32。","摘要顯示 learned DesignHarness 在七組受控配置下都能把平均分從 54.99 拉到 67.39。","這篇的重點不只是輸出更好，而是把 agent 的編排邏輯也變成可優化對象。",1,"2026-08-14T06:02:26.50133+00:00","2026-08-14T06:02:26.493+00:00",{"tags":30,"relatedLang":31,"relatedPosts":35},[],{"id":15,"slug":32,"title":33,"language":34},"autodesign-meta-harness-optimization-posters-en","AutoDesign learns better poster-making harnesses","en",[36,42,48,54,60,66],{"id":37,"slug":38,"title":39,"cover_image":40,"image_url":40,"created_at":41,"category":13},"70584f73-54b3-4548-944b-7c596e1e3db5","humantracker-human-aligned-motion-tracking-benchmark-zh","HumanTracker補上人形評測盲點","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786690974820-0s3o.png","2026-08-14T07:02:30.412806+00:00",{"id":43,"slug":44,"title":45,"cover_image":46,"image_url":46,"created_at":47,"category":13},"6bbeb865-a249-440c-839f-cf1763be8ab2","omni-scientist-full-stack-ai-science-zh","OmniScientist：AI 科學家先看原始證據","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786689182933-w118.png","2026-08-14T06:32:31.082995+00:00",{"id":49,"slug":50,"title":51,"cover_image":52,"image_url":52,"created_at":53,"category":13},"a212bb55-ce9d-4c3e-870d-8d6cd0ff3b76","test-time-harnesses-weak-model-transfer-zh","測試時外掛讓弱模型升級","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786604574332-ails.png","2026-08-13T07:02:25.318901+00:00",{"id":55,"slug":56,"title":57,"cover_image":58,"image_url":58,"created_at":59,"category":13},"363b733e-eb27-4be3-a234-4b3044e0eb3e","dreamfly-aerial-vln-memory-planning-zh","DreamFly 讓空中 VLN 更會記、會算","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786602773313-9vlj.png","2026-08-13T06:32:23.836363+00:00",{"id":61,"slug":62,"title":63,"cover_image":64,"image_url":64,"created_at":65,"category":13},"01d1a149-5977-4846-938a-6199ae59fc70","ava-encoder-agent-native-video-representation-zh","AVA-Encoder 把影片變知識圖譜","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786600969140-3p0h.png","2026-08-13T06:02:21.397513+00:00",{"id":67,"slug":68,"title":69,"cover_image":70,"image_url":70,"created_at":71,"category":13},"2aa54cfd-2caf-4c34-834c-e771e1308747","sparse-autoencoders-set-level-instability-zh","SAE 不是特徵袋","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786518181678-0ycl.png","2026-08-12T07:02:31.647391+00:00",[73,78,83,88,93,98,103,108,113,118],{"id":74,"slug":75,"title":76,"created_at":77},"f18dbadb-8c59-4723-84a4-6ad22746c77a","deepmind-bets-on-continuous-learning-ai-2026-zh","DeepMind 押注 2026 連續學習 AI","2026-03-26T08:16:02.367355+00:00",{"id":79,"slug":80,"title":81,"created_at":82},"f4a106cb-02a6-4508-8f39-9720a0a93cee","ml-papers-of-the-week-github-research-desk-zh","每週 ML 論文清單，為何紅到 GitHub","2026-03-27T01:11:39.284175+00:00",{"id":84,"slug":85,"title":86,"created_at":87},"c4f807ca-4e5f-47f1-a48c-961cf3fc44dc","ai-ml-conferences-to-watch-in-2026-zh","2026 AI 研討會投稿時程整理","2026-03-27T01:51:53.874432+00:00",{"id":89,"slug":90,"title":91,"created_at":92},"cf046742-efb2-4753-aef9-caed5da5e32e","adaptive-block-scaled-data-types-zh","IF4：神經網路量化的聰明選擇","2026-03-31T06:00:36.990273+00:00",{"id":94,"slug":95,"title":96,"created_at":97},"53a0dc54-0371-4e40-8d5e-74e94a73840c","geometry-aware-similarity-metrics-for-neural-representations-zh","超越距離測量：用微分幾何重新理解神經網路","2026-03-31T06:01:01.241968+00:00",{"id":99,"slug":100,"title":101,"created_at":102},"fee7d472-a775-4b1d-bbc2-1e8bca1bbf8b","on-the-fly-repulsion-in-the-contextual-space-for-rich-divers-zh","讓AI繪圖更有創意：用排斥力提升生成多樣性","2026-03-31T06:01:25.439673+00:00",{"id":104,"slug":105,"title":106,"created_at":107},"a9901203-d69b-447b-8854-15d14eab32b4","vision-aided-beam-prediction-cnn-eca-zh","影像輔助波束預測升級 CNN","2026-04-01T10:00:25.8073+00:00",{"id":109,"slug":110,"title":111,"created_at":112},"b55e7dd4-0a24-4b3d-804d-b0309a03f498","triple-band-fss-mimo-antenna-sub-6-ghz-zh","三頻 FSS MIMO 天線瞄準 sub-6 GHz","2026-04-01T13:18:36.857305+00:00",{"id":114,"slug":115,"title":116,"created_at":117},"f68290bd-e7f3-4b30-ba22-dcd4e0130a66","openclaw-1299-repos-eight-weeks-analysis-zh","OpenClaw 1299 個 Repo 的資料解讀","2026-04-02T05:03:45.208411+00:00",{"id":119,"slug":120,"title":121,"created_at":122},"ed9f80eb-eb02-4d35-8ad4-0ddf428751dd","beam-coherence-aware-combining-mmwave-mimo-zh","毫米波 MIMO 的雙階合併法","2026-04-02T05:27:26.897188+00:00"]