[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"article-omni-scientist-full-stack-ai-science-zh":3,"article-related-omni-scientist-full-stack-ai-science-zh":29,"series-research-6bbeb865-a249-440c-839f-cf1763be8ab2":72},{"id":4,"slug":5,"title":6,"content":7,"summary":8,"source":9,"source_url":10,"author":11,"image_url":12,"cover_image":12,"category":13,"language":14,"translated_content":11,"related_article_id":15,"keywords":16,"key_takeaways":22,"views":26,"created_at":27,"published_at":28,"topic_cluster_id":11},"6bbeb865-a249-440c-839f-cf1763be8ab2","omni-scientist-full-stack-ai-science-zh","OmniScientist：AI 科學家先看原始證據","\u003Cp data-speakable=\"summary\">以前 AI 科學家多半先看摘要再做推理，現在 OmniScientist 直接讀原始多模態證據，讓資料一路影響構想、實驗到寫作。\u003C\u002Fp>\u003Cul>\u003Cli>\u003Cstrong>研究機構\u003C\u002Fstrong>：arXiv 摘要未明確標註\u003C\u002Fli>\u003Cli>\u003Cstrong>核心數據\u003C\u002Fstrong>：85% head-to-head judgments\u003C\u002Fli>\u003Cli>\u003Cstrong>突破點\u003C\u002Fstrong>：原始證據直通流程\u003C\u002Fli>\u003C\u002Ful>\u003Cp>這篇論文在回答一個很實際的問題：AI 科學系統到底該先看什麼？過去很多做法把重點放在把研究流程自動化，例如生想法、跑實驗、寫論文，但真正進到模型眼前的，常常只是文字摘要、標籤、\u003Ca href=\"\u002Fnews\u002Fgemini-3-7-flash-launch-coding-gains-zh\">程式\u003C\u002Fa>輸出，或先算好的特徵。OmniScientist 認為，這樣會漏掉科學證據裡真正關鍵的關係。\u003C\u002Fp>\u003Cp>這個差別不是小修小補，而是定義問題本身。若系統只看整理過的資料，它可能看不到空間關係、時間變化、跨模態對應，或流程中的前後脈絡。這些東西在很多科學判斷裡，往往比單一數值更重要。也就是說，這篇不是在問「AI 能不能寫論文」，而是在問「AI 有沒有真的看見證據」。\u003C\u002Fp>\u003Ch2>這篇想修正的痛點\u003C\u002Fh2>\u003Cp>作者先把問題切得很清楚：workflow coverage 不等於 evidence coverage。系統即使能把研究步驟都跑完，也不代表它真的理解了原始資料。換句話說，流程自動化不等於科學推理完整。\u003C\u002Fp>\n\u003Cfigure class=\"my-6\">\u003Cimg src=\"https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786689182933-w118.png\" alt=\"OmniScientist：AI 科學家先看原始證據\" class=\"rounded-xl w-full\" loading=\"lazy\" \u002F>\u003C\u002Ffigure>\n\u003Cp>這個缺口在跨領域研究特別明顯。論文摘要列出的證據型態很廣，包含 images、signals、audio、video、3-D structures、trajectories、formulae 和 graphs。這些資料不只是格式不同，裡面的關係也不同。像圖像裡的空間位置、訊號裡的時間順序、軌跡裡的動態變化，常常就是結論能不能成立的關鍵。\u003C\u002Fp>\u003Cp>OmniScientist 的目標，就是把研究建立在 heterogeneous raw evidence 上，而不是先把資料壓縮成較簡單的表示法再推理。它要處理的，不只是「怎麼自動寫」，而是「怎麼讓證據一路留在迴圈裡」。\u003C\u002Fp>\u003Ch2>方法到底怎麼運作\u003C\u002Fh2>\u003Cp>這套系統的結構很明確：先有 perception layer，再接三個 autonomous agents，分別\u003Ca href=\"\u002Fnews\u002Fcbdc-governance-standards-stakeholder-roles-zh\">負責\u003C\u002Fa> ideation、experiment 和 writeup。這三個 \u003Ca href=\"\u002Ftag\u002Fagent\">agent\u003C\u002Fa> 是放在 deterministic pipeline 裡運作，不是讓它們自由亂跑。這代表流程是被設計過的，順序和約束都比較固定。\u003C\u002Fp>\u003Cp>白話來說，系統不是先想好題目再去找資料配合，而是讓觀察先進來，去影響研究問題怎麼形成、實驗怎麼選、最後的主張怎麼寫。這一點很重要，因為它改變了 agent 的角色：不是只做文字\u003Ca href=\"\u002Fnews\u002Fautodesign-meta-harness-optimization-posters-zh\">生成\u003C\u002Fa>，而是讓感知成為研究的一部分。\u003C\u002Fp>\u003Cp>摘要還提到，系統把 idea、rigour 和 claim checks 寫進程式裡，用來做 novelty screening、statistical validity、execution provenance 和 numerical traceability。對開發者來說，這是最有實作感的一段。它表示這不是純靠 prompt 控制，而是用可程式化檢查去限制輸出，避免 agent 只會講得像科學，卻沒有科學上的可追溯性。\u003C\u002Fp>\u003Cp>不過，摘要沒有交代完整模型架構、prompt 設計或這些檢查的程式細節，所以我們不能從這份資料推回更多實作內容。能確定的是整體設計方向：先感知，再結構化推理，最後用機器檢查輸出。\u003C\u002Fp>\u003Ch2>論文實際證明了什麼\u003C\u002Fh2>\u003Cp>這篇的評估不是只有單一測試集。摘要寫到，作者拿 36 個 real-data cases 來測，涵蓋 5 個 discipline families 和 4 類 scientific evidence。也就是說，它不是只在單一資料型態上試水溫，而是試圖跨不同科學情境驗證。\u003C\u002Fp>\n\u003Cfigure class=\"my-6\">\u003Cimg src=\"https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786689185874-0a91.png\" alt=\"OmniScientist：AI 科學家先看原始證據\" class=\"rounded-xl w-full\" loading=\"lazy\" \u002F>\u003C\u002Ffigure>\n\u003Cp>結果上，系統在這 36 個案例裡都能從 raw data 走到 compiled manuscript。摘要也報告了 mean overall paper score 6.3，使用的是 reference reasoning backbone。這代表系統不只完成流程，還有一個整體分數可參考。不過摘要沒有說這個 6.3 的完整意義，也沒有公開完整 \u003Ca href=\"\u002Ftag\u002Fbenchmark\">benchmark\u003C\u002Fa> 細節，所以不能把它直接解讀成某種通用能力指標。\u003C\u002Fp>\u003Cp>真正最有力的結果，是和 blind variant 的對照。那個版本只拿到 precomputed scalar features，沒有直接看原始證據。結果顯示，直接 perception 在 7 個 evaluation dimensions 全部更好，且在 head-to-head judgments 裡贏了 85%。這是摘要裡最清楚、也最能支撐主張的數字。\u003C\u002Fp>\u003Cp>但也要注意，摘要沒有列出那 7 個維度各自的分數差，也沒有說 scoring rubric 的細節。因此我們知道 direct perception 有優勢，卻還不能從摘要判斷這個優勢在不同任務上有多大、哪一項最關鍵。\u003C\u002Fp>\u003Ch2>對開發者有什麼影響\u003C\u002Fh2>\u003Cp>如果你在做 agentic system，這篇最值得看的不是「\u003Ca href=\"\u002Ftag\u002Fllm\">LLM\u003C\u002Fa> 能不能寫論文」，而是「agent 應該看到什麼」。OmniScientist 的答案很直接：不要只給壓縮後的表示，原始證據本身要留在迴圈裡。這會直接影響資料管線、工具設計，還有你怎麼定義評估方法。\u003C\u002Fp>\u003Cp>原因很簡單。很多科學判斷不是從單一欄位就能看出來，而是藏在結構、時間、或跨模態對應裡。若系統只依賴摘要或 scalar features，它可能在表面上看起來很會推理，實際上卻錯過真正的訊號。這篇論文等於提醒開發者：感知層不是附加功能，而是科學推理的一部分。\u003C\u002Fp>\u003Cp>另一個值得參考的點，是 deterministic pipeline 加上程式化檢查。這種做法的價值，在於把自主 agent 的探索能力和規則約束綁在一起。你可以讓系統去發想、去跑實驗、去寫稿，但在 novelty、統計、來源紀錄和數值一致性上，還是要有硬檢查。這對想做可靠 AI workflow 的團隊很有啟發。\u003C\u002Fp>\u003Ch2>限制和還沒回答的問題\u003C\u002Fh2>\u003Cp>這篇摘要有說服力，但資訊還是不完整。它沒有交代運算成本，也沒有說內部 agent 是怎麼協調的，更沒有說在資料雜訊很高、缺值很多、或證據彼此衝突時會發生什麼事。這些都是落地時很關鍵的問題。\u003C\u002Fp>\u003Cp>另外，摘要也沒有說這套方法能不能泛化到 36 個案例以外的情境。它用的是哪一個 reference reasoning backbone，摘要只提到有用，但沒有說這個 backbone 對結果影響多大。對真正要拿去做產品或研究平台的人來說，這些都是還不能忽略的空白。\u003C\u002Fp>\u003Cp>所以，這篇目前能證明的，是 lifecycle-wide perception 在這批案例上，確實比只看特徵值更有用。它不能直接證明 AI science 已經被解決，但它至少把一件事講得很清楚：如果你要做 evidence-grounded discovery，讓系統直接看見原始證據，可能比再加一層摘要更重要。\u003C\u002Fp>\u003Ch2>結論\u003C\u002Fh2>\u003Cp>OmniScientist 的核心貢獻，不是把研究流程再自動化一次，而是把多模態原始證據重新放回 AI 科學流程裡。它從構想、實驗到寫作，都試著讓觀察先於結論。\u003C\u002Fp>\u003Cp>對開發者來說，這篇的訊號很明確：如果你的 agent 要做科學判斷，感知層的重要性，可能不輸模型本身。你給它看什麼，會直接決定它能不能做出像樣的科學主張。\u003C\u002Fp>\u003Cul>\u003Cli>原始多模態證據比摘要特徵更能支撐科學推理。\u003C\u002Fli>\u003Cli>用 deterministic pipeline 和程式檢查，可把 agent 變得更可控。\u003C\u002Fli>\u003Cli>在 36 個案例中，直接 perception 以 85% head-to-head judgments 勝過盲版。\u003C\u002Fli>\u003C\u002Ful>","OmniScientist 把原始多模態證據直接放進 AI 科學流程，讓觀察不只被摘要，還能影響構想、實驗到寫作。","arxiv.org","https:\u002F\u002Farxiv.org\u002Fabs\u002F2608.13558",null,"https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786689182933-w118.png","research","zh","6b0b3b1a-f397-44d3-ad83-207b4e87d877",[17,18,19,20,21],"multimodal perception","AI scientist","agentic workflow","evidence-grounded discovery","deterministic pipeline",[23,24,25],"OmniScientist 主張 AI 科學流程要直接看原始多模態證據，不只看摘要或特徵。","它用 perception layer 加上 ideation、experiment、writeup 三個 agent，並以程式化檢查約束輸出。","摘要報告在 36 個案例上完成全流程，且 direct perception 在 head-to-head 比較中贏了 85%。",1,"2026-08-14T06:32:31.082995+00:00","2026-08-14T06:32:31.051+00:00",{"tags":30,"relatedLang":31,"relatedPosts":35},[],{"id":15,"slug":32,"title":33,"language":34},"omni-scientist-full-stack-ai-science-en","OmniScientist aims for full-stack AI science","en",[36,42,48,54,60,66],{"id":37,"slug":38,"title":39,"cover_image":40,"image_url":40,"created_at":41,"category":13},"70584f73-54b3-4548-944b-7c596e1e3db5","humantracker-human-aligned-motion-tracking-benchmark-zh","HumanTracker補上人形評測盲點","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786690974820-0s3o.png","2026-08-14T07:02:30.412806+00:00",{"id":43,"slug":44,"title":45,"cover_image":46,"image_url":46,"created_at":47,"category":13},"3a451f17-5483-4c4f-930c-3e58a97760a1","autodesign-meta-harness-optimization-posters-zh","AutoDesign：讓海報生成自己變強","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786687383071-oaq0.png","2026-08-14T06:02:26.50133+00:00",{"id":49,"slug":50,"title":51,"cover_image":52,"image_url":52,"created_at":53,"category":13},"a212bb55-ce9d-4c3e-870d-8d6cd0ff3b76","test-time-harnesses-weak-model-transfer-zh","測試時外掛讓弱模型升級","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786604574332-ails.png","2026-08-13T07:02:25.318901+00:00",{"id":55,"slug":56,"title":57,"cover_image":58,"image_url":58,"created_at":59,"category":13},"363b733e-eb27-4be3-a234-4b3044e0eb3e","dreamfly-aerial-vln-memory-planning-zh","DreamFly 讓空中 VLN 更會記、會算","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786602773313-9vlj.png","2026-08-13T06:32:23.836363+00:00",{"id":61,"slug":62,"title":63,"cover_image":64,"image_url":64,"created_at":65,"category":13},"01d1a149-5977-4846-938a-6199ae59fc70","ava-encoder-agent-native-video-representation-zh","AVA-Encoder 把影片變知識圖譜","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786600969140-3p0h.png","2026-08-13T06:02:21.397513+00:00",{"id":67,"slug":68,"title":69,"cover_image":70,"image_url":70,"created_at":71,"category":13},"2aa54cfd-2caf-4c34-834c-e771e1308747","sparse-autoencoders-set-level-instability-zh","SAE 不是特徵袋","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786518181678-0ycl.png","2026-08-12T07:02:31.647391+00:00",[73,78,83,88,93,98,103,108,113,118],{"id":74,"slug":75,"title":76,"created_at":77},"f18dbadb-8c59-4723-84a4-6ad22746c77a","deepmind-bets-on-continuous-learning-ai-2026-zh","DeepMind 押注 2026 連續學習 AI","2026-03-26T08:16:02.367355+00:00",{"id":79,"slug":80,"title":81,"created_at":82},"f4a106cb-02a6-4508-8f39-9720a0a93cee","ml-papers-of-the-week-github-research-desk-zh","每週 ML 論文清單，為何紅到 GitHub","2026-03-27T01:11:39.284175+00:00",{"id":84,"slug":85,"title":86,"created_at":87},"c4f807ca-4e5f-47f1-a48c-961cf3fc44dc","ai-ml-conferences-to-watch-in-2026-zh","2026 AI 研討會投稿時程整理","2026-03-27T01:51:53.874432+00:00",{"id":89,"slug":90,"title":91,"created_at":92},"cf046742-efb2-4753-aef9-caed5da5e32e","adaptive-block-scaled-data-types-zh","IF4：神經網路量化的聰明選擇","2026-03-31T06:00:36.990273+00:00",{"id":94,"slug":95,"title":96,"created_at":97},"53a0dc54-0371-4e40-8d5e-74e94a73840c","geometry-aware-similarity-metrics-for-neural-representations-zh","超越距離測量：用微分幾何重新理解神經網路","2026-03-31T06:01:01.241968+00:00",{"id":99,"slug":100,"title":101,"created_at":102},"fee7d472-a775-4b1d-bbc2-1e8bca1bbf8b","on-the-fly-repulsion-in-the-contextual-space-for-rich-divers-zh","讓AI繪圖更有創意：用排斥力提升生成多樣性","2026-03-31T06:01:25.439673+00:00",{"id":104,"slug":105,"title":106,"created_at":107},"a9901203-d69b-447b-8854-15d14eab32b4","vision-aided-beam-prediction-cnn-eca-zh","影像輔助波束預測升級 CNN","2026-04-01T10:00:25.8073+00:00",{"id":109,"slug":110,"title":111,"created_at":112},"b55e7dd4-0a24-4b3d-804d-b0309a03f498","triple-band-fss-mimo-antenna-sub-6-ghz-zh","三頻 FSS MIMO 天線瞄準 sub-6 GHz","2026-04-01T13:18:36.857305+00:00",{"id":114,"slug":115,"title":116,"created_at":117},"f68290bd-e7f3-4b30-ba22-dcd4e0130a66","openclaw-1299-repos-eight-weeks-analysis-zh","OpenClaw 1299 個 Repo 的資料解讀","2026-04-02T05:03:45.208411+00:00",{"id":119,"slug":120,"title":121,"created_at":122},"ed9f80eb-eb02-4d35-8ad4-0ddf428751dd","beam-coherence-aware-combining-mmwave-mimo-zh","毫米波 MIMO 的雙階合併法","2026-04-02T05:27:26.897188+00:00"]