[RSCH] 7 分鐘閱讀OraCore 編輯部

OmniScientist:AI 科學家先看原始證據

OmniScientist 把原始多模態證據直接放進 AI 科學流程,讓觀察不只被摘要,還能影響構想、實驗到寫作。

分享 LinkedIn
OmniScientist:AI 科學家先看原始證據

以前 AI 科學家多半先看摘要再做推理,現在 OmniScientist 直接讀原始多模態證據,讓資料一路影響構想、實驗到寫作。

  • 研究機構:arXiv 摘要未明確標註
  • 核心數據:85% head-to-head judgments
  • 突破點:原始證據直通流程

這篇論文在回答一個很實際的問題:AI 科學系統到底該先看什麼?過去很多做法把重點放在把研究流程自動化,例如生想法、跑實驗、寫論文,但真正進到模型眼前的,常常只是文字摘要、標籤、程式輸出,或先算好的特徵。OmniScientist 認為,這樣會漏掉科學證據裡真正關鍵的關係。

這個差別不是小修小補,而是定義問題本身。若系統只看整理過的資料,它可能看不到空間關係、時間變化、跨模態對應,或流程中的前後脈絡。這些東西在很多科學判斷裡,往往比單一數值更重要。也就是說,這篇不是在問「AI 能不能寫論文」,而是在問「AI 有沒有真的看見證據」。

這篇想修正的痛點

訂閱 AI 趨勢週報

每週精選模型發布、工具應用與深度分析,直送信箱。不定期,不騷擾。

不會寄垃圾信,隨時可取消。

作者先把問題切得很清楚:workflow coverage 不等於 evidence coverage。系統即使能把研究步驟都跑完,也不代表它真的理解了原始資料。換句話說,流程自動化不等於科學推理完整。

OmniScientist:AI 科學家先看原始證據

這個缺口在跨領域研究特別明顯。論文摘要列出的證據型態很廣,包含 images、signals、audio、video、3-D structures、trajectories、formulae 和 graphs。這些資料不只是格式不同,裡面的關係也不同。像圖像裡的空間位置、訊號裡的時間順序、軌跡裡的動態變化,常常就是結論能不能成立的關鍵。

OmniScientist 的目標,就是把研究建立在 heterogeneous raw evidence 上,而不是先把資料壓縮成較簡單的表示法再推理。它要處理的,不只是「怎麼自動寫」,而是「怎麼讓證據一路留在迴圈裡」。

方法到底怎麼運作

這套系統的結構很明確:先有 perception layer,再接三個 autonomous agents,分別負責 ideation、experiment 和 writeup。這三個 agent 是放在 deterministic pipeline 裡運作,不是讓它們自由亂跑。這代表流程是被設計過的,順序和約束都比較固定。

白話來說,系統不是先想好題目再去找資料配合,而是讓觀察先進來,去影響研究問題怎麼形成、實驗怎麼選、最後的主張怎麼寫。這一點很重要,因為它改變了 agent 的角色:不是只做文字生成,而是讓感知成為研究的一部分。

摘要還提到,系統把 idea、rigour 和 claim checks 寫進程式裡,用來做 novelty screening、statistical validity、execution provenance 和 numerical traceability。對開發者來說,這是最有實作感的一段。它表示這不是純靠 prompt 控制,而是用可程式化檢查去限制輸出,避免 agent 只會講得像科學,卻沒有科學上的可追溯性。

不過,摘要沒有交代完整模型架構、prompt 設計或這些檢查的程式細節,所以我們不能從這份資料推回更多實作內容。能確定的是整體設計方向:先感知,再結構化推理,最後用機器檢查輸出。

論文實際證明了什麼

這篇的評估不是只有單一測試集。摘要寫到,作者拿 36 個 real-data cases 來測,涵蓋 5 個 discipline families 和 4 類 scientific evidence。也就是說,它不是只在單一資料型態上試水溫,而是試圖跨不同科學情境驗證。

OmniScientist:AI 科學家先看原始證據

結果上,系統在這 36 個案例裡都能從 raw data 走到 compiled manuscript。摘要也報告了 mean overall paper score 6.3,使用的是 reference reasoning backbone。這代表系統不只完成流程,還有一個整體分數可參考。不過摘要沒有說這個 6.3 的完整意義,也沒有公開完整 benchmark 細節,所以不能把它直接解讀成某種通用能力指標。

真正最有力的結果,是和 blind variant 的對照。那個版本只拿到 precomputed scalar features,沒有直接看原始證據。結果顯示,直接 perception 在 7 個 evaluation dimensions 全部更好,且在 head-to-head judgments 裡贏了 85%。這是摘要裡最清楚、也最能支撐主張的數字。

但也要注意,摘要沒有列出那 7 個維度各自的分數差,也沒有說 scoring rubric 的細節。因此我們知道 direct perception 有優勢,卻還不能從摘要判斷這個優勢在不同任務上有多大、哪一項最關鍵。

對開發者有什麼影響

如果你在做 agentic system,這篇最值得看的不是「LLM 能不能寫論文」,而是「agent 應該看到什麼」。OmniScientist 的答案很直接:不要只給壓縮後的表示,原始證據本身要留在迴圈裡。這會直接影響資料管線、工具設計,還有你怎麼定義評估方法。

原因很簡單。很多科學判斷不是從單一欄位就能看出來,而是藏在結構、時間、或跨模態對應裡。若系統只依賴摘要或 scalar features,它可能在表面上看起來很會推理,實際上卻錯過真正的訊號。這篇論文等於提醒開發者:感知層不是附加功能,而是科學推理的一部分。

另一個值得參考的點,是 deterministic pipeline 加上程式化檢查。這種做法的價值,在於把自主 agent 的探索能力和規則約束綁在一起。你可以讓系統去發想、去跑實驗、去寫稿,但在 novelty、統計、來源紀錄和數值一致性上,還是要有硬檢查。這對想做可靠 AI workflow 的團隊很有啟發。

限制和還沒回答的問題

這篇摘要有說服力,但資訊還是不完整。它沒有交代運算成本,也沒有說內部 agent 是怎麼協調的,更沒有說在資料雜訊很高、缺值很多、或證據彼此衝突時會發生什麼事。這些都是落地時很關鍵的問題。

另外,摘要也沒有說這套方法能不能泛化到 36 個案例以外的情境。它用的是哪一個 reference reasoning backbone,摘要只提到有用,但沒有說這個 backbone 對結果影響多大。對真正要拿去做產品或研究平台的人來說,這些都是還不能忽略的空白。

所以,這篇目前能證明的,是 lifecycle-wide perception 在這批案例上,確實比只看特徵值更有用。它不能直接證明 AI science 已經被解決,但它至少把一件事講得很清楚:如果你要做 evidence-grounded discovery,讓系統直接看見原始證據,可能比再加一層摘要更重要。

結論

OmniScientist 的核心貢獻,不是把研究流程再自動化一次,而是把多模態原始證據重新放回 AI 科學流程裡。它從構想、實驗到寫作,都試著讓觀察先於結論。

對開發者來說,這篇的訊號很明確:如果你的 agent 要做科學判斷,感知層的重要性,可能不輸模型本身。你給它看什麼,會直接決定它能不能做出像樣的科學主張。

  • 原始多模態證據比摘要特徵更能支撐科學推理。
  • 用 deterministic pipeline 和程式檢查,可把 agent 變得更可控。
  • 在 36 個案例中,直接 perception 以 85% head-to-head judgments 勝過盲版。