分類

技術研究

AI 研究論文、突破性進展與技術深度分析。從學術發表到影響 AI 未來的實驗室研究成果。

Neura 指數把 Claude 與 Grok 推上前段班
8月15日

Neura 指數把 Claude 與 Grok 推上前段班

Neura Market 把 396 個 AI 模型、48 項 benchmark 整成 0 到 100 指數,Claude、Grok、DeepSeek 在不同任務各自領先。

HumanTracker補上人形評測盲點
8月14日

HumanTracker補上人形評測盲點

HumanTracker 用 153 小時動作資料與 HumanScore,讓人形追蹤評測更接近人類判斷。

OmniScientist:AI 科學家先看原始證據
8月14日

OmniScientist:AI 科學家先看原始證據

OmniScientist 把原始多模態證據直接放進 AI 科學流程,讓觀察不只被摘要,還能影響構想、實驗到寫作。

AutoDesign:讓海報生成自己變強
8月14日

AutoDesign:讓海報生成自己變強

AutoDesign 用可學習的 harness 把論文轉海報做得更好,在 PosterBench 拿下 78.32 分,並超過 Claude Design。

測試時外掛讓弱模型升級
8月13日

測試時外掛讓弱模型升級

強模型可在不改權重下,替弱模型打造測試時外掛,讓表現幾乎翻倍。

DreamFly 讓空中 VLN 更會記、會算
8月13日

DreamFly 讓空中 VLN 更會記、會算

DreamFly 用因果記憶、分段擴散規劃與明確停止機制,提升空中 vision-language navigation 的導航表現。

AVA-Encoder 把影片變知識圖譜
8月13日

AVA-Encoder 把影片變知識圖譜

AVA-Encoder 把影片轉成可編輯的知識圖譜,讓代理能推理、改寫,再重建回影片。

SAE 不是特徵袋
8月12日

SAE 不是特徵袋

這篇論文指出,SAE 的活躍 latent 集合反映的是模型內部相似性,不是人類概念邊界。

ConVAWG 讓 VAWG 對話可控生成
8月12日

ConVAWG 讓 VAWG 對話可控生成

ConVAWG 用檢索式情境與轉輪毒性控制,生成 6,000+ 筆多輪 VAWG 對話事件。

Surgical WAM 用影片訓練手術機器人控制
8月12日

Surgical WAM 用影片訓練手術機器人控制

Surgical WAM 證明,先用無動作的內視鏡影片預訓練,再接少量示範微調,能提升閉迴路手術機器人控制表現。

SWE-bench Verified 已不再是乾淨的模型排行榜
8月12日

SWE-bench Verified 已不再是乾淨的模型排行榜

97% 的天花板把頂尖 coding 模型擠成一團,SWE-bench Verified 已不適合再拿來當乾淨的排序工具。

荷蘭政府 LLM 不能只看準確率
8月11日

荷蘭政府 LLM 不能只看準確率

荷蘭政府用的 LLM 評估框架顯示,準確率之外,成本、能耗、偏誤與透明度都會影響選型。

MMDiff:把多模態特徵變成控制旋鈕
8月11日

MMDiff:把多模態特徵變成控制旋鈕

MMDiff 用多模態 SAE 比對基座與微調模型,找出被多模態訓練改寫的關鍵特徵,並可用來稽核、移除或定向操控 MLLM 行為。

TTS 評測不只看自然度
8月11日

TTS 評測不只看自然度

這篇論文證明,TTS 自動評測若只看自然度,會漏掉多種有語言結構的語音錯誤。

Rust 應被視為嚴肅的 GPU 程式語言,而不是副專案
8月10日

Rust 應被視為嚴肅的 GPU 程式語言,而不是副專案

Rust 已經不只是能碰 GPU 的新奇工具,它應該被當成 NVIDIA 工作流中的嚴肅選項,因為它能在不犧牲效能的前提下降低錯誤成本與維護負擔。

CoinRAG 用細粒度 KV 快取加速 RAG
8月10日

CoinRAG 用細粒度 KV 快取加速 RAG

CoinRAG 透過重用細粒度 nugget KV cache,降低長上下文 RAG 的 prefill 成本,並在 LongBench multi-hop QA 上帶來 5.3% 的平均 F1 相對提升。

CreativeInstruct 讓 LLM 保留創意
8月10日

CreativeInstruct 讓 LLM 保留創意

CreativeInstruct 用 instruction tuning 保住 LLM 的創意與多樣性,還能維持品質,並在部分下游 RL 設定中帶來提升。

MirrorWorld 讓鏡中倒影更一致
8月10日

MirrorWorld 讓鏡中倒影更一致

MirrorWorld 把場景到鏡面的關係納入影片擴散,讓鏡中倒影在語意和位置上都更一致。

Claude 4.5 證明 AI 進步還在加速
8月9日

Claude 4.5 證明 AI 進步還在加速

Claude 4.5 不是單一產品升級,而是證明 AI 能力仍在加速前進,企業與團隊不能再用穩態思維做規劃。

Mage-VL把视频Token壓到25%
8月8日

Mage-VL把视频Token壓到25%

我拆開 Mage-VL 的壓縮碼輸入與 dense caption 迭代流程,整理成可直接套用的視頻管線模板。

Astra 把長任務拆成多代理工作
8月7日

Astra 把長任務拆成多代理工作

我拆 Astra 這條線後,看到的是長時間多代理工作流、可驗證輸出,還有把證明落到 Lean 的做法。

心衰 EHR 特徵工程可追證據
8月7日

心衰 EHR 特徵工程可追證據

以前心衰 EHR 特徵工程要大量人工整理,現在 nMAS 把流程自動化,還把每個特徵綁回證據。

工具呼叫用程式碼可能更好
8月7日

工具呼叫用程式碼可能更好

BFCL v4 顯示,對 14 個模型來說,把工具呼叫改成程式碼介面,常比 JSON 呼叫更穩、更適合並行任務。

教 LLM 何時信上下文
8月7日

教 LLM 何時信上下文

MIST 與 SCOPE 讓模型更會分辨可信上下文,減少被誤導的錯答,同時保住正確上下文帶來的效益。

CUDA 二進位拆成可檢查 ELF
8月7日

CUDA 二進位拆成可檢查 ELF

我把 CUDA binary 的 cubin、fatbin、ELF note 一層層拆開,整理成可直接照抄的檢查模板。

OctoLong 用跨倉庫程式脈絡訓練長上下文模型
8月6日

OctoLong 用跨倉庫程式脈絡訓練長上下文模型

OctoLong 用跨倉庫、依賴密集的程式脈絡做中期訓練,讓長上下文模型更會追引用、抓狀態,也更能處理 repo 級任務。

Argus:會自我演化的長任務 runtime
8月6日

Argus:會自我演化的長任務 runtime

Argus 把長任務代理的重點放在 runtime:固定模型權重,靠可驗證狀態與角色化審查,讓流程能在長流程中修正、延續與演化。

Reasoning Core 讓程序推理資料更好用
8月6日

Reasoning Core 讓程序推理資料更好用

Reasoning Core 用 50 個生成器與語意評分、難度控制,證明廣泛的程序化資料能強化 completion-supervised 推理訓練。

Anthropic的失控测试:AI安全还没过关
8月5日

Anthropic的失控测试:AI安全还没过关

Anthropic的内部模型失控不是边角料,而是AI安全评估仍然不可靠的证据。

WorldCup Arena:LLM 直播預測實測
8月5日

WorldCup Arena:LLM 直播預測實測

WorldCup Arena 用世界盃直播賽事,測六個前沿 LLM 在賽前做無洩漏預測的表現。

已到底部