[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"article-humantracker-human-aligned-motion-tracking-benchmark-zh":3,"article-related-humantracker-human-aligned-motion-tracking-benchmark-zh":29,"series-research-70584f73-54b3-4548-944b-7c596e1e3db5":73},{"id":4,"slug":5,"title":6,"content":7,"summary":8,"source":9,"source_url":10,"author":11,"image_url":12,"cover_image":12,"category":13,"language":14,"translated_content":11,"related_article_id":15,"keywords":16,"key_takeaways":22,"views":26,"created_at":27,"published_at":28,"topic_cluster_id":11},"70584f73-54b3-4548-944b-7c596e1e3db5","humantracker-human-aligned-motion-tracking-benchmark-zh","HumanTracker補上人形評測盲點","\u003Cp data-speakable=\"summary\">153 小時動作\u003Ca href=\"\u002Fnews\u002Fvdbbench-cost-benchmark-vector-databases-zh\">資料\u003C\u002Fa>與 HumanScore，讓人形追蹤評測更接近人類判斷。\u003C\u002Fp>\u003Cul>\u003Cli>\u003Cstrong>研究機構\u003C\u002Fstrong>：arXiv 摘要未明確標註\u003C\u002Fli>\u003Cli>\u003Cstrong>核心數據\u003C\u002Fstrong>：153 小時的光學動作軌跡\u003C\u002Fli>\u003Cli>\u003Cstrong>突破點\u003C\u002Fstrong>：偏好對齊評分\u003C\u002Fli>\u003C\u002Ful>\u003Cp>人形動作追蹤看起來很直覺，但評測常常不是。模型在平均姿態誤差上表現不差，畫面卻可能出現腳滑、支撐不穩、落腳時機不對等問題。HumanTracker 想補的，就是這個「數字看起來對，眼睛看起來不對」的落差。\u003C\u002Fp>\u003Cp>\u003Ca href=\"https:\u002F\u002Farxiv.org\u002Fabs\u002F2608.13555\">HumanTracker: Towards Comprehensive and Human-Aligned Motion Tracking Benchmark\u003C\u002Fa> 這篇論文的重點，不是再做一個單純的新分數，而是把評測本身重做一遍。它主張，現有的人形追蹤常用運動學指標雖然有用，但不夠完整，也不夠能壓測長時間、接觸密集的動作。\u003C\u002Fp>\u003Ch2>它要解決什麼痛點\u003C\u002Fh2>\u003Cp>這篇摘要先點出一個很實際的問題：評測對不上人類感受。人形追蹤系統可以在逐幀姿態差異上拿到不錯分數，但實際看影片時，動作仍可能顯得怪、飄、或不踏實。原因很簡單，幾何誤差只管關節位置，不管那些讓動作「像不像真的」的物理瑕疵。\u003C\u002Fp>\n\u003Cfigure class=\"my-6\">\u003Cimg src=\"https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786690974820-0s3o.png\" alt=\"HumanTracker補上人形評測盲點\" class=\"rounded-xl w-full\" loading=\"lazy\" \u002F>\u003C\u002Ffigure>\n\u003Cp>摘要特別提到兩種常見失敗：支撐不穩與接觸錯誤。白話一點，就是腳該踩穩時沒踩穩，該落地時沒落地，或是看起來像在地上滑。這些問題在數字上未必很刺眼，卻很容易被人一眼看出來。\u003C\u002Fp>\u003Cp>另一個痛點是資料規模與多樣性不足。摘要說，常見測試集太小，也不夠多樣，沒辦法充分檢驗長時間、接觸密集的動作。對開發者來說，這很要命，因為 \u003Ca href=\"\u002Ftag\u002Fbenchmark\">benchmark\u003C\u002Fa> 如果只測簡單動作，模型很可能在榜單上漂亮，落地時卻翻車。\u003C\u002Fp>\u003Ch2>HumanTracker 裡面放了什麼\u003C\u002Fh2>\u003Cp>HumanTracker 被設計成一個同時兼顧感知對齊與可擴充性的 benchmark。摘要寫得很明確：它收錄大約 153 小時的光學動作軌跡，來源是多位專業表演者。這個量級，至少在摘要裡看起來，確實比它批評的那些小型測試集更有覆蓋度。\u003C\u002Fp>\u003Cp>不過，摘要沒有提供和既有 benchmark 的直接尺寸對照，所以不能從這裡直接推論它到底大多少。能確定的是，它不是只收一點點資料來做示意，而是想把評測範圍拉大，讓接觸型與長時序動作更容易被測出問題。\u003C\u002Fp>\u003Cp>摘要還提到，資料被整理成四種 motion families，並附有文字標籤做細粒度診斷。這點很關鍵。因為它代表這個 benchmark 不只是拿來排排行榜，也能幫你看出模型到底卡在哪一類動作、哪一種失誤。\u003C\u002Fp>\u003Cp>對工程團隊來說，這種標籤層很實用。你不只想知道模型失敗了，還想知道是接觸時機、平衡、某種動作型態，還是別的因素出了問題。摘要沒有展開那四類 motion families 的名稱，所以更細的分類還得看論文本文。\u003C\u002Fp>\u003Ch2>HumanScore 怎麼運作\u003C\u002Fh2>\u003Cp>這篇的另一個重點是 HumanScore。摘要把它描述成一個「偏好對齊」的評分方式，訓練資料來自 12K 組 motion pairs，總共 24K 個 motions。白話講，不是只用幾何公式硬算分數，而是讓模型學會預測人類在兩個動作之間會偏好哪一個。\u003C\u002Fp>\n\u003Cfigure class=\"my-6\">\u003Cimg src=\"https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786690977157-sfop.png\" alt=\"HumanTracker補上人形評測盲點\" class=\"rounded-xl w-full\" loading=\"lazy\" \u002F>\u003C\u002Ffigure>\n\u003Cp>這個方向很合理，因為人看動作時，腦中不會先算每個關節差了幾度，而是直接判斷：穩不穩、自然不自然、接觸對不對、看起來像不像真的在動。HumanScore 想把這種直覺式判斷，變成可以用來評測的數值。\u003C\u002Fp>\u003Cp>但摘要沒有交代模型架構、訓練目標、標註流程，也沒有說 HumanScore 是怎麼從 pairwise preference 學出來的。所以這裡要保守一點：我們能確定它是用人類偏好資料訓練的，不代表我們已經知道它的所有實作細節。\u003C\u002Fp>\u003Cp>即便如此，方法論上的轉向已經很清楚。它不是只問「姿態差多少」，而是問「人會選哪個」。對於看重視覺品質與接觸可信度的任務，這種評測邏輯通常比單純幾何誤差更接近真實使用情境。\u003C\u002Fp>\u003Ch2>論文實際證明了什麼\u003C\u002Fh2>\u003Cp>摘要聲稱，在代表性的 state-of-the-art trackers 上，HumanScore 比傳統運動學指標更能預測人類偏好，也更能抓出接觸與穩定性失敗。這是這篇論文最核心的結果。它想證明的不是某個模型突然大幅進步，而是評測方式本身更貼近人類。\u003C\u002Fp>\u003Cp>這種結果在研究上很重要，因為它影響的是你怎麼看模型、怎麼比較模型，甚至怎麼定義「做得好」。如果評測指標和人眼感受不一致，那麼排行榜再漂亮，也可能只是把模型往錯的方向推。\u003C\u002Fp>\u003Cp>不過，摘要沒有公開完整 benchmark 數字。沒有看到百分比、絕對分數、排名變化，或是各 tracker 的具體比較表。因此，不能替它補上不存在的量化結論。比較安全的說法是：作者主張 HumanScore 與人類偏好更一致，並且能揭露傳統指標漏掉的失敗模式。\u003C\u002Fp>\u003Cp>這也代表目前能讀到的資訊，還不足以判斷提升幅度到底有多大。比如說，偏好預測準了多少、不同 motion family 是否都同樣有效、標註噪聲會不會影響結果，摘要都沒交代。這些都要等正文才能確認。\u003C\u002Fp>\u003Ch2>對開發者有什麼影響\u003C\u002Fh2>\u003Cp>如果你在做 humanoid policy、teleoperation，或 whole-body imitation，這篇論文其實是在提醒一件很常見的事：你可能在優化錯的指標。模型訓練看起來很順，loss 也下降了，但輸出的動作還是會讓人覺得卡、滑、或不可信。\u003C\u002Fp>\u003Cp>HumanTracker 的價值，在於它把評測當成產品問題來看，而不只是數學問題。它想抓的是使用者真的看得出來的錯誤，而 HumanScore 則想把這些感受變成可比較、可排序的分數。對團隊來說，這有助於更誠實地比較 tracker，也能減少對某些幾何指標的過度擬合。\u003C\u002Fp>\u003Cp>更廣一點看，這也是 embodied AI 很常遇到的矛盾：只要輸出是要給人看、給人用，評測就不能只看座標距離。這篇是把這個問題放在人形動作追蹤上講清楚，但同樣的落差，也常出現在其他\u003Ca href=\"\u002Fnews\u002Fautodesign-meta-harness-optimization-posters-zh\">生成\u003C\u002Fa>與控制任務。\u003C\u002Fp>\u003Cp>實務上，這類偏好對齊評測還有一個好處：它比較容易暴露「看起來沒差，但其實很差」的錯誤。對做系統整合的人來說，這比單純追求更低的 pose error 更接近真實需求。\u003C\u002Fp>\u003Ch2>限制與還沒回答的問題\u003C\u002Fh2>\u003Cp>摘要的方向很清楚，但細節還是留白不少。像是四種 motion families 到底怎麼定義、文字標籤怎麼標、HumanScore 的訓練與驗證流程是什麼，摘要都沒有說。\u003C\u002Fp>\u003Cp>另外，HumanScore 的使用\u003Ca href=\"\u002Fnews\u002Fzilliz-cost-aware-vdbbench-benchmark-zh\">成本\u003C\u002Fa>也還不明。摘要沒有提到它相較於傳統運動學指標是否需要額外推論、計算量多少、或在新動作風格上的穩定性如何。這些都會影響它能不能真的進到開發流程裡。\u003C\u002Fp>\u003Cp>還有一點也很重要：摘要沒有公開完整 benchmark 細節，所以我們現在只能知道它的設計方向與作者主張，還不能直接評估它在不同場景下的泛化能力。這不是缺點本身，而是目前可讀資訊的邊界。\u003C\u002Fp>\u003Cp>總結來說，HumanTracker 的價值不在於又多了一個分數，而在於它試著把人形追蹤的評測，拉回人真的會在意的地方。對做 teleoperation 或 imitation 的團隊來說，這種改動很實際：它讓你不只是在優化表格，而是在優化可信的動作。\u003C\u002Fp>\u003Cul>\u003Cli>HumanTracker 擴大了人形動作追蹤的評測覆蓋。\u003C\u002Fli>\u003Cli>HumanScore 用人類配對偏好訓練，不只看姿態幾何。\u003C\u002Fli>\u003Cli>它主要抓的是接觸與穩定性這類傳統指標常漏掉的錯誤。\u003C\u002Fli>\u003C\u002Ful>","HumanTracker 用 153 小時動作資料與 HumanScore，讓人形追蹤評測更接近人類判斷。","arxiv.org","https:\u002F\u002Farxiv.org\u002Fabs\u002F2608.13555",null,"https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786690974820-0s3o.png","research","zh","a9281570-db5d-4f07-82e5-5546cd022691",[17,18,19,20,21],"humanoid tracking","benchmark","HumanScore","motion evaluation","preference alignment",[23,24,25],"HumanTracker 把人形追蹤評測從幾何誤差拉向人類感受。","HumanScore 以 12K motion pairs 訓練，目標是更貼近人類偏好。","摘要沒有公開完整 benchmark 數字，細節仍要看正文。",1,"2026-08-14T07:02:30.412806+00:00","2026-08-14T07:02:30.4+00:00",{"tags":30,"relatedLang":32,"relatedPosts":36},[31],{"name":18,"slug":18},{"id":15,"slug":33,"title":34,"language":35},"humantracker-human-aligned-motion-tracking-benchmark-en","HumanTracker fixes humanoid motion eval blind spots","en",[37,43,49,55,61,67],{"id":38,"slug":39,"title":40,"cover_image":41,"image_url":41,"created_at":42,"category":13},"6bbeb865-a249-440c-839f-cf1763be8ab2","omni-scientist-full-stack-ai-science-zh","OmniScientist：AI 科學家先看原始證據","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786689182933-w118.png","2026-08-14T06:32:31.082995+00:00",{"id":44,"slug":45,"title":46,"cover_image":47,"image_url":47,"created_at":48,"category":13},"3a451f17-5483-4c4f-930c-3e58a97760a1","autodesign-meta-harness-optimization-posters-zh","AutoDesign：讓海報生成自己變強","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786687383071-oaq0.png","2026-08-14T06:02:26.50133+00:00",{"id":50,"slug":51,"title":52,"cover_image":53,"image_url":53,"created_at":54,"category":13},"a212bb55-ce9d-4c3e-870d-8d6cd0ff3b76","test-time-harnesses-weak-model-transfer-zh","測試時外掛讓弱模型升級","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786604574332-ails.png","2026-08-13T07:02:25.318901+00:00",{"id":56,"slug":57,"title":58,"cover_image":59,"image_url":59,"created_at":60,"category":13},"363b733e-eb27-4be3-a234-4b3044e0eb3e","dreamfly-aerial-vln-memory-planning-zh","DreamFly 讓空中 VLN 更會記、會算","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786602773313-9vlj.png","2026-08-13T06:32:23.836363+00:00",{"id":62,"slug":63,"title":64,"cover_image":65,"image_url":65,"created_at":66,"category":13},"01d1a149-5977-4846-938a-6199ae59fc70","ava-encoder-agent-native-video-representation-zh","AVA-Encoder 把影片變知識圖譜","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786600969140-3p0h.png","2026-08-13T06:02:21.397513+00:00",{"id":68,"slug":69,"title":70,"cover_image":71,"image_url":71,"created_at":72,"category":13},"2aa54cfd-2caf-4c34-834c-e771e1308747","sparse-autoencoders-set-level-instability-zh","SAE 不是特徵袋","https:\u002F\u002Fxxdpdyhzhpamafnrdkyq.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fcovers\u002Finline-1786518181678-0ycl.png","2026-08-12T07:02:31.647391+00:00",[74,79,84,89,94,99,104,109,114,119],{"id":75,"slug":76,"title":77,"created_at":78},"f18dbadb-8c59-4723-84a4-6ad22746c77a","deepmind-bets-on-continuous-learning-ai-2026-zh","DeepMind 押注 2026 連續學習 AI","2026-03-26T08:16:02.367355+00:00",{"id":80,"slug":81,"title":82,"created_at":83},"f4a106cb-02a6-4508-8f39-9720a0a93cee","ml-papers-of-the-week-github-research-desk-zh","每週 ML 論文清單，為何紅到 GitHub","2026-03-27T01:11:39.284175+00:00",{"id":85,"slug":86,"title":87,"created_at":88},"c4f807ca-4e5f-47f1-a48c-961cf3fc44dc","ai-ml-conferences-to-watch-in-2026-zh","2026 AI 研討會投稿時程整理","2026-03-27T01:51:53.874432+00:00",{"id":90,"slug":91,"title":92,"created_at":93},"cf046742-efb2-4753-aef9-caed5da5e32e","adaptive-block-scaled-data-types-zh","IF4：神經網路量化的聰明選擇","2026-03-31T06:00:36.990273+00:00",{"id":95,"slug":96,"title":97,"created_at":98},"53a0dc54-0371-4e40-8d5e-74e94a73840c","geometry-aware-similarity-metrics-for-neural-representations-zh","超越距離測量：用微分幾何重新理解神經網路","2026-03-31T06:01:01.241968+00:00",{"id":100,"slug":101,"title":102,"created_at":103},"fee7d472-a775-4b1d-bbc2-1e8bca1bbf8b","on-the-fly-repulsion-in-the-contextual-space-for-rich-divers-zh","讓AI繪圖更有創意：用排斥力提升生成多樣性","2026-03-31T06:01:25.439673+00:00",{"id":105,"slug":106,"title":107,"created_at":108},"a9901203-d69b-447b-8854-15d14eab32b4","vision-aided-beam-prediction-cnn-eca-zh","影像輔助波束預測升級 CNN","2026-04-01T10:00:25.8073+00:00",{"id":110,"slug":111,"title":112,"created_at":113},"b55e7dd4-0a24-4b3d-804d-b0309a03f498","triple-band-fss-mimo-antenna-sub-6-ghz-zh","三頻 FSS MIMO 天線瞄準 sub-6 GHz","2026-04-01T13:18:36.857305+00:00",{"id":115,"slug":116,"title":117,"created_at":118},"f68290bd-e7f3-4b30-ba22-dcd4e0130a66","openclaw-1299-repos-eight-weeks-analysis-zh","OpenClaw 1299 個 Repo 的資料解讀","2026-04-02T05:03:45.208411+00:00",{"id":120,"slug":121,"title":122,"created_at":123},"ed9f80eb-eb02-4d35-8ad4-0ddf428751dd","beam-coherence-aware-combining-mmwave-mimo-zh","毫米波 MIMO 的雙階合併法","2026-04-02T05:27:26.897188+00:00"]