單 RGB 相機也能帶機器人走路
Mistral AI 的 Robostral Navigate 用單一 RGB 相機、8B 模型與模擬訓練,在 R2R-CE unseen validation 拿到 76.6%,把導航硬體需求壓得很低。

Mistral AI 的 Robostral Navigate 用單一 RGB 相機帶機器人走路,還在 R2R-CE unseen validation 拿到 76.6%。
Mistral AI 這次丟出的不是一般 demo。它把導航問題縮成一個很狠的命題:只靠一顆 RGB 相機,能不能讓機器人看懂指令、找路、轉彎、停下來。
答案目前看起來是可以,而且分數不差。這套 Robostral Navigate 是 8B 模型,在 R2R-CE 的 unseen validation 拿到 76.6%,還說自己比最佳單相機方案高 9.7 分,比最佳深度或多相機方案高 4.5 分。
更狠的是,它整套訓練都在模擬環境完成。資料量大約 240 萬條軌跡,涵蓋 35 萬個場景,還用 prefix-caching 把訓練 token 壓到原本的一小部分。這種做法很有 Mistral 風格,簡單、直接、很會算帳。
| 指標 | Robostral Navigate | 意義 |
|---|---|---|
| 模型大小 | 8B | 夠大,才有空間學導航策略 |
| R2R-CE unseen validation | 76.6% | 看泛化能力,不是只背地圖 |
| R2R-CE seen validation | 79.4% | 熟悉環境也能維持高成功率 |
| 訓練軌跡 | 約 240 萬條 | 資料量夠大,才容易學到穩定行為 |
| 場景數 | 35 萬 | 場景變化多,轉移到新空間比較有機會 |
| Token 減量 | 22× | 訓練效率直接拉高 |
| RL 增益 | +3.2% | 線上強化學習還能再補一刀 |
一顆相機,真的夠用嗎
訂閱 AI 趨勢週報
每週精選模型發布、工具應用與深度分析,直送信箱。不定期,不騷擾。
不會寄垃圾信,隨時可取消。
Robostral Navigate 的核心很直白。機器人收到自然語言指令,像是走出大廳、穿過走廊、進入倉庫,再停在第二排貨架前。接著它只看一張 RGB 影像,就要決定下一步怎麼走。

這件事之所以有意思,是因為多數機器人系統都很愛堆硬體。深度相機、LiDAR、多鏡頭陣列,確實能幫感知,但也會把成本、校正、故障點一起拉高。對很多公司來說,硬體不是越多越好,而是越少越好管。
Mistral 的想法很像在說,模型夠強時,感知不一定要靠一整套昂貴感測器。只要資料夠多、訓練方式夠聰明,單相機也能做出不錯的導航策略。這對想做商用機器人的團隊很有吸引力,因為 BOM 和維護成本都會比較好看。
- 輸入:一張 RGB 影像加上文字指令
- 輸出:下一個移動目標與朝向
- 硬體:沒有深度相機、LiDAR、多相機陣列
- 適用平台:輪式、足式、飛行平台
它還用了 point-based 的導航方法。簡單講,模型常常不是先想「我要走幾公尺」,而是先在畫面裡點出目標位置,再決定到達時要面向哪裡。這種設計對相機內參和世界尺度比較不敏感,跨機器、跨場景時比較不容易整個歪掉。
如果目標不在視野內,它就退回到局部位移策略,例如往前、往左、轉向。這種混合做法很務實,也比較像真實機器人會遇到的情境。現場不是乾淨的研究室,常常只有半個門框、半條走廊、還有一堆擋路的椅子。
模擬訓練才是這次的重點
Robostral Navigate 不是靠現成開源模型拼出來的。Mistral 說它先從一個已經懂 grounding 的 vision-language 系統出發,再把能力往導航方向延伸。這條路很合理,因為模型既然已經知道畫面裡東西在哪,下一步就是學怎麼往那裡移動。
資料管線也全部在模擬環境裡做。這很重要,因為真實機器人資料又貴又慢,還容易因為場地不同、鏡頭裝法不同、地面材質不同而變得很亂。模擬環境雖然不完美,但至少能讓團隊快速迭代,先把策略學起來。
“Navigation emerges as a natural extension of these capabilities: once it understands where things are, it learns how to move.”
— Mistral AI research team,Robostral Navigate
真正有意思的是訓練效率。Mistral 用 prefix-caching 搭配 tree-based attention masking,把整個 episode 壓成一個序列來訓練。白話一點,就是它一次把一整段導航過程塞進模型,卻又不讓未來資訊偷跑到前面。
這招讓訓練 token 比傳統 one-sample-per-time-step 方式少了 22 倍。這不是小修小補,這是直接改變團隊怎麼做實驗的節奏。原本可能要跑好幾個月的訓練,現在可以壓到幾天,試錯速度差很多。
- 訓練資料:約 240 萬條軌跡
- 場景數:35 萬個模擬場景
- 監督訓練:把整個 episode 壓成單一序列
- 線上 RL:CISPO 再加 3.2% 成功率
76.6% 代表什麼
76.6% 這個數字本身很漂亮,但重點是它出現在 unseen validation。這代表模型不是只會背已看過的環境,而是能在沒見過的空間裡做出不錯的導航決策。這種泛化能力,才是機器人能不能上線的核心。

Mistral 還把自己跟不同感測器配置的系統比。它說自己比最佳單相機方案高 9.7 分,也比最佳深度或多相機方案高 4.5 分。這個差距不小,因為後者通常在感知上比較有優勢,結果還是被單相機模型追上甚至超過。
R2R-CE 本來就是一個很適合看這件事的 benchmark。它測的是 Room-to-Room in Continuous Environments,重點是機器人能不能在連續空間裡聽懂指令並走到目的地。這不是死記路線,而是看它能不能在新辦公室、新走廊、新房間裡不迷路。
- Seen validation:79.4%
- Unseen validation:76.6%
- 最佳單相機方案差距:+9.7 分
- 最佳深度或多相機方案差距:+4.5 分
這組數字透露一件事。Robostral Navigate 不是只在壓縮硬體成本,它是真的在補感知缺口。若這種表現能從模擬穩定轉到真實場域,很多團隊可能會重新算一次感測器帳單。
對機器人團隊的實際意義
如果你在做辦公室配送、倉儲搬運、飯店服務、醫院巡檢,這種單相機導航模型很有吸引力。少一套感測器,代表少一些校正、少一些線材、少一些故障點。部署時也比較容易把同一套軟體搬到不同機器人上。
這件事對台灣團隊也很有感。很多機器人專案卡住,不是卡在模型分數,而是卡在整合。感測器一多,測試成本、維修成本、現場調參時間都會膨脹。能把硬體收斂到一顆 RGB 相機,對產品化很有幫助。
但這種路線也有代價。單相機在低光、反光、遮擋、鏡頭髒污時,風險一定比較高。換句話說,Robostral Navigate 比較像是在告訴大家,導航不一定非得靠滿身感測器;只是你要先接受模型本身得夠強,訓練資料也得夠紮實。
- 優點:硬體成本低、整合簡單、維護容易
- 風險:低光、遮擋、視角偏差會放大誤差
- 適合場景:室內配送、導覽、巡檢、倉儲
- 產品價值:更容易跨不同機器人平台移植
我覺得這裡最值得注意的是,它把導航當成視覺語言模型的延伸,而不是獨立的老派機器人模組。這種做法比較接近現在 LLM 的思路:先理解,再行動,再用回饋修正。對做產品的人來說,這種架構通常比較容易持續迭代。
這波其實是 AI 進機器人流程的縮影
Robostral Navigate 還有一個背景意義。它代表機器人研究正在慢慢從「很多模組各做各的」走向「一個模型管更多事」。以前是感知、地圖、規劃、控制各自拆開,現在則越來越多人想把這些能力壓進同一個模型裡。
這跟近年的 AI 發展很像。文字模型先把語言理解和生成整合起來,接著又往工具使用、程式碼、推理延伸。現在輪到機器人領域。只要模型能看、能聽、能動,很多傳統流程就會被重新整理。
當然,模擬和真實世界還是兩回事。真實建築裡有玻璃門、反光地板、臨時堆放的紙箱、還有根本沒出現在訓練資料裡的怪角度。這些東西不會因為 benchmark 漂亮就消失,所以最後還是要看實機表現。
目前比較務實的判斷是:這類模型會先進入受控環境,再慢慢往半開放場域推進。最先吃到紅利的,可能不是最複雜的機器人,而是那些只要在固定室內空間走路、找點、停靠的系統。
接下來該看什麼
如果 Mistral 真的要把這條線做下去,下一步就不是再多一點 benchmark 分數,而是看它能不能在真實建築裡穩定工作。最好是有玻璃、窄走廊、逆光、擁擠人流,還有各種很煩的邊角情況。
我會特別觀察三件事。第一,單相機方案在真實場域的成功率掉多少。第二,模型能不能在不同機器人底盤上維持表現。第三,推論成本能不能壓到商用可接受的範圍。這三個答案,比再加 1 分更重要。
如果你是做軟體或機器人產品的人,現在就可以開始問自己一個很實際的問題:你的導航系統,真的需要那一整套感測器嗎。很多時候,答案可能比想像中更保守,也更貴。