DIGITIMES

什麼是SLAM? Physical AI的第一步,是知道自己在哪裡

徐宏民
2026-09-09
AI語音摘要
00:41

上一篇談到自動化與自主性的差別,自動化把不確定性從環境裡移除,自主性需要系統在複雜環境中運作,兩者最大的差異,是自主機器人得走進沒有事先整理過的環境中完成工作,機器得知道自己在哪裡、周圍環境狀況,還要在執行任務的同時,安全、有效率地在場域中行動。

背後的關鍵技術,是SLAM(Simultaneous Localization and Mapping),機器要一邊定位,一邊把環境畫成地圖。

自駕產業是最早把高精地圖變成關鍵元件的產業之一。許多無人計程車進入一個新城市時,第一件事仍是先完成街道測繪,建立地區(高精)地圖後才開始營運。

地圖要多精細是一個成本問題。車輛定位,可以只保留道路曲率、車道線、路標、號誌或路緣等少數穩定特徵,讓車輛拿眼前看到的特徵與地圖對位;也可以更細緻地把車道線、路緣、號誌、與街景都定位到公分級。愈精細,定位愈準,維護成本也愈高。量產車開發實務中,圖的更新頻率是關鍵,而施工、標線重畫、號誌調整甚至車禍隨時在發生,地圖一舊反而會引發自駕導航風險。

另外是誰來更新。早期地圖靠專用測繪車(配備昂貴定位設備),一條路一條路測繪,巷弄密集更費時,更新頻率決定新鮮度,成本與涵蓋範圍、頻率成正比。後來導入分散式(crowd-sourcing)的做法,讓已經在路上跑的量產車順手做,行駛中回傳道路特徵,每台車每公里約幾KB,1年約幾百MB,後端把眾多車輛的訊息融合拼出道路結構。車愈多掃過,地圖品質愈好。

那機器人呢?如何定位,如何動態建圖,還有哪些全新應用?

問題是,要定位,得先有圖;要畫圖,又得先知道自己在哪裡(而且室內不能用衛星訊號定位)。兩件事互相依賴,像是雞生蛋、蛋生雞。SLAM針對這個問題,同時估算兩者,邊走邊修,這個概念1980年代後期提出,1990年代中期定名,到現在40年。

機器先從連續的畫面或點雲估算自己移動了多少,這一步的誤差會累積,走得愈遠偏得愈多。所以還要能認出「我回到剛才來過的地方」,一旦認出來,累積的偏差就能一次修正,再把沿路所有位置和觀測一起重新最佳化,讓前面累積的誤差重新分配;在視覺SLAM裡,常見的做法就是bundle adjustment。重新開機或搬移之後,機器還得在既有地圖裡重新定位。這幾件事分別叫做里程計(odometry)、迴路閉合(loop closure)與重定位(relocalization),要長時間、大範圍運作,通常得三者一起解決。

要多準,感測器的訊號也扮演關鍵角色。光達直接量到距離,幾何結構最明確,定位通常也較容易;相機便宜且資訊豐富,但深度需要額外估計。深度相機每個畫素都有距離,有效範圍卻多半在幾公尺內,室外也容易受光線干擾。實際的系統幾乎都是混用,再補上輪速。

高度是另一個長期被忽略的問題。早期室內SLAM常見的做法,是把環境簡化成一張二維地圖,只記錄同一個平面上有沒有障礙物,當成整個空間能不能走的依據,對輪式機器人夠用,因為它只在同一個樓層的地面上移動。當機器人的移動自由度開展,上坡、跨門檻、爬樓梯、完成抓取任務之後,這個假設就不管用了,能不能踩、碰撞,都得從立體結構判斷。地圖因此得從二維變成3D,感測器與運算也跟著加重,避障也得算進高度,畢竟真實環境不是乾淨、規整的,桌面上有杯子,地上散落著鞋子。

更大的變化是地圖的表示方式正在改變。傳統SLAM多半記錄稀疏特徵或幾何結構,神經輻射場(NeRF)與3D Gaussian Splatting(3DGS)等新的場景表示方法,則讓機器開始保存更完整的3D外觀與空間資訊;與SLAM結合後,一般相機也能在移動過程中逐步建立細緻的3D場景。我們在2023年就用單眼相機做過這件事,而且不必為每個場景預先訓練。

新一代SLAM紀錄下的,不再只是2D照片或沒有空間結構的視訊,而是數位化的3D環境。密集的3D圖有很多非常有潛力的運用,特別是加上推理能力,但這些運算多半得放在機器人身上完成,邊緣端的算力與儲存還是限制,例如工地或產線的進度比對、資產盤點與異常偵測、生成訓練資料,或是產生數位分身。因此,Physical AI時代重新看SLAM,重點已經不只是「怎麼把圖畫準」,而是「怎麼把真實世界變成AI可以持續讀取、更新與推理的空間記憶」,這是下一篇要談的重點。

圖建好了,然後呢?傳統SLAM的任務到這裡差不多就完成,地圖交給路徑規劃,機器人照著走。對Physical AI來說,這才是開始。導航、記憶,以及推理等各種自主效能力,都要從這張圖長出來。

國立台灣大學資訊工程學系教授,曾任鴻海集團與Stellantis合資車用科技公司技術長暨副總經理,推動ADAS及智慧座艙系統產品進入全球車用市場。紐約哥倫比亞大學電機博士,專精於機器學習、電腦視覺、自駕車、機器人等領域。為訊連科技研發團隊創始成員,慧景科技(thingnario)共同創辦人,NVIDIA AI Lab計畫主持人;曾任IBM華生研究中心及美國微軟研究院客座研究員。擔任多家科技公司AI策略顧問,習慣從學術與產業雙重視角檢驗技術發展的機會與挑戰。
智慧應用 影音