前往中央內容區塊 :::
:::

歷史雜誌

購物提醒:當您要離開或跳轉頁面時,請先將您想要購買的文章加入購物車,以便快速紀錄完成購買流程!

無地圖導航:以局部觀測實現不需顯式全域地 圖之機器人導航

作者 Bolivar Enrique Solarte Pardo

刊登日期:2026/08/01

摘要

本文提出「無地圖導航」 (Map-free Navigation),作為一種新穎的機器人導航方法,旨在使機器人 於推論階段無需依賴預先建立的全域幾何地圖或語意地圖即可執行導航任務。不同於傳統方法通常需要事 先建構並存取全域地圖,本研究將導航問題分解為兩個互補的推理與控制系統。第一個系統為高階場景 條件式推理 (High-Level Scene-Conditioned Reasoning),其根據機器人的當前觀測與任務情境,推估機器人 可能所在的位置,並解析目標相對於機器人目前位置的空間關係。第二個系統為低階推理模組 (Low-level Reasoning Module),其根據局部感測量測與相對目標,產生機器人執行導航所需的控制指令。高階推理系 統採用經微調的大型視覺語言模型 (Large Vision-Language Model, LVLM) 實作。該模型被訓練為在給定輸 入觀測時估計最可能的機器人位置,並在給定輸入情境提示時推估相對目標。透過此設計,本文將場景 理解、位置推理與目標解析整合於同一高階推理架構中,以支援不依賴明確全域地圖的導航決策。針對 低階控制,本研究評估兩種局部導航實作方式:(1) 基於 PPO 的策略[11],其根據局部 RGB-D 觀測與相 對目標預測速度控制指令;以及 (2) 基於 Nav2 的局部導航模組[12],其使用局部量測進行短視距導航與 障礙物避讓。實驗結果顯示,在工研院 22 館的真實場景中,無地圖導航可達到約 86.6% 的 Recall@ 0.5m, 並在推論階段避免存取明確的全域幾何地圖或語意地圖。

Abstract

We introduce Map-free Navigation as a novel approach to robot navigation that does not require a predefined global map during inference time. Instead, it decomposes the navigation task into two complementary systems: (i) High-Level Scene-Conditioned Reasoning, which interprets the target goal relative to the robot’s current position, and (ii) Low-level Reasoning Module, which estimates robot commands based on local sensor measurements. The high-level reasoning system is implemented using a Large Vision-Language Model (LVLM) fine-tuned to estimate both the most probable robot location given an input observation and the relative target goal given an input context prompt. For low-level control, we evaluate two local navigation implementations: (1) a Proximal Policy Optimization (PPO-based policy) [11] trained to predict velocity commands from local RGB-D observations and a relative goal, and (2) a Nav2-based local navigation module [12] that uses local measurements for short-horizon obstacle avoidance. Our results show that Map-free Navigation achieves approximately 86.6% Recall @ 0.5m in a real-world setting of the ITRI Building 22, while avoiding explicit global geometric or semantic map access during inference.

前言

近年來,移動式機器人與人形機器人技術的進展,使大眾對語意機器人導航系統的興趣逐漸提升。此類系統要求具身智能體能夠將高階語言請求轉換為物理環境中具有空間依據的運動[1][2][3][5][6][7]。在這類情境中,使用者可能要求機器人前往廚房、會議室或其他語意區域,而不會明確指定度量座標、路徑或低階控制指令。

多數實際導航系統透過依賴明確的全域幾何地圖或語意地圖來解決此類歧義,並以此支援定位、規劃與控制[12]-[14]。雖然此設計有效,但也帶來顯著的部署負擔:地圖必須被蒐集、儲存、更新,並隨著環境變化持續保持一致[13][15][16]。在大型或動態空間中,此負擔更加嚴重,因為場景佈局變化、暫時性障礙物以及密集人流,皆使可靠的幾何與語意資訊更難維護。這引出一個核心問題:機器人是否能在推論階段不存取明確全域幾何地圖或語意地圖的情況下,導航至語意目標?

移除明確的全域幾何與語意表徵會使機器人導航變得更加困難,因為這些表徵通常同時提供三類資訊:機器人的當前位置、語意目標的位置,以及連接兩者的空間結構。在推論階段缺乏此類明確全域資訊時,僅能觀測鄰近幾何的局部導航器無法可靠地決定移動方向,尤其當請求的語意目標位於機器人當前視野之外時更是如此。這造成場景特定的空間歧義:廚房、會議室或大廳等語意區域,在不同場景布局中會位於不同位置,因此其相對方向無法僅由局部幾何推斷。本文主張,與其在推論階段查詢明確的全域地圖,不如使場景條件式大型視覺語言模型(Large Vision-Language Model,LVLM)內化這些場景特定的目標位置先驗,並利用其估計機器人導航所需的相對目標方向。

近期研究顯示,視覺語言模型與多模態基礎模型能為機器人導航、空間推理以及語言接地式決策提供有用的高階線索[3][5][6][7]。例如,LM-Nav 結合預訓練語言模型、視覺語言模型與導航模型,將自然語言指令解析為基於地標的導航目標,並將這些地標對應至視覺觀測中[3]。NavGPT 進一步顯示,大型語言模型能夠根據文字化場景觀測、導航歷史與候選方向,執行明確的高階導航推理[5]。較新的 LVLM-based 系統則延伸此方向,利用多模態觀測支援具身導航中的路徑點選擇、動作預測與場景層級推理[6][7]。這些研究顯示,大型語言模型與視覺語言模型蘊含有助於連結語言、感知與空間決策的先驗。然而,這些方法尚未直接探討場景條件式 LVLM 是否能內化特定環境中的目標位置先驗,並在推論期間不查詢明確全域地圖的情況下,用以預測相對目標方向。

DOI:10.30256/JIM.202608_(521).0010

「如欲訂購單篇,請至 「華藝線上圖書館」

更完整的內容歡迎訂購 2026年08月號 (單篇費用:參考材化所定價)

3篇450元

NT$450
訂閱送出

10篇1200元

NT$1,200
訂閱送出