前往中央內容區塊 :::
:::

歷史雜誌

購物提醒:當您要離開或跳轉頁面時,請先將您想要購買的文章加入購物車,以便快速紀錄完成購買流程!

市場前線|整合熱影像指向鎖定與輕量化語意映射之邊緣 服務機器人控制架構

作者 林子揚蕭哲安

刊登日期:2026/08/01

摘要

隨著具身智能技術發展,服務機器人被期待能在真實環境中與人類進行互動。然而,傳統家電仰 賴硬編碼缺乏適應力,雲端運算亦有延遲及隱私疑慮。本文提出部署於地端設備之多模態功能型服務機 器人控制架構,以智慧語音風扇為載體進行驗證。本機器人具備三項能力:(1) 語音互動能力:整合大型 語言模型及零樣本語意映射;(2) 無光環境感知能力:以紅外線熱像儀結合雙層人體偵測,於無可見光條 件實現人體追蹤;(3) 指向鎖定能力:針對非步進馬達缺乏角度回授之瓶頸,設計遲滯控制迴路與漂移校正。 實驗結果顯示,語意映射正確率逾88%、推理延遲在500 ms 以內、移動追蹤誤差顯著降低,為地端物理 AI 應用提供實務參考。

Abstract

As Embodied AI advances, service robots are expected to interact naturally and precisely with humans in real physical environments. However, conventional smart appliances still rely on hard-coded command sets, lacking adaptability to colloquial user intents, while cloud-based solutions introduce communication latency and privacy risks. This article presents a control architecture for edge service robots that integrates thermal imaging orientation locking and lightweight semantic mapping, validated through an intelligent voice-controlled fan platform. The robot features three core capabilities: (1) Voice interaction: integrating a lightweight LLM for zero-shot semantic mapping, enabling the robot to comprehend colloquial commands and provide spoken feedback in a closed-loop interaction; (2) Zero-visible-light perception: employing an infrared thermal imager with a dual-layer human detection algorithm for human localization and dynamic tracking in complete darkness; (3) Orientation locking: addressing the control bottleneck of non-stepper motors lacking angular feedback through a dynamic hysteresis control loop and drift correction mechanism. Experimental results demonstrate 88% semantic mapping accuracy, inference latency improved to 450-500 ms, and improved IR tracking efficiency with 23% error reduction in fast-movement scenarios, providing a practical system architecture reference for local Physical AI applications.

前言

具身智能(Embodied AI)技術的發展已成為智慧型機器人研究的核心焦點。要實現機器人在複雜環境下與人類自然且精準的互動,系統必須具備自然語言處理能力、語意與語境理解、環境感知及致動功能等多面向能力以應對挑戰[1][2][3]。

傳統的控制方法多採用預先規劃的硬編碼指令集,在面對非結構化的環境或多變的使用者要求時就顯得僵化。現有功能型服務機器人面臨三項關鍵挑戰。語音交互層面,現有智慧家電透過關鍵字匹配實現語音功能,無法理解含糊口語表述、人機互動僵化;環境感知層面,傳統可見光攝影機在低光源或無光環境下效能大幅下降,且在私密場域中做影像擷取會引發隱私疑慮、缺乏隱私與全天候運作的方案;致動控制層面,消費級服務載具採用非步進馬達,此類致動器僅具啟停控制,缺乏角度回授與精密定位機構,傳統控制或開迴路指令易因物理慣性產生震盪,難以實現指向鎖定(Orientation Locking),而目前困難在於如何進一步優化語意推理層與控制層。

基於上述挑戰,本文提出並優化了一套整合熱影像指向鎖定與輕量化語意映射之邊緣服務機器人控制架構。本系統以特定功能型服務機器人為定位,整合三項核心能力:(1)導入大型語言模型實現語意推理,透過零樣本語意映射控制搭配語音合成建構語音互動體驗;(2)採用紅外線熱像儀,結合人體偵測演算法,在保護隱私前提下實現無光環境之追蹤;(3)對於非步進馬達之機構,設計動態遲滯策略與漂移校正之指向鎖定控制迴路策略。所有運算皆於地端完成,兼顧功能性與資訊安全。

系統架構與語音互動子系統

本研究提出之控制系統旨在提升人機互動體驗。系統由硬體感知-致動層與感知-決策-控制架構組成,系統皆部署於地端邊緣設備,不採用雲端推理模式,避免資料意外洩露、達成高標準資安條件。

一、硬體平台與機器人構型

實驗平台硬體為智慧語音風扇應用載體,系統由運算中樞、視覺感知模組、聽覺交互模組與致動載具四部分組成。

二、運算中樞

使用樹梅派 5 作為微型邊緣運算電腦作為中央控制樞紐,搭載四核心 ARM Cortex-A76 處理器、8 GB LPDDR4X 記憶體及金士頓 128 GB SD 卡儲存裝置,負責承載感知推理與控制決策運算[4]。

DOI:10.30256/JIM.202608_(521).0013

「如欲訂購單篇,請至 「華藝線上圖書館」

更完整的內容歡迎訂購 2026年08月號 (單篇費用:參考材化所定價)

3篇450元

NT$450
訂閱送出

10篇1200元

NT$1,200
訂閱送出