多模態感知技術

產出年度

2026

現況描述

本技術整合影像、LiDAR、IMU、室內定位與場域資訊,搭配多模態/視覺語言模型及雲地協作語言模型,進行情境語意萃取、人物與物件辨識、空間關係與環境風險理解。已規劃即時影像、圖像、文字及語音 Prompt 整合,並結合空間定位與 AI 預測方法,支援具身代理人在醫療、照護等場域的環境理解與導航決策前置感知。

可應用範圍

智慧醫療、智慧照護、AMR、智慧輪椅、服務型機器人、室內物流與導引

所需軟硬體設備

具 GPU 之邊緣 IPC/伺服器、攝影機或 RGB-D Camera、LiDAR、IMU、室內定位設備、ROS2 載具

需具備專業人才

電腦視覺、多模態/VLM、機器人感知、定位與感測融合工程人才

聯絡資訊

人工智慧研究院

廖憲正

(02)66073196

hcliao@iii.org.tw