文/林裕洋 本刊特約記者 圖/Shutterstock
自ChatGPT問世以來,生成式AI已在多個領域展現出強大的語言理解、內容生成與推理能力,並催生出各類AI Agent應用。現今全球科技產業正將目光投向下一個發展階段,讓AI具備理解物理環境、操作設備與自主行動的能力,即近年快速崛起的「Physical AI(實體人工智慧)」。
相較於AI聊天機器人、AI Agent等均在資訊系統中運作,Physical AI則試圖讓AI進一步理解現實世界的物理規則,透過攝影機、感測器、機器手臂與移動平台感知周遭環境,並實際執行任務,使AI從「會思考」進一步邁向「能行動」。值得注意,Physical AI並不侷限於人形機器人,而是泛指所有能夠感知、理解並與真實世界互動的智慧系統,包括自駕車、自主移動機器人(AMR)、智慧機械手臂、無人機及各類服務型機器人等。
NVIDIA執行長黃仁勳也多次指出,繼生成式AI之後,Physical AI將成為下一個兆美元等級的市場機會。其背後代表的不僅是機器人產業的崛起,更意味著AI正從「數位勞動力」進一步演進為「實體勞動力」。
繼大型語言模型之後,Physical AI已成為全球科技產業下一個兵家必爭之地。從NVIDIA、Tesla、Google DeepMind,到機器人新創Figure AI、Agility Robotics,以及Boston Dynamics,皆加速布局人形機器人與Physical AI相關技術。
AI Agent到Physical AI引爆新產業革命
若說AI Agent正在重新定義白領工作的流程與生產模式,Physical AI可望引爆另一場更深層的產業革命。當AI開始同時具備感知、推理與行動能力,未來的工廠、物流中心、醫療院所,甚至日常生活場景,都將迎來新一波人機協作模式,AI也將真正從數位世界延伸至實體世界。
回顧近年AI技術演進,第一階段為辨識型AI(Perception AI),以電腦視覺、語音辨識與推薦系統為代表,AI主要負責資料分析與模式辨識。第二階段則是生成式AI,隨著大型語言模型興起,AI開始具備內容生成、推理與自然語言互動能力,從分析工具進一步成為知識工作的協作者。現今AI技術發展正逐步邁向第三階段─Physical AI,其核心在於讓AI能夠理解物理世界、感知環境變化,並自主規劃與執行行動。這代表未來AI不僅能理解語言與生成內容,更將具備觀察、移動、操作與執行任務的能力,直接參與現實世界中的各類工作流程。
過去幾年,大型語言模型主要處理預先整理好的文字資料,但真實世界卻充滿高度的不確定性與動態變化。同一物體可能因光線、角度或遮蔽而呈現不同樣貌;在工廠或倉儲場域中,原本規劃好的移動路徑,也可能因突發障礙而需要即時調整。因此,Physical AI不僅需要視覺辨識能力,更必須整合空間理解、環境感知、動作控制與即時決策等能力,才能真正適應現實環境。
世界模型成為關鍵 AI理解現實世界
然而要讓AI從理解文字走向理解真實世界,其技術複雜度遠高於生成式AI。大型語言模型擅長語言理解、知識推理與內容生成,但若AI進一步需要操作機器人、進行自主移動,甚至與人類協作,就必須具備對物理世界運作規則的認知能力,包括物體之間的因果關係、空間變化,以及行動可能產生的結果。而這種讓AI能夠在腦中建立環境預測與推演能力的核心技術,正是近年備受關注的「世界模型(World Model)」。
世界模型的核心概念,在於讓AI建立對物理世界的內部模擬能力,使其能夠預測環境可能發生的變化,並提前規劃下一步行動。如AI必須理解物體之間的空間關係、物體受力後可能產生的變化,以及人類在不同情境下可能出現的行為模式。這些對人類而言再自然不過的常識,對機器而言卻必須透過大量學習與模擬才能逐步掌握。
換言之,世界模型就像是AI的大腦,讓機器人在真正執行動作之前,先在內部完成一次「預演」,評估不同決策可能產生的結果,進而降低錯誤率並提升自主決策能力。
近幾年NVIDIA積極推動Cosmos平台與Physical AI架構,其核心目標之一便是建立世界模型能力。即透過大量模擬資料與虛擬環境訓練,讓AI先在數位世界中學習物理規律,再將所學能力遷移至真實世界。這種模式被稱為Sim-to-Real(Simulation to Reality),即先虛擬環境完成訓練,再部署至現實場域。
隨著數位孿身(Digital Twin)技術逐漸成熟,也進一步加速Physical AI的發展,即透過建立高度擬真的虛擬環境,企業可在數位世界中模擬工廠設備、物流流程,甚至整個城市運作情境,讓AI與機器人先完成大量訓練與測試,再將能力部署至真實場域。
相較於直接在現實環境進行學習,虛擬訓練不僅能大幅降低成本與風險,也能加快模型迭代速度。未來隨著模擬平台、感測技術與運算能力持續進步,AI將有機會先在數位世界完成「成長」,再逐步進入真實世界執行任務,成為Physical AI普及的重要推手。
人形機器人競賽開打 全球科技巨頭全面卡位
當AI開始具備理解物理世界的能力後,可望讓人形機器人發展進入新階段。過去機器人多只能依照固定程式執行特定任務,但結合大型語言模型、世界模型與視覺感知能力後,新一代人形機器人已逐漸具備環境理解、自主規劃與人機互動能力,使其應用範圍開始從工廠自
動化,進一步擴展至物流、零售、醫療與家庭服務等領域。
由於工廠、倉庫、辦公室與家庭等環境,大多是依照人類身體結構設計,當機器人擁有雙手、雙腳與接近人類的活動能力,便能直接使用現有設備與工具,而不需要重新改造整個環境。因此,Tesla Optimus、美國新創公司(Figure AI)Figure 02、Agility Digit、波士頓動力(Boston Dynamics)Atlas等業者,均有相關產品陸續問世。中國大陸業者也正快速崛起,如宇樹科技、智元機器人、優必選等,均積極投入人形機器人開發,憑藉成熟供應鏈與製造能力,可望在全球人形機器人產業中佔有一席之地。
機器人革命背後 勞動力危機浮現
儘管技術突破是推動Physical AI的重要因素,但真正驅動市場需求的關鍵,卻是全球日益嚴重的人力短缺問題。目前全球主要國家都面臨高齡化與少子化趨勢,使製造、物流與照護產業面臨人力短缺的壓力,也成為推動Physical AI與人形機器人快速發展的重要驅動力。
因此,人形機器人被視為繼工業機器人之後,全球因應人口結構變遷的重要技術解方。
Physical AI機器人可依不同工作需求進行調整,被視為解決勞動力不足的重要工具。只是現今大多數人形機器人專案仍處於測試與概念驗證階段,真正能夠大規模部署的案例仍相當有限。關鍵在於成本、能源效率、可靠度與安全性等問題尚未完全解決,且當機器人進入企業現場,還必須面對系統整合、法規遵循、人機協作與責任歸屬等挑戰。
從AI Agent到Physical AI,代表的不只是技術能力的提升,更意味著AI正從數位助手,逐步演進成具備感知、推理與行動能力的智慧勞動力。