草根影響力新視野 夜未央編譯
當你要求機器人把馬克杯放進櫥櫃時,看似簡單的生活日常,對機器人而言卻是一場極為複雜的考驗。人類能輕鬆繞過座椅、避開檯面雜物並打開正確的櫃門,但機器人卻必須仔細運算每一個動作細節與物理路徑。這也解釋了為什麼現在的機器人在實驗室示範中看起來靈巧無比,但一進到真實的家庭或工廠環境時,卻常常連最基礎的家務事都做不好。機器人需要累積大量的空間與場景經驗才能穩定運作,然而在現實世界中訓練機器人不僅耗時費力,還需要人類隨時維護與監督。
為了打破這個瓶頸,美國麻省理工學院電腦科學與人工智慧實驗室(MIT CSAIL)與豐田研究院(Toyota Research Institute)聯手推出了全新的AI訓練系統「SceneSmith」。這個系統能透過簡單的文字指令,自動建構出細節極為豐富的3D室內虛擬環境。機器人可以在這些由AI生成的虛擬空間中進行千百次的練習與試錯,並在進入真實家庭或工作場所前,提前發現並修正行動計畫中的缺失。
傳統的實體測試存在許多痛點。機器人每嘗試一次,研究人員就必須重新擺設現場物件。擺歪的椅子或放錯位置的瓶罐都會影響下一次的測試結果,更糟糕的是,失敗的動作可能會撞碎碗盤或損壞機器人本身。雖然過去也有團隊使用模擬器進行測試,但舊款模擬器產生的房間通常過於空曠且缺乏細節,無法呈現真實生活中隨處可見的雜物、隨意擺放的家具與複雜的物理環境。SceneSmith的出現則大幅填補了這個虛擬與現實之間的落差。
圖片取自:( 示意圖123RF )
SceneSmith的運作方式極具創新性。使用者只需輸入簡單的文字描述,例如「打造一個帶有汽車與工作檯的車庫,角落堆放輪胎,牆邊靠著梯子」,系統就能順暢生成場景。SceneSmith內部整合了三個由GPT-5.2驅動的AI代理(Agent)相互協作:首先由「設計師」負責規劃並建構房間結構;接著由「批評者」檢查整體擺設是否符合現實邏輯與合理性;最後由「協調者」掌控溝通流程並決定設計何時大功告成。
在建造過程中,SceneSmith採用分層建構策略。系統會先建立基本戶型與大型家具,再於牆面和天花板加上飾品與設備,最後才放入機器人可以抓取或移動的日常小物件。「批評者」AI還能敏銳地捕捉到不合常理的細節,例如確保重物不會懸空擺放、物品風格相互協調等,讓整個虛擬場景高度逼真。
透過這樣強大的生成能力,機器人得以在完全安全且無風險的環境中訓練。即使在虛擬空間中打破幾百個碗盤、撞倒數十張桌子,也不會造成任何財產損失或安全隱患。更重要的是,這種訓練模式能揭示機器人在面對複雜環境時的思維盲點,大幅提升機器人未來投入實體應用時的安全性與穩定度。隨著AI生成技術的持續突破,未來的具身智慧(Embodied AI)將能以更快的速度走出實驗室,真正成為人類生活中不可或缺的好幫手。