掃地機器人還在撞牆,Google 的機器人已經會幫你摺衣服
你家的掃地機器人是不是還會卡在電線上?Google DeepMind 剛剛公開的 Gemini Robotics 2,已經完全是另一個等級的東西——它會聽懂人話、看懂場景、自己決定怎麼做。
不是那種「工廠裡只會重複同一個動作」的機械手臂,而是像有個隱形的腦袋在裡面,真的能理解「這個杯子要放進櫃子的第三層」。
實際做了什麼?摺衣服、收杯子、整理桌面
DeepMind 釋出的影片裡,同一台機器人做了好幾件完全不同的事:
- 摺衣服:抓起床單,辨識哪邊是長邊,對折、再對折
- 收杯子:把散在桌上的杯子一個個放進櫃子,還會避開已經滿的格子
- 整理桌面:把雜物分類,文具放一邊、零食包裝丟另一邊
最關鍵的是——這些不是預設程式。研究員只給口語指令,機器人自己拆解步驟、執行、遇到問題會調整。
你可以想成:以前的機器人像背好整本食譜的廚師,只會做那幾道菜;Gemini Robotics 2 像真的會煮飯的人,冰箱有什麼就炒什麼。
背後的技術:Gemini 多模態模型 + 機器人身體
這台機器人的「大腦」是 Gemini 2.0,Google 目前最強的多模態 AI。多模態的意思是——它同時看懂畫面、聽懂語音、理解文字,然後輸出動作指令。
具體怎麼運作?
| 步驟 | 機器人在做什麼 |
|---|---|
| 1. 感知 | 攝影機拍下畫面,Gemini 辨識「這是杯子、那是櫃子、第三層有空位」 |
| 2. 理解 | 把人類的口語指令「把杯子收好」轉成具體目標 |
| 3. 規劃 | 自己拆解動作:伸手→抓杯→移動→對準→放入 |
| 4. 執行 | 控制機械手臂,還會根據觸覺回饋調整力道 |
這整套流程,以前需要好幾個獨立系統分別處理。現在 Gemini 一個模型全包,這就是為什麼它能「通用」——學會摺衣服,不用重新訓練就能收杯子。
台灣人該注意什麼?製造業、教育、你家客廳
製造業:短期還好,3 年後要緊張
現在這台肯定貴到嚇人(研究原型機通常要價數百萬台幣),而且動作速度還比人類慢。但想想自動駕駛的發展——5 年前你會覺得 Tesla 自己開車很扯,現在已經滿街跑。
台灣的電子代工、食品加工、倉儲物流,這些「重複性高、環境相對固定」的場景,最先被影響。當學生問「為什麼要學程式」,答案可能變成:「不然以後連指揮機器人都不會」。
教育:程式思維比程式語言更重要
未來的工人不是寫程式,而是告訴機器人要做什麼。這需要的能力是:
- 拆解問題:把「整理好房間」拆成「先收衣服、再掃地、最後擦桌子」
- 明確溝通:指令要具體,機器人聽不懂「弄乾淨一點」這種模糊話
- 檢查結果:發現機器人放錯櫃子,能找出是哪個步驟出問題
這些其實就是計算思維(Computational Thinking),國高中資訊課正在教的東西。以前覺得「以後又不當工程師」,現在發現是基本生活技能。
還有哪些挑戰?別以為明天就能買
雖然影片很帥,但幾個現實問題還沒解決:
- 成本:研究原型和量產商品差很遠,掃地機器人花了 20 年才從實驗室到你家
- 安全:機械手臂力氣很大,怎麼保證不會傷到人?(這也是為什麼影片裡都只有單一機器人)
- 複雜環境:實驗室的桌面很乾淨,你家客廳有電線、地毯邊緣、寵物亂跑
Google 自己也說,這是「研究進展展示」,不是產品發表會。
重點整理:這件事為什麼重要
| 過去的機器人 | Gemini Robotics 2 |
|---|---|
| 一個程式只做一件事 | 同一個系統做多種任務 |
| 需要工程師重新寫程式 | 聽口語指令就能學新動作 |
| 環境要固定、燈光要統一 | 能適應一般家庭環境 |
這條線一跨過,機器人就不再是「工廠專用」,而是通用型幫手的起點。
現在可以做的三件事
- 去 YouTube 搜「Gemini Robotics 2」看原片——比文字描述震撼 10 倍
- 想想你工作中重複的動作——哪些未來可能交給機器人?你該強化什麼能力?
- 跟國高中生聊聊——問他們覺得「以後機器人會做什麼」,聽聽 10 後怎麼想這件事
這波浪潮不會明天淹到你家,但看懂趨勢的人,會比較知道往哪游。
試試看吧:現在就打開 YouTube 搜尋 Gemini Robotics 2,看看這台機器人怎麼摺衣服。