一週 AI 大事|AI 走進真實世界:開始預測地球,也開始操作機器(2026/8/31)

一週 AI 大事・完整延伸閱讀

2026/08/31

AI 走進真實世界:開始預測地球,也開始操作機器

這週的重點不只是模型更快。AI 正在接上地理資料、實體硬體、企業流程與機器人,從「給答案」往「理解環境、持續記住、實際完成任務」移動。

預測地球操作硬體學會長任務
易悅吉祥物操作控制輪,連接地球預測、實體硬體與機器人長任務

本週完整整理

7 則 AI 更新,一則一則看懂

以下依 8/31 影片內容整理,並以官方公告、專案頁與論文重新核對名稱、數字和發布狀態;廠商跑分與展示都會明確標成官方自評。

地球資料自動轉成預測模型的示意
01實驗研究

Google PPE:用自然語言建立地球尺度的預測模型

發生什麼

Google Research 發表 Planetary Prediction Engine(PPE)。輸入一個地理預測問題後,系統可以自行找資料、整理特徵、訓練與評估模型,最後產生預測和報告。

為什麼值得注意

過去建立公共衛生、糧食安全與環境風險模型,常要花數週整合零散資料。PPE 的目標,是把這段大量人工資料工程縮短到幾分鐘,讓專家更快測試假設。

展開能力邊界與查證補充
  • PPE 屬於 Google Earth AI 旗下的實驗研究能力,不是 Google Earth 已全面開放的一般功能。
  • 它縮短的是「建立地理預測模型」所需的資料搜尋、整理與訓練流程,不是把疾病或糧食危機本身的預測週期直接從數週變成數分鐘。
  • 論文在公共衛生、風險與奈及利亞糧食安全等任務報告優於基準的結果;這些仍是研究團隊的實驗評估。
人形機器人在田徑賽道奔跑的示意
02正式賽事

世界人形機器人運動會:百米決賽跑進 8.64 秒

發生什麼

第二屆世界人形機器人運動會在北京舉行,來自 16 個國家和地區的 666 支隊伍、2,056 台機器人參與 51 個賽項。天工 Ultra 從開幕時的 9.39 秒,一路把大型組百米成績推進到決賽 8.64 秒。

為什麼值得注意

除了速度,賽事還測試跳高、障礙、乒乓球、拔河、街舞與真實場景任務。這些比賽最有價值的地方,是把平衡、感知、散熱、關節控制與自主決策放進同一個壓力測試。

展開最終成績與比較方式
  • 影片中的 9.39 秒是開幕時的成績;賽事後續又出現約 8.85 秒,決賽最終由天工 Ultra 以 8.64 秒奪冠。
  • 閉幕資料記錄原地跳高由上屆 0.95641 公尺提高到本屆 3.40 公尺,因此本文不再沿用影片中的 2.88 公尺與 4.8 公尺。
  • 這些數字雖然高於部分人類田徑紀錄,但機器人賽事的器材、分組、量測與競賽規則不同,不宜直接寫成已由人類田徑組織認證的「超越人類極限」。
輕量多模態模型兼顧速度與成本的示意
03開放權重

GLM‑5.3‑Flash:更省成本的多模態代理模型

發生什麼

Z.ai 發表 GLM‑5.3‑Flash,總參數約 320B、每次啟用 18B,支援文字與圖片。官方把它定位為比 GLM‑5.2 更快、更便宜,同時能處理程式與代理任務的 Flash 版本。

為什麼值得注意

它把多模態能力、開放權重與較低推論成本放在同一個模型裡,對需要看畫面、寫程式又要大量呼叫模型的工作流特別有吸引力。

展開價格、跑分與晶片說法
  • 官方寫的是「相較 GLM‑5.2,以十分之一價格取得更高表現」,不是成本只有 Claude Opus 4.8 的十分之一。
  • 官方定位是「在程式與代理跑分接近 Claude Opus 4.8」,不同測試各有輸贏,不能概括成全面超越。
  • 目前找到的官方模型資料沒有足夠證據支持「訓練與運作全部由中國晶片完成」這個完整說法,因此本文不把它列為已確認規格。
共通介面連接多種實體設備的示意
04研究預覽

Anthropic MHS:讓 AI 用同一套規格連接實體設備

發生什麼

Anthropic 公開 Model Hardware Standard(MHS)研究預覽,先提供科學實驗室與先進製造夥伴測試。它用標準化驅動程式描述設備能力、安全限制和可執行指令,再讓 AI 代理透過 MCP、命令列或 API 協調多台設備。

為什麼值得注意

實驗室和工廠最耗時的往往不是模型,而是每台儀器都要另外寫整合。MHS 想把這層翻譯統一,讓顯微鏡、移液機器人、機械臂等設備能被同一個代理理解與協作。

展開適用範圍與安全限制
  • 目前只開放申請加入有限研究預覽,尚未全面開源。
  • MHS 只能操作具有可程式化介面的設備;沒有介面的硬體仍需要廠商新增驅動。
  • Anthropic 明確提醒 Claude 的空間與物理推理仍有限,需要專家監督,因此不能簡化成「AI 已能直接接管工廠」。
Claude 讀取客戶資料並更新銷售進度的示意
05小規模試點

Claudeforce:把 Salesforce 的銷售資料與流程帶進 Claude

發生什麼

Salesforce 與 Anthropic 擴大合作,推出 Claudeforce。第一個產品是 Salesforce in Claude 外掛,內含 37 個銷售技能,可讀取即時營收脈絡、整理會議、檢查商機健康度、檢視銷售管線並在權限規則內更新資料。

為什麼值得注意

它不是在 CRM 外再加一個聊天視窗,而是讓 Claude 直接使用企業既有資料、流程與權限。銷售人員可以從問題開始,再接著更新管線或採取行動,減少在多個畫面間找資料。

展開產品名稱與開放時間
  • Claudeforce 是 Salesforce 與 Anthropic 的合作名稱;首個產品叫 Salesforce in Claude,不是一套全新的 CRM。
  • 發布時只提供部分試點客戶,官方規劃在 2026 年 9 月進入公開測試。
  • 初期 37 個技能以 Sales 為主,Service、Marketing 與 Commerce 等功能仍標示為後續推出。
機器人觀看一次影片示範後執行長任務的示意
06官方展示

Skild S1:看一次影片,機器人就照著完成新任務

發生什麼

Skild AI 展示機器人基礎模型 S1。它以一段影片作為提示,不需要再微調模型,就能把示範轉成機器人動作;官方展示的未見任務包括換盆、手沖咖啡、組裝套件與翻鬆餅。

為什麼值得注意

傳統機器人要學新任務,往往需要大量遙控資料和專門訓練。若一次視覺示範就能說清楚「要怎麼做」,教機器人的方式會更像人類帶著做一次。

展開長任務與證據邊界
  • 官方展示的長任務最長約 10 分鐘,包含數十個操作步驟,使用同一組模型權重完成。
  • 換盆案例從錄完一段人類第一視角示範,到機器人開始自行執行,相隔約 11 分鐘。
  • 目前主要證據來自 Skild AI 自己的展示與內部評測,尚不能等同於所有家庭環境都能穩定成功的獨立驗證。
語音記憶分成事實與情緒兩條路徑的示意
07論文/開源

VoiceMem:把語音記憶分成「事實」與「情緒」兩條路徑

發生什麼

VoiceMem 是為即時語音助理設計的串流記憶系統。它用「左腦」整理人物、知識等事實記憶,再用「右腦」累積情緒、偏好與人格;使用者還在說話時,系統就能開始轉寫、分類與搜尋相關記憶。

為什麼值得注意

語音 AI 不只需要記得你說過什麼,也要控制回憶帶來的延遲與上下文長度。VoiceMem 只取回少量最相關記憶,嘗試兼顧個人化、情緒理解與即時反應。

展開作者、跑分與開源資訊
  • 論文作者來自南洋理工大學、新加坡國立大學、清華大學、香港中文大學與 Open Interaction Lab;沒有證據顯示這是字節跳動發布的系統。
  • 團隊報告在 LoCoMo 使用 Top‑5、約 430 個記憶 token 時取得 91.2%,檢索延遲 134 ms;這些是論文與專案頁的團隊評測。
  • 程式以 Apache 2.0 授權開源,專案頁也提供資料集、模型與可重現評測入口。

讀完最常問

本週 FAQ

機器人百米 8.64 秒,真的已經超越人類嗎?

數字上比人類男子百米世界紀錄快,但機器人賽事的器材、分組、量測與規則不同,也不是由人類田徑組織認證。比較適合把它看成雙足機器人在速度與控制上的重大進展。

GLM‑5.3‑Flash 已經全面超越 Claude Opus 4.8 嗎?

沒有。Z.ai 的官方說法是部分程式與代理跑分接近 Opus 4.8;不同評測有輸有贏。本文也把價格的「十分之一」正確寫成相較 GLM‑5.2,而不是相較 Claude。

MHS 現在可以讓 Claude 接管所有工廠設備嗎?

不行。MHS 仍是有限研究預覽,只能連接具有可程式化介面的設備,而且 Anthropic 要求專家監督,現階段更像一套待共同測試的 AI 硬體共通介面。

想跟大家一起討論這些 AI 更新?

易悅元宇宙社群免費開放。除了每週整理,也可以交流工具、內容創作與實際使用心得。

加入元宇宙社群
Ad Feature

🚀 加入易悅元宇宙|節省時間創作基地

在這裡你可以認識更多的創作者、找尋自己的靈感、每週獲得創作心法,社群免費開放。歡迎你一起加入✨

分享此內容: