
- 登入
- 註冊

一週 AI 大事・完整延伸閱讀
2026/08/10這週的共同訊號很清楚:AI 正從一次性的回答,走向長時間執行、科學研究與真實決策。模型開始能連續工作數天、重建論文,也開始被拿來預測天氣、畫工程檔案與測試市場反應。
本週完整整理
短影片先讓大家快速掌握;這裡補上每則消息的背景、為什麼值得注意,以及可以繼續查看的官方公告、論文與開源專案。

Google DeepMind 的 WeatherNext 2 能預測熱帶氣旋的生成位置、路徑、強度、結構、大小與形成機率,時間最遠到 15 天。這套技術也能在 Weather Lab 查看,並透過 Google 的企業與研究平台使用。
更長時間、更多面向的氣旋預測,可以讓專業預報與防災單位更早比較不同風險情境;但它仍是實驗工具,不能取代各地官方預報與警報。

OpenAI 公布下一代模型的內部版本 Astra,在高維幾何、編碼理論、群論、量子複雜度、格密碼學等領域,解決或大幅推進十項長期開放問題。官方估算,若用 Sol API 計價,總 token 成本約 2,000 美元。
這次重點不是「AI 算出十題數學題」,而是它開始能參與真正的研究流程:探索證明、協助整理手稿,再把部分結果形式化到 Lean,讓證明能被機器檢查。

Qwen3.8‑Max 在官方長時間代理實驗中連續運作約 16 天,完成 265 次程式提交、127 個 Pull Request 與 151 個 Issue。另一項實驗裡,它花約五天重建研究論文的實驗,接著提出改良方法。
AI coding agent 的競爭,已經從「一次幫我寫一段程式」走到「能不能守著一個專案工作好幾天」。能讀論文、重建結果、再跑新的實驗,是更接近研究助理與工程團隊的工作模式。

清華大學 IEI Lab 公開 MAC(Multi‑Agent CAD)。使用者輸入自然語言需求後,四個代理會分工規劃規格、幾何結構、程式生成與修正,最後輸出 STEP、STL 等可以檢查與列印的工程檔案。
一般圖片模型只能畫出「看起來像 3D」的圖;CAD 檔案則要符合尺寸、零件關係與製造需求。MAC 把文字直接接到可編輯、可量測的工程流程,跨過的是完全不同的一道門檻。

Meta 推出 Beta 版終端機程式代理 Muse Code,以及背後的 Muse Spark 1.2。它能建立持續運作的非同步背景代理,處理跨檔案、複雜除錯與較長時間的程式任務。
Meta 不只做一個新模型,而是把模型和終端機 Agent 一起訓練。這代表競爭焦點開始從單次程式能力,轉向「模型與工作工具能不能一起把長任務做完」。

Cloudflare 推出 Kitesurf,一套為 AI Agent 重新設計的無狀態瀏覽器。它拿掉分頁、主題、擴充功能與像素級顯示等人類瀏覽器功能,把重點放在讀頁面、操作網站、節省上下文與大規模平行執行。
現在很多 AI Agent 背後仍在啟動完整 Chromium,就像派機器人看一頁資料,卻先幫它開一整套桌面。Cloudflare 文件顯示,Kitesurf 的記憶體與 CPU 使用量可降低約 3 到 7 倍。

xAI 在 8 月 7 日推出 Imagine Image 2.0,加入區域編輯、背景移除、最多五張參考圖、多比例智慧延伸,以及更完整的文字與版面控制。它已成為 Grok 的 Quality Mode,也提供 API。
截至推出當日,Arena 的圖像生成與圖像編輯榜上,它都排在第二名,落後 OpenAI 的 GPT‑Image‑2,但領先當時榜上的 Gemini 圖像模型。這讓 Grok 從「能生成」走到更接近實際設計工作。

MatrAIx 論文提出一套涵蓋全球 83 億人口尺度的人格代理系統,讓研究者與產品團隊能抽樣不同背景、偏好與行為傾向的模擬使用者,測試 AI 系統或數位產品會收到什麼回饋。
傳統使用者研究很花時間,也很難在早期一次涵蓋大量族群。這套系統能先觀察價格改變、等待時間、產品失敗經驗等因素,如何影響模擬使用者的選擇,再決定哪些假設值得真的去訪談。
FAQ
不完全是。OpenAI 的原文是十項成果「解決或取得重大進展」,而且手稿仍由人類研究者準備。它顯示模型有研究協作能力,但不是十個問題都已經由 AI 單獨完成並通過學界共識。
不是。它是一個人口尺度的人格模擬與抽樣系統,適合先測假設、找分歧;模型偏差、資料缺口和真實生活情境都會限制結果,不能取代真人研究。
不能這樣解讀。Meta 展示的是能持續呼叫工具、測試與修正的長任務能力,但產品目前仍是 Beta;權限、測試結果與上線內容仍需要人類設定和審查。
易悅元宇宙社群免費開放。除了每週整理,也可以交流工具、內容創作與實際使用心得。