
- 登入
- 註冊

一週 AI 大事・完整延伸閱讀
2026/08/17這週從旗艦模型、手語輸入,到能在本地運行的開放權重模型,變化不只在跑分,而是 AI 開始更直接地進入工作、創作與真實世界。
本週完整整理
IG 短影片先帶大家快速看完;這裡補上每則消息的背景、為什麼值得注意,以及可以繼續往下看的原始來源。
xAI 在 8 月 12 日推出 Grok 4.6,主打長時間代理、程式開發、多步驟工作與互動式視覺成果。xAI 的發布文指出,它在當時的 Artificial Analysis Intelligence Index 與 GPT‑5.6 Sol 並列。
它最值得看的不只是總分,而是長任務裡的自我檢查、工具使用和工作效率。這表示 Grok 已經不只是「追上」,而是開始和最前面的模型正面競爭。
OpenAI 在 8 月 13 日公布 GPT‑5.6 Sol Ultrafast。它由 Cerebras 提供運算,官方標示最高可比 Standard processing 快 14 倍,最高達每秒 750 個輸出 token。
當旗艦模型能用接近即時的速度運作,金融研究、資安事件分析、客服、語音互動與電商決策,就不必再卡在長時間等待。
Google 推出 Gemini 3.7 Flash,定位是 coding 與 agents 的新一代 workhorse 模型。它加強第一次寫對程式、UI 指令遵循與複雜知識工作,Gemini Spark 也改用這個模型。
官方提供到 2026 年底的優惠價:每百萬輸入 token 0.75 美元、輸出 3.75 美元。模型更強,暫時價格又只有標準定價的一半,讓大量代理工作更容易算得過來。
Google DeepMind 發表 sign-language-to-text 模型 SL2T,先在 Pixel 11 提供美國手語轉英文。使用者可以直接對鏡頭打手語,再輸入 Gboard 或顯示在 Live Transcribe。
它不是研究室裡的展示,而是直接放進手機的無障礙功能。模型會同時理解手、身體與臉部動作,也針對拿著手機時的單手手語做了實際使用優化。
Qwen 釋出 Apache 2.0 授權的 Qwen3.8‑27B。這是一個 27B 的視覺語言模型,主打程式開發、專業工作、研究與長時間代理任務,官方模型卡也直接提供本地部署與量化模型入口。
27B 這個尺寸在量化後可以部署到合適的消費級硬體或部分筆電,讓高能力的視覺與程式模型不一定只能留在雲端;實際需求仍取決於量化方式、上下文長度與運行工具。
小米研究團隊公開 MiDashengLM‑Gen。過去語音、配樂和音效常要分開生成再混音,這個模型改成用同一套端到端框架,直接產生包含說話聲、音樂與環境音的完整聲音場景。
對影片、遊戲與有聲內容創作者來說,真正麻煩的常常不是「做出一個聲音」,而是讓不同聲音在同一段裡聽起來合理。統一生成代表製作流程有機會再少好幾步。
MiniMax 公開 Music 3 權重。輸入歌詞和音樂描述後,它能生成最長 5 分鐘、包含前奏、主歌、副歌、橋段和尾奏的完整歌曲,輸出為 32 kHz、16-bit 立體聲 WAV。
它不只是雲端網站的新功能,而是能自己下載部署的模型。完整版可在 24GB 以下顯存運行,透過 CPU offload 與逐層串流,連 8GB 顯卡也能跑,只是速度會變慢。
Dyna Robotics 發表 Dyna‑2,利用超過 100 萬小時的第一人稱人類影片預訓練。模型先從人類怎麼和物品互動開始學,再把能力轉到摺衣、取放與食物處理等真實機器人操作任務。
機器人資料一直很難大量收集;如果能先看人類影片建立物理與動作常識,就不必每個技能都靠機器人一小時一小時重新示範,訓練規模才有機會像軟體一樣放大。
易悅元宇宙社群免費開放。除了每週整理,也可以交流工具、內容創作與實際使用心得。