一週 AI 大事 9/21|Jev、Dream‑RSI、Qwen 同傳與虛擬世界

一週 AI 大事・完整延伸閱讀

2026/09/21

AI 開始自己決策、自己探索,也把虛擬世界繼續運轉

這週的主線不只是模型變快,而是 AI 正同時往三個方向前進:更快做選擇、持續改進搜尋策略,以及在影音、虛擬世界與機器人裡接手更長的動作流程。

資安邊界即時決策世界與行動
易悅吉祥物在俯視情報桌上查核資安、語音、世界模型、影片與機器人線索

本週完整整理

10 則 AI 更新,一則一則看懂

以下依 9/21 的橫式字幕稿整理,並重新核對研究團隊、產品頁、論文與正式專案。數字若來自廠商自評或小規模實驗,會放回它原本的測試條件,不把宣稱直接寫成普遍事實。

資安漏洞串連後完成修補的示意
01白帽揭露/已修復

白帽研究員串起兩個漏洞,取得 OpenAI 員工帳號權限

發生什麼

資安團隊 Hacktron 從 OpenAI 社群論壇的 HEIF 圖片解碼漏洞切入,再串接單一登入設定問題,成功接觸到 ChatGPT/Codex 員工帳號與內部程式庫權限。他們依漏洞懸賞流程回報,OpenAI 在獲報後修補,並於 9 月 1 日發放 6,500 美元獎金。

為什麼值得注意

真正危險的往往不是單一漏洞,而是兩個看似分開的弱點被串成完整攻擊路徑。這次也顯示,AI 服務的圖片處理、社群系統與員工登入,都可能成為同一條供應鏈的一部分。

展開時間線、金額與事件邊界
  • 研究團隊表示整條 OpenAI 通報流程不到 72 小時;OpenAI 端問題在提交後約 14 小時內修正。
  • 「不到 3,000 美元 Token 成本」是 Hacktron 整個跨公司 HEIF Heist 研究計畫的總花費,不是只為這次 OpenAI 測試所花。
  • 研究員只提交無害的內部 PR 作為存取證明,沒有公開使用者資料外洩證據;因此本文不把事件寫成已確認的大規模資料外洩。
模型從多個選項快速做出決策的示意
02早期體驗

Jev:把 AI 從聊天改成毫秒級「選一個行動」

發生什麼

Diogo Almeida 團隊推出 Jev,定位為 System One 決策模型。它不是生成一大段文字,而是在預先定義的選項中快速選擇下一步;官方標示回應時間約 70~500 毫秒,可用於網頁操作、遊戲、分類與即時路由。

為什麼值得注意

許多 Agent 任務真正需要的不是長篇推理,而是低延遲、結構固定的下一個動作。Jev 把輸出空間縮小後,更容易接進需要即時反應的系統。

展開團隊、「零幻覺」與使用邊界
  • Jev 官網把 Diogo Almeida 描述為 ChatGPT 方法的共同發明者;本文只採用官網可核對的身分表述,不額外擴張頭銜。
  • 官方所說的「zero hallucinations」是指輸出只能落在預先定義、型別安全的選項裡,不會憑空生成不存在的欄位。這不等於每次決策都正確,模型仍可能在合法選項中選錯。
  • 產品目前屬早期開放階段;若用於付款、刪除或控制設備,仍需要驗證與停手機制。
模型比較多條探索路徑並保留最佳策略的示意
03研究發布

Dream‑RSI:先在「發現樹」裡重播,再挑更好的探索策略

發生什麼

Google DeepMind 團隊提出 Dream‑RSI:它把過去的探索紀錄整理成可精確重播的發現樹,先在不增加新執行成本的模擬器中測試大量搜尋策略,再把表現最好的策略帶回真實任務。

為什麼值得注意

自我改進不一定要不斷燒更多算力。若模型能從既有探索歷史學會「下一次該怎麼找」,演算法、數學最佳化與 GPU 核心設計這類昂貴任務,就可能更有效率。

展開實驗範圍與官方數字
  • 研究涵蓋 8 個發現任務,類型包含演算法工程、數學最佳化與 GPU kernel 工程。
  • 作者報告相較固定探索策略可少用約 1.7 倍呼叫;在其中一個 Lasso 比較中,最高達到相較 SimpleTES 少 162 倍呼叫。
  • 這些結果屬指定研究任務,不代表任何模型都能在所有領域無限制自我進化。
即時語音跨語言並在背景呼叫工具的示意
04模型更新

Gemini 3.8 Live:說話不中斷,背景照樣呼叫工具

發生什麼

Google 在 9 月 15 日推出 Gemini 3.8 Live 與 Extended Thinking。新版可在對話持續進行時於背景執行 API 與工具,也支援即時視覺輸入,以及在對話中自動切換 97 種語言。

為什麼值得注意

過去語音助理一查資料就停住,會讓互動像在等客服轉接。背景工具呼叫把「對話」與「工作」拆開並行,對即時客服、導覽與現場助理更實用。

展開語言、工具與延遲邊界
  • 97 種語言是官方列出的支援範圍;口音、環境噪音與專有名詞仍可能影響辨識品質。
  • Extended Thinking 可在語音輸出時持續推理,但較長推理也可能增加成本與完成時間。
  • 背景工具呼叫不等於所有動作都應自動執行,涉及付款、個資與外部訊息時仍要設確認點。
文字圖片聲音與影片匯入同一模型的示意
05模型上線

Qwen3.8‑Omni‑Flash:一次讀進文字、圖片、聲音與影片

發生什麼

阿里巴巴發布 Qwen3.8‑Omni‑Flash,可同時接收文字、圖片、音訊與影片,輸出文字,並支援最高 100 萬 Token 上下文、工具呼叫與多步 Agent 工作流。官方也特別強調空間音訊理解能力。

為什麼值得注意

影音理解不必再拆成轉錄、抽幀、辨識與文字推理好幾段流程。對長影片檢索、會議、客服與多媒體 Agent 來說,輸入管線能變得更直接。

展開多模態跑分與使用邊界
  • 官方將模型與 Gemini 3.8 Flash 等產品比較,部分多模態基準領先;這是 Qwen 團隊自評,不是獨立第三方已確認的全面勝出。
  • 100 萬 Token 是支援上限,不代表把整段長影音一次塞入就一定更準或更省。
  • 分析人物、聲音與監視影像時,仍要注意授權、個資與錯誤辨識風險。
兩段語音即時跨語言翻譯的示意
06模型上線

Qwen3.8‑LiveTranslate:60 種語言邊聽邊翻,平均延遲 2.3 秒

發生什麼

Qwen 同步推出 LiveTranslate 即時語音翻譯模型,可接收 60 種來源語言,並以 29 種語言輸出語音。官方報告平均延遲指標 LAAL 為 2.3 秒,低於前一版的 2.8 秒。

為什麼值得注意

即時翻譯的體感關鍵不是只看字面準確率,而是能否在語句還沒說完時做出穩定預測。延遲縮短後,更接近會議、直播與跨語言對話需要的節奏。

展開延遲數字與語言範圍
  • 官方數字是平均 2.3 秒,不是「不到 2 秒」;實際延遲會受網路、句型、語言對與輸出方式影響。
  • 60 種是來源語言支援,語音輸出為 29 種,兩個數字不能混在一起。
  • 同聲翻譯會在資訊尚未完整時先預測,姓名、數字、專有名詞與否定句仍需要人工覆核。
虛擬世界與自主角色持續運作的示意
07研究預覽

JING & DAO:一個生成世界,一個讓角色繼續生活

發生什麼

XGEN Labs 公開 JING & DAO 世界模型架構。JING 負責生成觀察者看見的第一人稱世界;DAO 則維護共享世界狀態、規則與自主角色,讓使用者離開視角後,世界內的事件仍可繼續發展。

為什麼值得注意

生成式 3D 正從「做出一段畫面」走向「維持一個有狀態的世界」。如果角色、規則與記憶能長時間一致,遊戲、模擬與數位分身的設計方式都會改變。

展開「持續運行」與研究限制
  • 「離開後仍運作」指 DAO 維持共享狀態與自主 Agent,不代表一個公開世界已能無限期、完全穩定地自行演化。
  • 官方目前定位為研究預覽,仍列出延遲、畫面忠實度、互動可靠性與長時間漂移等限制。
  • 若要用於多人世界或商業遊戲,還需要內容安全、權限、成本與可重現狀態等工程層。
在兩個影格之間補出新影格的示意
08正式上線

Runway Enhance Frame Rate:把影片補到最高 120fps

發生什麼

Runway 上線 Enhance Frame Rate,可在既有影格之間補出新畫面,輸出 25、30、48、60 或 120fps。官方說明支援最高 4K、最長 5 分鐘的來源影片,輸出會維持原始解析度。

為什麼值得注意

AI 影片常見的跳動與低幀率,可以在後製階段變得更流暢;慢動作、運動畫面與高更新率播放也多了一個直接工具。

展開 4K、補幀與畫質邊界
  • 這項功能是時間維度的補幀,不是空間維度的放大;來源若本來模糊或有壓縮痕跡,不會因補幀自動變成真正的 4K 細節。
  • 「支援 4K」是指可處理最高 4K 來源並維持解析度,不是把所有低解析影片升成 4K。
  • 快速遮擋、手部、細線與複雜運動仍可能出現幽靈影像或錯誤中間幀,輸出後需要逐段檢查。
相機繞著同一場景重新運鏡的示意
09開放模型

Viggle Meridian:影片拍完後,還能重新選鏡位與路徑

發生什麼

Viggle 發布 Meridian,一個幾何導引的 re‑camera 模型。它可根據原始影片與指定相機路徑合成新視角,也能暫停時間、拉出鏡頭路徑,製作類似子彈時間的效果。

為什麼值得注意

傳統拍攝一旦結束,鏡位大多跟著固定。重新運鏡模型讓剪輯者能在後製階段重新設計觀察角度,對產品展示、動作片段與短影音轉場很有想像空間。

展開輸出規格與硬體限制
  • 模型卡標示輸出為 24fps、約 768 等級解析度,每段建議 3~10 秒,並需要高記憶體 CUDA GPU。
  • Meridian 建構在 MiniMax‑H3 與 VGGT‑Omega 等元件之上,公開的是模型與介接資源,不等於任何手機都能即時完成。
  • 新視角超出原始影片可見資訊時,模型必須自行補畫;遮擋、人物一致性與幾何結構仍可能失真。
機器人觀察人類示範後嘗試新動作的示意
10研究發布

GPT‑Policy:不重新訓練,機器人也能從示範中調整動作

發生什麼

GPT‑Policy 提出一套機器人策略框架:固定的通用視覺語言模型先理解情境,再由 context compiler 整理示範與狀態,最後只能透過受限制的機器人工具執行。新示範可在測試時加入,不需要梯度更新或重新訓練模型。

為什麼值得注意

機器人學新技能如果每次都要蒐集資料、重訓模型,成本很高。把示範直接變成當下可用的上下文,可能讓少量教學更快轉成新任務嘗試。

展開示範結果與安全邊界
  • 實驗使用 GPT‑6 Astra 作為通用 VLM,但框架本身的重點是上下文整理、工具限制與即時加入示範。
  • 以紅毛巾與筆記本任務為例,加入人類示範後從 0/3 提升到 2/3 次成功;樣本很小,不能寫成「看一次就一定學會任何動作」。
  • 碰撞、接觸精度、動作完成驗證與未知環境仍是限制;實體機器人應保留速度、力道與緊急停止保護。

讀完最常問

本週 FAQ

Jev 的「零幻覺」是否代表它永遠不會做錯決定?

不是。它的輸出被限制在預先定義的合法選項中,因此不會生成不存在的欄位;但在這些選項之間,仍可能選錯。高風險動作依然需要人工確認與驗證。

Runway 的 4K 120fps,能把模糊影片直接變清楚嗎?

120fps 是補出更多時間影格;4K 是支援的來源解析度上限。它能讓動作更流暢,但不等於把缺失的空間細節全部還原。模糊、壓縮與生成瑕疵仍要另外處理。

Dream‑RSI 與 GPT‑Policy 都算是 AI 自我進化嗎?

兩者都會利用新的經驗改變後續行為,但方法不同。Dream‑RSI 在發現樹中評估並更新探索策略;GPT‑Policy 則把人類示範加入當下上下文,不需要重新訓練底層模型。它們都不是無限制自行成長的通用智慧。

想跟大家一起討論這些 AI 更新?

易悅元宇宙社群免費開放。除了每週整理,也可以交流工具、內容創作與實際使用心得。

加入元宇宙社群
Ad Feature

🚀 加入易悅元宇宙|節省時間創作基地

在這裡你可以認識更多的創作者、找尋自己的靈感、每週獲得創作心法,社群免費開放。歡迎你一起加入✨

分享此內容: