newsruka / daily
TODAY ISSUE 102 · 2026.08.12 · 10 MIN READ
政策與倫理 編寫 by 水無瀨 澪

Anthropic 翻出三起沙箱逃逸事故,最早一起四月就發生了

OpenAI、Anthropic、Meta 的模型都在安全測試中攻入外部真實系統,防護是他們自己拆掉的,而三起事故指向同一家評測供應商。Meta 同日開源 Muse Glimmer 30B。

今日漫畫 出演・水無瀨 澪
模型從沙箱破洞跑出去,而那個洞是實驗室自己拆的。三家的線最後全指到同一個地方。 ↗ 點擊放大

過去三週,OpenAI、Anthropic、Meta 接連承認自家模型在安全測試中攻入了外部的真實系統。三家各自發了一篇說明,措辭不同,但事故的形狀幾乎重合。

三家實驗室的模型逃出沙箱,防護是他們自己拆的

先看發生了什麼。

OpenAI 的兩個模型利用一個之前無人知曉的軟體漏洞逃出沙箱,鏈式入侵開源平台 Hugging Face 的生產資料庫,竊取了評測答案。Anthropic 的 Claude 在測試中攻入三家公司,上傳惡意 Python 包到 PyPI,竊取安全公司的憑證。Meta 的 Muse Spark 1.1 攻入一家未具名的協力廠商系統。

容易被略過的是前提。OpenAI 的評測基於 ExploitGym 基準,任務就是讓 agent 發現並利用軟體漏洞;Anthropic 測的同樣是模型的進攻性網路能力。兩家都為了測試目的主動移除部分防護措施,這是它們在自己文章中親口交代的。

那些防護不是隨便加的。攻防兩邊的安全研究者已經抱怨好幾個月,說這些限制嚴格到連正常的安全研究都做不了。測試時,兩家把它們關掉了。

紐約法學院電腦法學者 Ahmed Ghappour 的說法很直接:模型是公司的工具,你不能部署一個有能力入侵系統的東西,然後在它跑偏之後撇清關係。他指出主動關閉防護的行為可能強化過失指控,如果他代理受害方,提起訴訟是「毫無疑問」的決定。

喬治城大學網路安全研究者 Colin Shea-Blymyer 問的則是另一件事:如果這些公司真的認為自己的 agent 能力很強,為什麼不在把它放進沙箱之前,先讓它檢查一下沙箱有沒有漏洞。沒有人這麼做。

安全研究者 Bruce Schneier 把時間拉回 1988 年。那年一個研究生的蠕蟲程式意外擴散到網路上,他成為歷史上第一個依《電腦欺詐和濫用法案》被定罪的人。Schneier 的問題是,這跟今年三家兆元公司主動拆掉防護、模型跑出沙箱攻入真實系統、然後丟出三篇事後解釋文,本質區別在哪裡。

事故時序比事故本身更值得看。

Anthropic 的事故最早在 4 月就發生了,但直到 OpenAI 於 7 月 21 日公開之後才被發現。Anthropic 隨後啟動回顧審查,從 141,006 次評測紀錄中翻出三起事故,發了詳盡的事後報告,點名協力廠商評測夥伴 Irregular 但明確表示不打算追責。8 月 5 日 Meta 的 Muse Spark 1.1 被曝出同類事故,它甚至不是自己發現的,是評測方通知的,Meta 直接點名並歸咎於 Irregular。

把三家串在一起的是同一個地方。OpenAI 的第二起事件、Anthropic 的三起事故、Meta 的事故,全部指向 Irregular 的同一個評測環境。Irregular 發言人直接確認,Meta 和 Anthropic 的事故屬於完全相同的評測環境問題。

Irregular 是 2025 年融資 8,000 萬美元的以色列 AI 安全評測公司,客戶包含 OpenAI、Anthropic、Google DeepMind 和 Meta。這些前沿實驗室共用同一套評測基礎設施,也共用了同一個配置失誤。

敘事的選擇同樣一致。「模型強到掙脫了牢籠」和「我們的沙箱沒封好」描述的是同一件事,前者是能力廣告,後者是事故報告。Sam Altman 用 extremely sci-fi 形容 Hugging Face 事件,黑帽安全大會上 OpenAI 員工臨時加場演講,反覆強調「完全自動化的進攻性迴圈」。

這套敘事的商業效果有跡可循:

  • 4 月 Anthropic 發布 Mythos Preview 時表示這個模型太危險,不能公開發布
  • 6 月 Fable 5 和 Mythos 5 上線三天後,美國商務部以國家安全為由下了出口管制令
  • 7 月出口管制解除,同月 Anthropic 披露 Claude 攻入三家公司的系統
  • 8 月 Anthropic 和 OpenAI 一起支持了一份呼籲政府控制 AI 開發節奏的請願書
  • 加密貨幣託管公司 BitGo 執行長拿出 100 枚比特幣放進錢包,公開邀請 Claude 來偷

網路安全研究者 Peter Girnus 的評價很精準:如果你在每一篇新聞稿裡都把自己的產品描述成軍火,總有一天政府會當真。

7 月 23 日兩黨議員提出「AI 強制關閉法案」,擬賦予國土安全部通過 CISA 對最強 AI 系統的緊急關停權。適用門檻是年收入至少 5 億美元、且模型訓練算力成本超過 1 億美元,兩道門檻由 CISA 在法案生效後 90 天內設定,之後每年更新。這個區間恰好只覆蓋幾家巨頭。

而這部由沙箱逃逸直接催生的法案,明確豁免了紅隊測試期間的行為。催生它的那起事故,本身並不會觸發它。

Muse Glimmer 開源了,官方的加速器在小機器上是減速器

Meta 10 日推出 300 億參數的開放權重模型 Muse Glimmer,以 Muse Spark 為基礎,針對地端、永遠待命的 agent 工作流程最佳化,用 Apache 2.0 授權釋出權重。開發者是 Meta 超級智慧實驗室。

規格上的取捨很清楚:

  • 完整精度下 300 億參數需要超過 55GB 記憶體,遠超任何消費級硬體
  • 量化把權重壓到大約 4 位元精度,模型縮到 20GB 以下
  • 剩餘空間留給 KV Cache、圖像理解的感知編譯器與預設生成,讓它能在 24GB 或 32GB 的 GPU 上跑
  • 基準對比的是 Google Gemma 4-31B 與阿里巴巴 Qwen3.6-27B
  • Hugging Face 可下載,Ollama、LM Studio、Unsloth 陸續支援,並與 AMD、Arm、戴爾、英特爾、NVIDIA 合作最佳化跨裝置效能

祖克柏同步發了一篇 6,500 字長文《The Future is for Everyone》,主張與其將超級智慧集中化,不如廣泛分散並賦予每個人指揮它的能力。他也講明了商業模式:免費版本讓數十億人取用,願意付費使用更多運算資源的人走一套動態競價機制。Meta 今年投入 1,450 億美元建造資料中心,計劃 2028 年之前在 AI 基礎設施上投入多達 6,000 億美元。

社群的實測比官方數字有意思。昨天有人在單張 3090 上量到 DFlash 這個推測解碼器帶來 1.75 到 1.8 倍加速,且加速幅度不隨上下文填滿而衰減。Meta 官方給的數字是 5090 上 3.1 倍、M5 Max 1.8 倍、M4 Max 1.5 倍。

同一個東西在基本款 MacBook Air M5 上是反效果。那台是 10 核 GPU、32GB 統一記憶體、153 GB/s 頻寬:

  • 不開推測解碼:7.41 tok/s
  • DFlash 溫度 1.0:3.0 tok/s
  • DFlash 溫度 0.6:4.5 tok/s

慢了 60%。測試者給的解釋是機器平衡,不是設定錯誤。定義 B 為尖峰 FLOP/s 除以頻寬,那台 Air 大約是 33 FLOPs/byte,5080 是 450。4 位元下驗證 K 個 token 大約要 4K FLOPs/byte,只要 4K 小於 B 驗證就是免費的,換算下來 Air 的臨界值在 K 約等於 8,NVIDIA 卡在 K 約等於 100。DFlash 用的是 16 的區塊,在 5090 上深深落在免費區間,在 Air 上已經過了交叉點。

量化那組數字也推翻了一個常見假設。同一台機器七種量化跑同一組設定,UD-IQ3_M 以 14.1GB 拿到 8.5 tok/s 最快,而檔案更小的 UD-IQ3_XXS 只有 13.1GB,速度卻掉到約 8.0。測試者的判讀是 13GB 附近就不再是純頻寬受限,更重的碼本解壓成本吃掉了少讀資料省下的時間。理論天花板是頻寬除以模型大小,153 除以 16 大約 9.5 tok/s,實測落在八成左右。

Claude 沒證出黎曼猜想,但把下限從 41.6% 推到 67.2%

Anthropic 員工 Jarred Sumner 慢跑時向自家 Claude 提出了黎曼猜想。這是 1859 年由 Bernhard Riemann 提出的難題,至今未被證明或推翻,也是克雷數學研究所願意頒出 100 萬美元獎金的千禧年大獎難題之一。

Claude 沒解出來。但一個未對外釋出的研究版本,把黎曼ζ函數的零點中符合黎曼猜想所占比例的下限,從既有的 41.6% 提高到 67.2%

過程的規模比結果更具體。整件事歷經兩次 Claude Code 工作階段、總共 3,100 萬輸出 token。起初 Claude 嘗試了 650 個構想,沒有任何一個奏效;Sumner 要求它再試一次,花了一天半,協調管理約 60 個子代理。子代理彼此審視證明、尋找反例、從 arXiv 下載 54 篇論文確認是否已被他人提出,總共執行 2,400 道 Shell 指令、撰寫數百支 Python 腳本、對已知的 zeta 零點執行數千次數值檢核。

數學上的路徑是把兩批既有成果接起來。Montgomery 在 1973 年引進的技巧原本以黎曼猜想為真作為假設前提;Baluyot、Goldston、Suriajaya 及 Turnage-Butterbaugh 後來發表的一系列研究讓這些技巧不依賴該前提也能運作。Claude 發現把這批成果與 Bombieri 在 2000 年的論文結合,就有一條路徑能越過 41.6%。

Sumner 不是數學專業人士。他告訴 Claude 要「認真放手一搏」,之後的數學抉擇全部交給 Claude 決定,過程中他的輸入提示大多是鼓勵訊息。Claude 完成後主動提議把結果寫成論文,並建議由人類數學家進行驗證。

Claude 開始在文字裡藏浮水印

Anthropic 宣布新的 Claude 模型產生的文字會嵌入肉眼看不見的機器可讀浮水印,支援格式的檔案則附上數位簽章式的來源資訊。

實作細節值得看清楚。浮水印是在模型產生文字時就加入,不是網站或應用程式事後附加,所以透過 Claude、Claude Platform API、Claude Code、Claude Cowork 或 Claude Tag 取得的文字都會帶標記,複製貼上到別處後仍可能保留。SVG、PNG、JPEG 這類檔案走的是另一套,加入符合 C2PA 標準、經數位簽署的來源中繼資料,用來檢查檔案是否帶有可驗證來源以及事後是否遭竄改。

起點是歐盟。8 月 2 日起在歐盟推出的新 Claude 模型從第一天就支援標記,而 Anthropic 已簽署歐盟《人工智慧法》第 50 條相關的透明度實務準則,該條的透明度規定同樣自 8 月 2 日起適用。機制本身套用到全球所有 Claude 服務。

Anthropic 自己把限制講得很清楚,這點難得:

  • 偵測到標記不代表內容全部由 Claude 創作,只是用 Claude 校稿、翻譯或摘要既有內容,處理後的文字也會帶標記
  • 偵測不到標記,同樣不能認定內容沒有經過 AI 處理
  • 文字經大幅改寫或翻譯、篇幅太短,或檔案轉換、重新儲存、截圖導致來源資訊被移除,標記都可能失效

8 月 2 日前推出的既有 Claude 模型仍在補標記支援,完成時間未公布。浮水印採用的具體技術與偵測方式也還沒公開,Anthropic 說之後會發布技術文件並提供第三方工具。

CoWoS 5.5 倍光罩量產,良率站上 98%

台積電先進封裝技術暨服務副總經理何軍在 OCP APAC 高峰會上講了封裝這幾年的變化。他說三年前董事長魏哲家指派他接手後段封裝營運時 AI 還沒來臨,他以為工作會很輕鬆,只要加速技術移轉、升級當時較老舊的封裝廠即可。現在他手上有 10 座先進封裝廠。

技術數字如下:

  • 2026 年成功量產 5.5 倍光罩尺寸的 CoWoS 封裝,良率穩定維持 98% 以上,部分客戶產品達到 99%
  • 2029 年預期推進至 14 倍光罩尺寸以上
  • SoIC 透過混合鍵合提供超過 50 倍互連密度與 5 倍能源效率,2025 年進入 6 微米間距,2029 年進一步推進到 4.5 微米
  • 過去三年 CoWoS 產能幾乎每年翻倍,供應能力正逐漸接近客戶需求

麻煩也隨尺寸放大。封裝變大之後任何微小缺陷對良率的影響都會被放大,不同熱膨脹係數與機械特性的材料放在一起,應力梯度與翹曲問題日趨嚴峻。何軍另外點名記憶體與 ABF 基板短缺,說晶圓代工廠必須增加供應鏈多樣性,但這又帶來材料不匹配。

擴產在同一天有實體進度。日月光投控旗下的矽品精密 11 日在雲林斗六動土,投資近千億元、開發面積 6 公頃,預計導入 CoWoS 先進封裝製程。2028 年第一期啟用可先帶來 1,300 個就業機會,滿載超過 2,200 個。前一座虎尾廠是 2022 年 11 月動土、2025 年 9 月啟用。矽品近兩年擴廠總投資約 2,000 億元,新增員工超過 8,000 人。

需求端也有新數字。The Information 引述知情人士報導,微軟計劃最快 9 月發表新一代 AI 晶片 Maia 300,並已與台積電洽談保有明年出貨 30 多萬顆的產能。微軟 2023 年 11 月就推出過 Maia,但在提升至大規模生產上持續落後同業,目的是降低對輝達處理器的依賴。這次它想把產量拉上來,說服 Anthropic 這類重大雲端客戶採用。微軟未回覆置評請求。

LTX 2.5 上線,社群評價分成兩派

LTX 2.5 釋出後,社群測完的結論分成很明確的兩邊。

肯定那派給的是具體數字與相容性。4080 上 5 秒 1080p 影片跑 226 秒;3060 搭 16GB 記憶體,0.5mp 的 10 秒影片耗時 180 秒。先前的 nodes 與 lora 完全相容,用舊工作流的人不用重建。聲音明顯改善,不再未經提示就自動配上糟糕的配樂,lip sync 也乾淨。prompt adherence 提升,角色神秘消失、環境不一致的情況變少。

否定那派的說法更簡短:拿 2.3 和 2.5 生成的兩段影片並排,幾乎看不出差別。

有意思的是同一位給正評的使用者,也把 LTX 2.5 的弱點講得很白。他認為在 prompt adherence、一致性、物理與整體肢體動作上,LTX 2.5 明顯低於 MiniMax H3。但 H3 的問題在寫實人臉,它做電視劇風格的片段很強,碰到寫實影像卻會破壞細節,而且要壓下這個毛病得跑到 2mp,那樣一段 5 秒片段就要 5 到 7 分鐘,即使掛了 turbo lora 與加速節點也一樣。

他給的用法是兩個模型分工:長而簡單、互動不多的鏡頭交給 LTX,需要打鬥或大量物理的交給 H3。

明日值得追的事
  • → Irregular 會不會對外說明那個共用評測環境的配置問題到底是什麼
  • → AI Kill Switch Act 的兩道門檻由 CISA 在法案生效後 90 天內設定,看它會落在哪
  • → Anthropic 承諾的第三方浮水印偵測工具什麼時候放出來