8 個 AI 代理四天摸清 21 個政府系統,被擋下時它們自己去找新方法
以色列資安公司 Dream Security 揭露一起針對台灣政府機關的自主 AI 代理攻擊,數發部證實七月已偵測到。同日 Mozilla 報告指出,AI 代理的寫入權限仍沒有跨框架標準。
今天最該讀完的一則,主詞不是人。
8 個 AI 代理在四天內把台灣政府系統摸了一遍
以色列資安新創 Dream Security 揭露一起針對台灣政府機關的網路攻擊,執行者是一套自己會做決定的 AI 代理框架。這家公司由 NSO Group 共同創辦人 Shalev Hulio、奧地利前總理 Sebastian Kurz 與 Wayout Group 創辦人 Gil Dolev 共同成立。
研究人員說,攻擊者用 Hermes 和 OpenClaw 這兩套公開可取得的工具,搭出一個自主的駭客框架。攻擊發生在 7 月 1 日到 7 月 4 日之間。
- 框架同時最多派出 8 個自主 AI 代理,分工搜尋目標、挖掘漏洞
- 探查 21 個政府系統的網路架構
- 入侵至少 85 個政府使用者帳號,取得逾 2,500 筆人事資料
- 之後把範圍擴大到核能安全主管機關、政府 IT 供應鏈廠商、政府郵件系統,以及至少 7 家能源公司
- 原定手法失敗時,它會派代理上網收集資料,自己擬一套新的攻擊方法
比較難處理的是它怎麼繞過模型的安全防護。攻擊者把整套行動偽裝成取得授權的系統漏洞測試,模型看到的是一份合法的滲透測試工單,不是入侵。
Dream 首席策略長 Amir Becker 曾任以色列 8200 部隊的網路作戰負責人。他說過去從未在政府目標上見過這種「端對端自主攻擊」,各國政府現在必須把「自己持續遭受網路攻擊」當成基本假設。
歸屬方面,Dream 沒有點名特定團體。研究人員指出,與這起行動有關的內部通訊使用簡體中文;從攻擊目標取得的資料則以繁體中文撰寫,這種文字形式通常只見於台灣、香港和澳門的政府網站。
數發部資安署 8 月 13 日發布新聞稿,時間軸比外界知道的早。資安監控單位 7 月就發現這波針對政府機關的異常攻擊,7 月 20 日起由國家資通安全研究院陸續發布警訊並啟動調查,目前攻擊來源、手法與影響範圍都已完成調查,受影響單位陸續處理完成。
資安署對這類攻擊的描述是速度快、成本低、規模大。AI 代理能快速串聯多種攻擊手法,並且擅長拿備援、測試這類次要系統當跳板,那些系統平常沒什麼人盯著。
數發部發言人講的是雙重挑戰:攻擊行動趨於自動化,而 AI 代理程式本身也成為新的漏洞。
台灣國安局今年 1 月的報告寫過,台灣 2025 年平均每天遭受 260 萬次來自中國的網路攻擊,比前一年增加 6%。數發部說會依這次掌握的攻擊特徵,繼續監控是否存在其他潛在攻擊路徑。
代理已經會做事,能做什麼還沒人說得清
Mozilla 發布首份《The State of Open Source AI》報告,裡面有一句判斷跟上面那起攻擊接得很緊:AI 產業的競爭正從模型本身,轉向上層的「AI 代理執行框架」(agentic harness)。
模型能力差距縮小、推論成本持續下降之後,模型逐漸變成可替換的基礎元件。真正決定一個代理能拿到哪些資料、記得什麼、執行哪些操作的,是負責協調工具、記憶、沙箱與權限控管的那一層。
Mozilla 把它類比成網頁架構裡的 user agent。生態系已經長出 LangGraph、CrewAI 這類工作流程工具,以及模型脈絡協定(MCP)與 Agent2Agent(A2A)這類互通協定。
- MCP 伺服器已超過 1 萬個
- SDK 每月下載量約 9,700 萬次
- 跨 MCP、A2A、直接工具呼叫與不同代理框架都適用的共通權限模型,還不存在
問題集中在寫入操作。Mozilla 把代理執行的動作分成讀取與寫入兩類:讀文件、查資料庫、列行事曆風險低,重複執行也安全;傳送訊息、動用預算、修改資料、執行交易則可能造成額外成本,或帶來難以逆轉的後果。
協定層已經補了一部分。MCP 的 2025 年 11 月規格採 OAuth 2.1 處理授權,A2A v1.0 把經數位簽章簽署的 Agent Card 標準化,用於代理身分驗證。這兩件事解決的是「你是誰」,不是「你能改什麼」。
靠人工按確認也補不上。報告引用 AI 安全聯盟(CoSAI)的 MCP 威脅模型指出,使用者面對大量權限確認要求時會產生同意疲勞,逐漸習慣直接批准。Mozilla 給的數字是,使用者批准 AI 代理請求的比例最高可達 93%。
企業端的處理方式開始往「把代理當員工管」走。每個正式投入營運的代理要有獨立且可驗證的身分,包含唯一識別碼、明確負責人、業務目的、可用工具、資料範圍,以及允許執行的動作。
權限則改成任務導向。代理不長期持有完整權限,而是在特定情境取得短期、可撤銷的憑證,任務結束即失效。稽核紀錄要同時保留兩個身分:哪位人類發起或批准任務、哪個代理實際執行。
沒有定期重新認證的話,公司裡會累積一批「孤兒代理」,散落在各平台,比離職員工沒停用的帳號更難被發現。
能力這一側的數字已經追上來了。在 OSWorld-Verified 這項讓代理在 Windows、macOS 與 Ubuntu 桌面上實際操作的測試裡,頂尖模型的任務完成率一年內從 42% 上升到 85%,超過人類測試者平均的 72%。
a16z 提醒的是同一個 85%:一百個任務裡有十五個以失敗告終。會操作電腦,跟能可靠地把工作做完,是兩件事。
規模化的例子倒是已經有了。一家消費品數據平台每月透過自動化完成約 1,500 萬至 2,000 萬次入口網站操作,把 AI 代理當成傳統網頁爬蟲的故障修護備援:零售商改版導致爬蟲出錯時,代理自主診斷並搶修,工程師還沒發現,資料就恢復流動。導入之後,專門維護爬蟲的工程團隊縮減一半。
Grok 4.6 和 DeepSeek V4 Pro 押在同一個地方
xAI 在美國時間 8 月 12 日發表 Grok 4.6,距離 Grok 4.5 問世還不到一個月。官方把它定位成 Grok 4.5 的延伸,重點放在長時間運行的 agent,以及更有企圖心的互動與視覺工作。
Artificial Analysis 的綜合智慧指數給 61 分(high 推理檔),與 GPT-5.6 Sol 的 max 檔同分,落在 Claude Opus 5 的 63 分與 Claude Fable 5 的 62 分之後,比 Grok 4.5 的 56 分進步 5 分。
真正對得上「長時間運行」這個定位的是另外幾組數字:
- 偏真實職場工作的 GDPval-AA v2,Grok 4.6 以 Elo 1753 排在 Claude Opus 5 之後
- 終端機操作實測 Terminal-Bench v2.1 為 88.4%
- 銀行客服情境 τ³-Banking 為 50.7%,位居前兩名
- 長時程知識工作 AA-Briefcase 平均約 53 輪來回解完任務,Claude Opus 5 的 max 檔平均約需 103 輪
官方公告另外提到,在較長的任務軌跡上,模型會出現更多自我測試與驗證行為,先檢查自己的成果再往下一步走。
價格這邊有一個容易看漏的地方。標準費率跟前代相同,每百萬輸入 token 2 美元、輸出 6 美元;漲的是快取輸入,短文本從 0.3 美元升到 0.5 美元,長文本從 0.6 美元升到 1 美元,都是前代的 1.7 倍左右。快取正是多輪對話與長時間 agent 壓低成本的主要手段,這一漲剛好打在它主打的用法上。
首週雙倍用量的範圍也要看清楚。官方原文寫的是 Grok Build 與 Cursor 內含額度加倍,API、grok.com 與訂閱方案都不在內。Grok 4.5 當初就是跟 Cursor 合作推出的。
同一天 DeepSeek 把 V4 Pro 正式版(DeepSeek-V4-Pro-0813)放上 OpenRouter,官方回報的進步幅度同樣集中在 agent 類測試:
- DeepSWE 62.7,比預覽版高 49.9
- CyberGym 83.3,高 30.6
- NL2Repo 61.5,高 23.0
- Terminal Bench 2.1 87.9,高 15.8
定價是每百萬輸入 0.435 美元、輸出 0.87 美元。同期 Fable 5 的效能平均高出 5.3%,價格則高 45 倍。
馬斯克 8 月 12 日向員工簡報時說,到了 9 月,AI 營收「很有機會超越 SpaceX 其他所有業務的營收」,其中很大一部分可能來自向 Alphabet 及 Anthropic 等公司提供算力的合作協議。
輝達走的是第三條路,讓系統當路由器、按任務難度把請求分給不同大小的模型,昨天寫過那套 NeMo Switchyard。三家的做法不同,要解的是同一筆帳:agent 一跑就是幾十輪,每一輪都要付錢。
白宮的發布前測試可能延伸到開放模型
白宮本月宣布制定 AI 框架,要求美國 AI 實驗室開發的高階模型在公開發布前接受聯邦政府的安全測試。框架內容目前還沒公布,適用範圍也只涵蓋 Anthropic、OpenAI 這類公司的封閉模型。
一名白宮官員透露,未來幾個月可能把開放模型也納進來。門檻是能力:只要開放模型達到 Anthropic Mythos 系列或 OpenAI GPT-5.6 這種前沿水準,就必須在發布前接受安全測試。
推動這件事的直接原因是 Mythos。Anthropic 今年 4 月因為擔心該模型的能力可能被用來入侵 IT 與金融系統,決定暫緩公開發布,這件事讓原本較寬鬆的政策方向轉向加強政府監督。
官員自己也擔心副作用。如果只有封閉模型拿得到政府的安全認證,企業會不敢採用沒有認證的開放模型,即使開放模型成本更低;再往下推,美國企業投入開放模型開發的意願也會被削弱。安全測試若需要長達 30 天,發布節奏還會被拖慢。
Mozilla 的報告剛好給了這場政策討論一組背景數字。
- 頂尖開放權重模型與封閉模型的能力差距已縮小至約 3%
- 大中華地區與東亞的開放模型採用率都達到 89%
- 已有 47 個國家限制部分關鍵工作負載交由境外處理
- 阿里巴巴 Qwen 模型在 Hugging Face 累計下載量達 9.42 億次,約為 Meta Llama 的兩倍
- 2026 年 4 月,中國開放權重模型占 OpenRouter 每週 token 流量超過 45%
開放權重被各國看上的理由很實際:模型一旦公開並被下載,供應商就沒辦法像雲端服務那樣停掉存取。DeepSeek 的託管服務目前在至少 8 個司法管轄區受到限制,但企業仍可自行部署它的模型權重。
歐盟走的是自己蓋一套。InvestAI 計畫將動用 2,000 億歐元投資,其中 200 億歐元公共資金用於興建 4 至 5 座 AI 超級工廠,另外直接資助支援 24 種歐盟官方語言的 EUROPA 開放模型。
美方同一時間在管晶片的另一個出口。中國 AI 企業買不到硬體,但可以在海外伺服器租用運算時間,這條路技術上不違法。商務部工業安全局 5 月下旬的報告已經釐清,不論實體硬體位於何處,只要企業總部設於中國或由中國母公司控制,都適用許可證限制,涵蓋 Blackwell 和 Rubin 世代處理器以及超微的 MI350X。
執法難度不一樣。攔實體貨物在邊境就能做,離岸租用要追的是算力的實際控制者與受益人,而複雜的企業股權結構往往就是為了隱匿這條所有權鏈。
政策拉鋸也還沒停。川普政府 2025 年 5 月廢除了一套更具約束力的許可架構,12 月又在限定出口上限與第三方安全測試等條件下,核准向中國銷售輝達 H200。黃仁勳持續公開爭取進入中國市場的機會,理由是限制無法減緩中國的 AI 進展,反而會把市場讓給華為這類本土晶片製造商。
供應鏈那一側則在加碼。美國國務院要在巴拿馬建一個試行平台,投入多達 5,000 萬美元外援資金,加速盟友之間 AI 基礎設施、半導體與關鍵礦物的貿易與物流。這是「矽盛世」(Pax Silica)倡議的一環,參與方約 20 多個,包括歐盟、英國、印度及阿拉伯聯合大公國。經濟事務次卿海柏格說,計畫重點是讓參與經濟體能追蹤並加速來自可信賴供應商的高價值貨物運送。
Pixel 11 把 Gemini 從功能變成操作方式
Google 8 月 13 日發表 Pixel 11、Pixel 11 Pro、Pixel 11 Pro XL 與折疊機 Pixel 11 Pro Fold,四款同步開放預購,8 月 20 日到貨。
- 台灣售價依序是 29,990 元、36,990 元、42,990 元與 60,990 元起
- 美國起價為 899、1,099、1,299 與 1,899 美元
- 全系列儲存容量從 256GB 起跳,Pro 系列另附六個月 Google AI Pro 訂閱
- 美國四款機型的最低起價,都比 Pixel 10 系列高了 100 美元
晶片端的升級大多為了同一件事。Tensor G6 採台積電最新改良型 3 奈米製程,App 啟動快 15%、網頁瀏覽快 25%、能源效率改善 20%;AI 運算單元算力增加 50%,搭配新版 Gemini Nano 之後,端側 AI 任務快 3.5 倍、耗電少 3.5 倍。通訊數據機換上聯發科,安全性交給新的 Titan M3 晶片,導入可抵抗未來量子電腦破解的加密技術,全系列提供七年更新。
把 AI 塞進手機而不讓電池崩潰,是上面這些數字要處理的前提。
Gemini Intelligence 才是這一代押注最重的地方,變化是從回答問題走向代替使用者做事:訂雜貨、叫車、買咖啡,甚至代打電話向店家訂位,過程可以隨時接手中止,也能查看 AI 通話的逐字紀錄。
可用性的限制要一起看。這些代理式任務先開放給美國使用者,Gemini Intelligence 其餘多項功能標示僅支援特定國家與語言,部分需滿 18 歲或需訂閱才有較高額度,還有功能停在 Preview 階段。台灣能用到多少,要看 Google 後續的地區開通進度。
相機是硬體側改最多的部分。基本款換上全新 4,800 萬像素主鏡頭感光元件,進光量提升 56%,5 倍望遠支援的超級變焦從 20 倍拉到 30 倍;Pro 系列望遠鏡頭升級為 4,800 萬像素、進光量增加 30%,變焦上限從 100 倍拉到 120 倍,人像模式首次支援 5 倍。一鍵抓拍輕觸一次,由裝置端 AI 與 Gemini 模型即時分析約 400 幀畫面,挑出最清晰的那一張,並同步給一段動態影片。
折疊機是這代最尷尬的一台。Pixel 11 Pro Fold 減重到 239 公克、折疊狀態厚度 10.1mm,耐用度提升 3 倍,但電池容量從 5,015mAh 縮到 4,806mAh,變焦上限只到 30 倍,沒有拿到 120 倍 Pro Zoom 與新的望遠感光元件。花最多錢,買到的相機規格最不完整。
還有一筆容易被忽略:Pixel 11 Pro 與 Pro XL 的 256GB 版本標配 12GB 記憶體,要 16GB 得升級到 512GB 或 1TB。去年 Pixel 10 Pro 與 Pro XL 是全線統一 16GB。
同一天 Google 在東京表參道開了美國以外第一家直營店,橫跨地下一樓至二樓共三層。一樓可以試用 HiLight 與 Gemini Intelligence,二樓有讓顧客透過 AI 分析自拍照生成分身的裝置,地下樓層負責維修與售後支援。
大規模失業沒來,先不見的是加薪
兩份研究先後指向同一個地方:AI 對就業總量的影響還很有限,先被壓到的是薪資與新職缺。
Apollo Global Management 的白皮書分析美國 321 種職業,把勞工統計局的薪資與就業數據,跟 Anthropic 衡量各職業 AI 使用程度的資料合在一起看。結果是高 AI 曝險職業的實質薪資成長落後低曝險職業約 6.7%,但就業人數沒有明顯下降。
個別職業的落差更清楚。電腦程式設計師約 75% 的工作任務高度暴露於 AI,2022 到 2024 年間實質薪資下降 6.1%;統計助理下降 5.4%。
反方向的例子同樣存在,而且提醒了這件事不能全算在 AI 頭上。廣播播音員與電台 DJ 的 AI 曝險程度不高,實質薪資卻在兩年間暴跌 52%;個人理財顧問約三分之一工作涉及 AI,薪資反而增加 8.4%;行政法官、裁決員與聽證官約 30% 的任務涉及 AI,同期薪資上升 17.5%。
衝擊的分布也不平均。自 2023 年以來,收入最低 25% 勞工的薪資成長下降 10.7%,服務業從業人員下降 24.3%;收入最高四分之一則沒有出現明顯影響。
賓州大學經濟學家的模型給了一個形狀:駝峰。自動化初期,AI 與人類互補、提高生產力,薪資會先上升;等 AI 逐漸接管更多原本由人類完成的認知工作,人類勞動的稀缺性下降,薪資可能觸頂並轉為下滑。模型的基準情境是約 37% 的智慧型任務被自動化時開始回落,Marinescu 估計目前已超過 14%。
史丹佛團隊看的是年齡。更新版的《Canaries in the Coal Mine?》由 Erik Brynjolfsson、Bharat Chandar 與 Ruyu Chen 撰寫,資料來自 ADP 薪資數據與美國勞工統計局就業資料。22 到 25 歲、身處高 AI 曝險職業的勞工,與較不曝險同儕的就業差距已擴大到 19%,主要原因是雇主減少招募,而不是大量解僱。
研究團隊的另一種分法比年齡更值得看。依賴明文化知識的職業,也就是可透過教育、教科書或書面流程傳授的標準化知識,年輕勞工的就業出現下滑;依賴默會知識的職業,也就是靠實作、師徒傳承與反覆接觸真實情境累積的經驗,資深員工的就業反而增加。生成式 AI 特別擅長複製已經被文字與數位資訊編碼過的那一種。
以 ADP 樣本來看,2022 年 11 月到 2026 年 6 月,整體就業約成長 6%,AI 曝險最高的五分之一職業只成長約 4%。
網路流量裡,人類已經是少數
Cloudflare 統計,2026 年 AI 代理程式貢獻超過 57% 的網路流量,人類約 42%,機器活動首度超越人類。執行長 Matthew Prince 的說法是,相對於代理程式與機器人,人類在網路將只是誤差值。
這件事直接衝擊的是內容跟流量之間那筆舊交易:網站開放爬蟲索引,搜尋引擎把讀者導回網站。Prince 指出,Google 爬蟲看到的網頁量是 OpenAI 的 3.2 倍、微軟的 4.8 倍,而 Google 把搜尋與 AI 抓取綁在同一支爬蟲上,出版商要擋 AI 摘要就得連搜尋流量一起放棄。
英國大型報業集團 Reach 表示,來自 Google 的推薦流量已經腰斬,AI 摘要是原因之一。
美國反托拉斯訴訟揭露的內部簡報顯示,Google 在 2024 年 4 月推出 AI 摘要前,曾經考慮讓網站選擇不讓內容用於 AI 功能、同時保留搜尋曝光,最後因為這塊「正演變為變現空間」而作罷。
反擊有兩條線在推。Cloudflare 已對 Google 下最後通牒,自 9 月 15 日起預設替以廣告收入為主的客戶封鎖混用型爬蟲;英國競爭與市場管理局 6 月要求 Google 給網站業者明確選項,可以拒絕內容用於 AI 搜尋功能、同時保留傳統搜尋曝光,而且不得藉調降排名報復。
Google 發言人證實正在測試新設定,讓網站在不影響搜尋排名的情況下退出 AI 摘要,英國測試完成後推向全球。爬蟲本身還沒分家,Google 也仍握有約九成搜尋市占。
蘋果選的是付錢那條路。公司正與多家出版商洽談複數年的內容授權合作,要讓預計今年稍晚開放 beta 測試的 AI 版 Siri 取得即時新聞與資訊。整體預算討論過九位數美元,付費方式是變動式補償,依 Siri 實際使用內容的情況支付,而不是一次授權後由平台廣泛運用。
蘋果今年 6 月發表新一代 Siri AI,主打理解個人情境、操作不同應用程式,並透過網路取得最新資訊。它先前曾因為內容出錯,暫停過新聞與娛樂 App 的 AI 通知摘要。
如果變動式補償真的談成,出版商的收入會跟內容被 AI 使用的頻率連動,跟 Cloudflare 想擋掉的那種免費抓取,剛好是兩種相反的解法。
其他值得記一下的
Signal 上線自動金鑰驗證。導入金鑰透明度機制,讓應用程式持續比對電話號碼、使用者名稱與公開金鑰之間的變更紀錄,使用者不必再當面掃 QR Code 人工核對。Cloudflare 與資安公司 Trail of Bits 擔任獨立稽核方。限制講得也清楚:這只能確認識別資訊與金鑰的對應紀錄是否一致,不能證明帳號目前實際由誰控制。
Unsloth Desktop 開放測試。可以在 macOS、Windows 與 Linux 上直接執行與訓練模型,並透過 Unsloth Start 把 Claude Code 或 Codex 接到本機模型,或只把部分工作交給本機模型當子代理。官方說訓練速度在部分情況下可提高至 2 倍,顯示記憶體需求最多減少 70%。
Spotify 推出 Xirp 測試版。它本身不提供新模型,而是搭配 Claude Code、Codex 與 Gemini 的工作環境,從開發者平台 Portal 取得公司內部的服務、負責團隊、相依關係與架構決策,讓 AI 改程式時知道會影響哪些上下游服務。目前僅支援 macOS。
Skill 已經是跨平台格式。Anthropic 2025 年 10 月推出 Agent Skills,同年 12 月將其發展為跨平台的開放標準,OpenAI 已在 ChatGPT 與 Codex 導入,Google 則提供 Gemini CLI 的官方教學。格式可以通用,執行結果不會一樣,同一份 SOP 在不同模型手上,對觸發條件與例外狀況的理解仍有差異。
思覺失調症的遺傳圖譜補上了大半。刊登於《Nature Genetics》的研究分析超過 10 萬 2,000 人的基因資料,結合來自數百名捐贈者、涵蓋六個腦區的腦組織樣本,用 AI 重建人腦中數千個基因的協同活動,找出 766 個相關基因,其中 641 個未曾出現在先前的轉錄體分析中。世界衛生組織估計全球約有 2,300 萬人罹患這個疾病。
開源創作模型佔滿了社群討論。MiniMax Music 3 與 MiniMax H3 影片模型這幾天在 ComfyUI 社群刷版,多篇貼文直接寫著要退掉 Suno 訂閱,LTX 2.5 則被拿來測連續鏡頭與生成速度。討論的共同點是本地硬體跑得動,話題集中在顯示記憶體、步數與工作流怎麼串接。
- → 數發部說會依這波攻擊的特徵繼續檢查是否還有其他潛在攻擊路徑,這部分會不會對外說明
- → 白宮那套發布前測試框架的內容何時公布,開放模型是否真的被納入
- → Cloudflare 9 月 15 日的封鎖期限到之前,Google 的退出 AI 摘要設定能不能推出英國以外
攻擊方已經把整條流程交給代理自己跑,防守方還在討論代理該不該有權自己按下寫入。如果權限標準比下一輪攻擊晚到,中間這段落差只會愈拉愈長。