蘋果把 Mac mini 改成常駐 AI 代理機。記憶體漲價讓它再貴 100 美元。
Mac mini 導入 M6、Mac Studio 導入 M5 Ultra,兩款都以本機跑 AI 為訴求。同一天 Perplexity 把 agent 的排程器與工具路由搬進 DGX Spark,OpenAI 第一代自研晶片 Jalapeño 交出每瓦贏過 GB200 的實測。
今天的新聞有一半在講同一件事:AI 的運算位置正在往使用者的桌上移。蘋果改款 Mac mini 與 Mac Studio,兩款的主訴求都寫成 AI;Perplexity 把 agent 的整套執行元件搬進 NVIDIA 的桌上型機器;Reddit 上一整天在量 8GB 顯卡跑不跑得動新的影片模型。另外一半在講這件事的代價,記憶體價格把蘋果的售價往上推,雲端業者的自由現金流轉負。
蘋果把桌機當成 AI 代理機在賣
蘋果 8/25 同步更新 Mac mini 與 Mac Studio,兩款的改版說法都以 AI 效能為核心。Mac mini 導入 M6 與 M5 Pro,主打「常駐式代理運算」(Always-on Agentic Computing);Mac Studio 導入 M5 Max 與 M5 Ultra,主打在本機端執行前沿級大型模型。
規格攤開來看,這次的重點放在記憶體頻寬與神經加速器,不在核心數:
- M6 為 12 核心 CPU 與 12 核心 GPU,較前代 M4 各增加 2 核心,首度在 Mac mini 導入神經加速器,AI 效能最高提升 4 倍、繪圖 2 倍、CPU 40%
- M5 Pro 最高 18 核心 CPU、20 核心 GPU,支援最高 64GB 統一記憶體,頻寬最高 307GB/s,具備 Thunderbolt 5 可串連多臺主機
- M5 Max 為 18 核心 CPU、最高 40 核心 GPU,AI 效能最高提升 3.9 倍,統一記憶體最高 128GB、頻寬 614GB/s
- M5 Ultra 最高 36 核心 CPU、80 核心 GPU,統一記憶體最高 512GB、頻寬達 1.2TB/s,AI 運算效能較 M3 Ultra 最高提升 4.3 倍,較初代 M1 Ultra 提升 9.8 倍
比單機規格更值得記下的是串連。M5 Ultra 版 Mac Studio 支援透過 RDMA 技術串接多臺主機,蘋果宣稱 4 臺組成的叢集,AI 推論效能可達單機 3 倍。這個數字說明蘋果對這條產品線的定位已經不是桌機,是可以疊起來用的推論節點。
需求端的證據比產品發表更早出現。MacStadium 委託 Censuswide 在 2025 年 8 月調查 300 位美國企業 CIO,在已採用 Mac 的企業中,AI 處理是最普遍用途、比例達 73%,超過 App 開發的 68% 與建置測試部署的 61%,9 成 CIO 表示蘋果自研晶片影響其採用或擴大導入的決策。Tim Cook 在 2026 財年第二季財報會議上也說過,Mac mini 和 Mac Studio 已成為 AI 與代理工具的熱門平臺,熱門到供貨吃緊。
蘋果通常在每年 10 月左右更新 Mac mini、3 月發表 Mac Studio。這次提前,官方說法是 AI 帶動的需求超乎預期,再加上記憶體晶片短缺打亂節奏。
價格是這則新聞裡最誠實的部分。M6 版 Mac mini 起價 899 美元,M5 Pro 版 1,699 美元。上一代 M4 版 2024 年 10 月發表時是 599 美元,今年 6 月因記憶體漲價調到 799 美元,這次再漲 100 美元;M4 Pro 從 1,399 漲到 1,599,這次同樣再漲 100。Mac Studio 那邊更明顯,M3 Ultra 原價 3,999 美元,6 月調到 5,299 美元,同規格的 M5 Ultra 版再漲 200 美元到 5,499。
Perplexity 把 agent 的執行架構整套搬進本機
Perplexity 8/25 與 NVIDIA 推出 Portable Computer,名字聽起來像硬體,實際上是 Perplexity Computer 的完全本機版本。首波支援 DGX Spark 的 Linux 環境,Windows 版與搭載 RTX GPU 的桌機工作站支援預告即將推出,目前開放 Pro 與 Max 訂閱方案用戶使用。
它跟「把一個大型語言模型下載到電腦裡」的差別在於搬了什麼。協調器(orchestrator)、規畫器(planner)、工具路由器(tool router)、排程器(scheduler)、持久化任務佇列(durable task queue)與本機搜尋索引,這些元件全部在裝置端執行。模型本身可搭 Qwen 3.8 27B 或 Perplexity 自家的 PPLX 27B,後者是以 Qwen 模型後訓練的版本,Nemotron 3.5 Lightning 30B 很快會加入。
會做這件事的原因寫在計費方式裡。agent 跟一問一答的聊天機器人不同,為了完成一項工作可能持續規劃任務、讀取文件、搜尋資料、呼叫工具,再反覆檢查結果。工作時間從幾秒拉長到數十分鐘,模型呼叫次數跟著往上疊。Portable Computer 的規則是本機模型處理的工作不消耗 Perplexity credits,只有需要最新資訊、瀏覽器、串接 App 或較進階推理時,才由本機協調器把任務轉交雲端;如果任務需要把裝置上的內容送出去,系統會先要求使用者核准。
Perplexity 給的使用情境很具體:Portable Computer 可以在本機根據 Gmail 收到的夜間臭蟲報告,協助分類新的 GitHub 問題,並在早上透過 Slack 通知前三項主要問題與建議負責人。目前可串接的是 Google Drive、Gmail、Slack 與 GitHub。聽寫模式用 Nemotron 3.5 ASR 在本機處理語音,語音轉錄與檔案操作都留在裝置上。
安全機制的說法是與雲端版同等級,程式碼與工具在隔離沙箱執行,並限制對檔案及已連結 App 的存取。
本地跑得動什麼,社群這兩天在量
廠商說本機跑得動,社群這兩天在做的是驗證跑得動到什麼程度。
影片模型那邊,有人把 MiniMax H3 的 FL2VA BF16 完整權重拿去實測 1376×768、243 幀(24fps 約 10.1 秒),diffusion block 比 idle 多用約 5.8 到 6.3 GiB。在桌面本身吃掉約 1.15 GiB 的 Windows RTX 4070 系統上,全 GPU 峰值約 7.0 到 7.4 GiB,換句話說 8GB 卡在好幾種配置下是可行的。預設 Comfy attention 峰值 6.99 GiB,Sparse Kitchen INT8 是 7.40 GiB。
工具鏈的更新速度跟上了這個節奏。ComfyUI Portable 已更新到 v0.34.0,新增在任意幀錨定影像與音訊 guide 的節點、支援 MiniMax H3 的 per-token 影音 latent noise mask、支援 prompt embeddings 做爆炸這類特效,也補上先前遺漏的特殊 token 修好對話標籤。
文字模型那邊,有人在單張 RX 7900 XTX(Windows 11、ROCm/HIP 7.2、Qwen3.8-27B Q4_0、16,384 context)上從 36 tok/s 起步,做完投機解碼週期剖析與 RDNA3 verifier 調校後,寫程式情境跑到 106.9 tok/s、agentic edit 跑到 120.7 tok/s,對照組的 Vulkan MTP 是 104.5 與 117.7。另一頭有人用 llama.cpp 把 Qwen 3.8 Flash Next 移植到 12GB RAM 的 Android 手機上,約 2 tokens/s,作者自己說離目標還遠,但在中階手機上跑這個尺寸的模型,前陣子還不太可想像。
硬體側的張力也很直接。有人反映 RTX 5080 的 16GB 已經是瓶頸,一個 27B Q4 模型大約 18GB 就放不下,問題出在 VRAM 不在算力。Asus GX10 在 Newegg 一天內從 3,999 美元跳到 4,999 美元,發文者說 15 分鐘內又改了兩次、回到 4,699 美元。
OpenAI 第一代自研晶片的實測數字
OpenAI 今年 6 月才正式揭露首款自研推論晶片 Jalapeño,8 月 25 日就公布第一批完整實測。在半導體研究機構 SemiAnalysis 的 InferenceX 測試中,Jalapeño 執行 GPT-OSS 120B、DeepSeek R1 670B 與 Kimi K2.5 1T 等模型時,尖峰每瓦工作量比 NVIDIA GB200/GB300 高出 1.5 至 1.9 倍,端到端延遲降低 1.7 至 3.6 倍。
會被特別點出來的原因是世代。SemiAnalysis 指出新晶片通常需要數代迭代才能建立有競爭力的軟硬體系統,而 Jalapeño 是 OpenAI 的第一代自研 ASIC,卻在其測過的 NVIDIA、AMD 與 Google 晶片中展現領先表現。OpenAI 的說法是這顆晶片不是為 GPT 特製,而是從 LLM 推論的需求重新設計。
同一週的另一則消息方向相反。負責 OpenAI 資料中心業務的主管 Chris Malone 已離職,公司證實了消息,但雙方都未說明原因。Malone 於 2025 年 3 月加入,當時 OpenAI 正與軟銀、甲骨文推動 Stargate 計畫。Stargate 初期進度不如預期後,OpenAI 一度較仰賴與雲端業者簽約取得運算資源,近期則重新推動部分自建案,包括承租整座資料中心設施。
離職發生在組織調整的時間點上。OpenAI 擴大基礎架構主管 Sachin Katti 的職掌後,Malone 與 Adrian Caulfield 共同負責資料中心技術工程與設計,7 月又升任 Uday Ruddarraju 為運算容量技術長。今年以來的主管異動還有產品主管 Kevin Weil 4 月離職、Fidji Simo 7 月因健康因素轉任兼職顧問、任職約 8 年的前營運長 Brad Lightcap 本月宣布離開。補進來的是兩週前延攬的 Wiz 總裁兼營運長 Dali Rajic,接任營收長。
擴容的動作沒有停。OpenAI 本月與軟銀旗下能源公司 SB Energy 簽署 20 年資料中心租約,NVIDIA 為這項交易提供最高 1,050 億美元財務保證,並另投資 SB Energy 15 億美元。相關設施位於俄亥俄州,規畫總容量最高 8GW,首批 800MW 預計 2028 年上線。
錢從哪裡來
Gartner 估 2026 年全球半導體營收將達 1.555 兆美元,較 2025 年的 8,090 億美元成長 92%,主要動力是 AI 基礎設施投資與高於預期的記憶體漲幅。
這筆錢的組成很偏:
- 記憶體營收預估由 2,201 億美元增至 8,373 億美元,佔全球半導體營收比重由 27% 升到 54%
- DRAM 營收成長 246.6%,NAND Flash 成長 371.9%
- 不含記憶體的半導體市場營收預估 7,179 億美元,年增 21.9%
- 換算下來,今年半導體多出來的營收裡,記憶體一項就吃掉八成以上
TrendForce 另估 DRAM 與 NAND 合計占主要雲端業者總資本支出的比重,將由今年 47% 提高到明年 68%,這個數字與昨天報告提到的一致。雲端業者今年資本支出預估年增 98%,明年再增加 50%。TrendForce 認為記憶體價格升高可能促使雲端業者調整伺服器的記憶體配置,包括降低單套系統容量、調整一般伺服器記憶體與高頻寬記憶體的用量,並評估採用把模型架構硬體化的 AI ASIC。
付這筆錢的四家公司帳面已經看得出壓力。亞馬遜、谷歌、微軟與 Meta 今年資本支出合計 7,540 億美元,較 2025 年的 3,795 億美元成長 98.7%。四家 2025 年獲利分別是亞馬遜 776.7 億、谷歌 1,321.7 億、微軟 1,018.32 億、Meta 604.58 億美元,合計 3,721.3 億美元,只達今年預計資本支出的 49.35%。谷歌今年第二季自由現金流為負 59 億美元,亞馬遜第二季由去年同期的正 182 億轉為負 76 億美元。
差額靠發債補。Meta 在 2025 年 10 月發行 300 億美元公司債,2026 年 5 月再發 250 億;甲骨文今年 2 月發行 250 億;Alphabet 2025 年 11 月發 175 億、今年 2 月再發 200 億並吸引千億美元認購,同時在歐洲發行英鎊與瑞士法郎債券約 110 億美元,8 月 20 日又在澳洲募集 55 億澳元;亞馬遜今年 3 月發行約 540 億美元投資等級公司債。高盛 8 月初估算,美國美元投資級債券今年迄今發行量已超過 1.5 兆美元,單筆平均 17 億美元,是金融海嘯之後最大的發債規模,其中大規模發債的公司約三分之二來自科技業。
資產負債表之外還有一層。華爾街日報揭露 Alphabet、Meta、微軟、亞馬遜、甲骨文、輝達、博通、SpaceX 與 AMD 九家公司,近期在證券文件附註中揭露的表外承諾合計約 3 兆美元,其中約 1.2 兆是未開始租約、約 1.9 兆是採購承諾。四家 CSP 的未開始租約合計 9,043 億美元,微軟 3,291 億與 Meta 3,470 億最高;採購承諾合計 1.519 兆美元,Alphabet 一家就 8,110 億。
機房供電要換一輪
單一算力機櫃的總功耗從 40kW 快速往 120kW 走,即將突破 1MW。NVIDIA 宣布從下一代 Vera Rubin 架構開始推動 800VDC 高壓直流架構。
問題出在轉換次數。傳統資料中心用 415V AC 配電,電力從電網進到晶片之前至少要經歷四到五次 AC/DC 轉換,在超高功耗下會產生數十千瓦廢熱,加重液冷系統負擔,電流也會飆到數千安培、排擠機櫃間空間並加重線路損耗。800VDC 的做法是在機房源頭或側邊電源櫃做單次轉換,直接把交流電轉為 800V 直流分配到各機櫃,再由伺服器主機板上的負載點模組把高壓降到晶片所需的 1V 以下。
省下來的東西可以量化:電力轉換損耗降低 5 到 8%,而 800V 直流架構省下的白區空間,可以多部署 15 到 20% 的算力機櫃。
換架構的連鎖反應落在功率半導體。傳統矽基元件在高壓高溫環境已不敷使用,高壓端要靠碳化矽把 800V 降到 48V,中低壓高頻端要靠氮化鎵把 48V 降到 0.8V。2027 年以後如果走向全直流資料中心、結合中壓固態變壓器直接把電網中壓轉為 800VDC,換的就是電網等級的設備。碳化矽這一段目前由歐美日的 IDM 大廠掌握高階產能,Wolfspeed 在基板磊晶市場長年有將近五成市佔,並擁有全球規模最大的八吋碳化矽晶圓廠。
被騙去做錯事的 AI
OWASP 為 AI Agent 列出的十大風險裡,排第一的那項不需要寫任何程式碼。
攻擊長這樣:一封供應商寄來的報價信,沒有惡意附件、沒有漏洞利用、沒有可疑連線。採購 agent 讀取郵件後,原本應該整理品項、比對庫存與產生採購摘要,卻因為郵件內容中藏了一段專門操縱 AI 的指示,開始查詢內部客戶資料,並透過合法郵件工具把摘要寄到外部信箱。OWASP 舉的實例是 EchoLeak,攻擊者寄出夾帶隱藏指令的郵件,Microsoft 365 Copilot 讀取後就自動把機密郵件與對話紀錄外傳,使用者從頭到尾沒有點過任何連結。
麻煩的地方在於每個單獨事件都合規。防火牆看到的是被允許的 HTTPS 流量,EDR 看到的是合法應用,IAM 看到的是有效權杖。真正被攻擊的是 agent 對任務的理解、行動計畫、工作記憶與工具呼叫邏輯。過去企業防的是沒有權限的人做不該做的事,現在還得防有權限的 AI 被騙去做不該做的事。
Gartner 從另一個角度指到同一件事。該機構預測到了 2029 年,多數隱私事件將不再源自個人識別資訊直接曝光,而是 AI 根據既有資料產生的推論所引發。即使資料看似無害或已經匿名化、彙整處理,AI 仍可能綜合線索推論出健康狀況與行為模式。這類推論攻擊還可能避開既有偵測機制,讓企業更難察覺問題。Gartner 估到 2028 年,企業投入資料完整性保護的支出將與資料機密性保護支出相當。
產出端的數字說明為什麼驗證變成瓶頸。截至 2026 年 5 月,Anthropic 合併進自家程式碼庫的程式碼超過八成由 Claude 撰寫完成,到第二季,一般工程師每天合併的程式碼量已是 2024 年的八倍。人工審查在這個量下會立刻塞住,Anthropic 的做法是把自動化的 Claude 審查員部署進持續整合與部署流程,事後分析顯示這層自動化攔截了約三分之一過去導致旗艦網站發生停機事故的正式環境錯誤。今年 4 月,一名工程師派 Claude 自主修復一類持續存在的 API 錯誤,模型完成超過 800 項個別修復,把錯誤率降低 1,000 倍,工程師估算同樣工作由人類完成得花四年。
人工核准這一關本身也有隱憂。工程師持續面對很少真正需要介入的請求時,會漸漸習慣直接核准,注意力隨之下降,真正的例外反而更難被察覺。有效的做法是降低送到人類眼前的審查量,常態且可逆的動作交給自動化控管放行,只有不尋常、不可逆或影響重大的決策才集中人力,並用拒絕率、審查時間與人類介入實際改變結果的頻率,去衡量監督機制本身的品質。
看一支影片就會做鬆餅
Skild AI 發表機器人基礎模型 S1,主打上下文學習,讓機器人看過操作示範就能執行新任務,不必重新訓練模型。
過去機器人學新動作,往往要先蒐集大量實際操作資料再針對特定任務訓練,面對沒學過的任務可能需要數十甚至數百小時的訓練資料。S1 的做法是讓機器人直接看影片學習如何完成任務,而不只依賴文字指令。模型在大量不同任務上預訓練後,能從影片示範中理解人類想完成的目標,判斷操作步驟與執行進度,再轉換成實際動作。
測試結果裡最有說服力的是任務長度。S1 能根據單一影片示範完成最長達 10 分鐘的任務,包括栽種盆栽、製作鬆餅、手沖咖啡與組裝工具套件,這些工作在預訓練階段從未出現。栽種盆栽那個案例,團隊晚上把土壤、花盆、澆水壺和植物送到辦公室,完成場景準備後錄製示範,從錄完到 S1 開始自主執行只花了 11 分鐘。
跟純語言提示的視覺動作模型比較,差距在同樣資料與運算資源下被拉開:預訓練資料增加到 10 萬小時後,語言提示模型的任務成功率約 9%,S1 是 66%。
同類方向不只一家。Generalist AI 本月發布的 GEN-1.5 同樣主打上下文學習,測試顯示機器人只需觀看 3 至 12 秒的示範,就能學會拉開鉛筆袋拉鍊、開罐這類操作。差別在於示範長度與任務跨度,GEN-1.5 目前以短時間操作為主,S1 強調的是複雜、長時間的任務。
如果本機推論的成本曲線繼續往下走,agent 的執行位置會愈來愈常落在使用者自己的機器上;如果記憶體價格把桌機的門檻推得比雲端訂閱還高,這條路會先在硬體那一端卡住。
- → Portable Computer 的 Windows 版與 RTX 桌機支援何時開放
- → OpenAI 資料中心主管的職務由誰接手,以及俄亥俄州 8GW 案的後續
- → Gartner 那份 2026 年半導體營收預估在下一季會不會被修正
本機跑 AI 這件事今天同時出現在三個位置:蘋果的產品定位、Perplexity 的架構選擇、社群的 VRAM 實測。三邊算的是同一筆帳,雲端推論每多跑一分鐘就多付一次錢,而桌機是一次性支出。