Fable 5 只拿走 11% 支出。輝達花 60 億美元買開放權重。
Ramp 從 7 萬家企業的帳單算出 Fable 5 只占 Anthropic 模型支出 11%,同一天 Claude 四款模型錯誤率升高。輝達 60 億美元收下 Poolside 補開放權重,美光揭露 Meta 訓練 Llama 3 有 17% 中斷來自 HBM 故障。
企業不買最貴的那顆模型,今天有了具體數字。支付業者 Ramp 從 7 萬家企業的帳單裡算出來,Anthropic 最強的 Fable 5 上線兩個多月,只拿走該公司模型支出的 11%。
同一天下午,Claude 四款模型的錯誤率一起升高,claude.ai 與 Claude Code 被列為部分中斷。輝達則在同一週花 60 億美元,把一支開放權重團隊整批收進 Nemotron 計畫。
Fable 5 上線兩個月,只拿走 11% 的支出
支付業者 Ramp 彙整 7 萬家企業的資料,替「企業到底在買哪一顆模型」給出了一個難看的答案。
- Fable 5 推出兩個多月,占 Anthropic 整體模型支出約 11%,成長已陷入停滯
- 拉近到過去一個月,Fable 5 只占這些企業向 Anthropic 購買 token 的 6%、費用的 11.4%
- 規模較小、價格較低的 Opus 5 在 7 月底推出後,企業支出已經超過 Fable 5
- OpenAI 7 月推出的 GPT-5.6 價格明顯低於 Fable 5,帶動 OpenAI 本季迄今年化營收成長 35%,來到逾 400 億美元
Fable 5 的開局並不順。6 月 9 日跟 Mythos 5 一起發表,推出 3 天後美國政府就要求限制外籍人士使用這兩款模型。Anthropic 無法即時驗證使用者國籍,乾脆把所有人的存取都停掉,直到 7 月 1 日才重新向全球開放。
供應恢復之後,熱度沒有跟著回來。
Accel 合夥人 Miles Clements 的說法是「多數人根本不需要站在最前沿」。舊一點、便宜一點的模型已經能處理大部分企業需求,最強的那一顆逐漸變成技術實力的招牌,而不是日常主力。
證明「最強不等於最常用」的另外一半,同一天由服務狀態頁提供。
台灣時間 8 月 24 日下午 1 點 06 分起,Claude Mythos 5、Fable 5、Opus 5 與 Opus 4.8 同步出現錯誤率升高。下午 1 點 27 分 Anthropic 表示已找到原因,3 點 47 分更新為 Opus 5 與 Fable 5 的錯誤已趨於穩定,事故仍未解除。
claude.ai、Claude API、Claude Code 與 Claude Cowork 四項服務同列部分中斷,只有 Claude Console 與 Claude for Government 維持正常。
痛的地方跟以前不一樣。聊天中斷了重問一次就好,這次受影響最深的是 Claude Code 與 Cowork 這類代理型產品。有使用者的流程已經跑了 9 小時,中途被打斷。
事故也不是孤例。8 月 12 日到 24 日之間 Anthropic 累計通報 13 起,其中 8 月 16 日的驗證系統異常讓使用者無法登入,8 月 14 日單日就有三起,包含狀態頁自己因為憑證問題連不上。
代理型工作流被打斷後要不要從頭重來,取決於它有沒有保存中間狀態,Claude Code 本身提供工作階段恢復與檢查點機制。以 API 串接的服務則建議把重試改成指數退避並設上限,避免在後端還沒恢復時繼續累積失敗請求。
輝達花 60 億美元,把開放權重那一塊補起來
輝達與 AI 新創 Poolside 談成的這筆交易,結構比一般收購複雜。
- 支付 60 億美元取得 Poolside 技術授權
- 另以 120 億美元的投前估值,對 Poolside 投資 10 億美元
- 100 多名員工加入輝達 2023 年啟動的 Nemotron 開放權重模型計畫
- 創辦人 Eiso Kant、Jason Warner 與營運主管 Margarida Garcia 都不加入輝達,繼續參與未具體說明的研究計畫
Poolside 創辦人在給股東的信裡寫,這筆交易是要確保未來的通用人工智慧「不會成為由少數人控制的封閉技術,而是能由眾人在開放環境中共同打造」。
輝達的動機直接一些。黃仁勳 7 月 24 日在 X 的第一篇貼文,發的就是一封題為〈開放權重與美國 AI 領導地位〉的信,主張美國能不能贏,判斷標準不在單一前沿模型,而在能不能建立深入各行各業的開放生態系。
布局今年 3 月就開始了。輝達當時成立 Nemotron Coalition,成員包括 Mistral、Thinking Machines Lab 與 Perplexity。聯盟裡另一家獲輝達資助的 Reflection AI 被投資人稱作西方版 DeepSeek,正在談以 250 億美元估值募集 25 億美元。
OpenAI 與 Anthropic 都是輝達最密切的晶片客戶。這筆交易之後,輝達會在開放權重這條線上跟他們正面對上。
要理解輝達為什麼急,可以看同一天公布的另一份調查。
日經旗下 NIKKEI Digital Governance 與美國 Weights & Biases 合作的生成式 AI 實力比較裡,月之暗面的 Kimi K3 綜合排名躍升到第六,分數超過 Google 與 SpaceX AI 的模型。單項來看,自主程式設計的軟體發展功能排第九,可靠性排第八。
弱點在另一邊。倫理觀項目 K3 只排第 33,判斷檔案內容是否適當的不當內容抑制排到第 70。性能追得上,防護沒跟上,被攻擊者惡意利用的風險排除不掉。
價格才是它真正的殺傷力。K3 的單位使用量收費約 GPT-5.6 Sol 的一半、Opus 5 的六成,而且允許蒸餾,第三方可以拿它去做小模型。同一份調查裡,Z.ai 的 GLM-5.2 排第 18、Minimax 的 M3 排第 28,走的都是開源商業模式。
DeepSeek 也在 8 月 21 日放出 V4-Flash-Vision-Exp,替旗艦純文字模型 V4-Flash 加上讀圖與螢幕截圖的能力。官方說法是純文字能力與正式版持平,多模態 agent 表現已接近 Claude Opus 4.8。
輝達自己的財報 26 日公布,第二季營收預估上看 920 億美元,高於年初預估的 780 億美元。它同時在洽談投資 Perplexity,這輪融資會讓 Perplexity 估值突破 300 億美元,該公司年化營收已從年初不到 2.5 億美元成長到超過 7.5 億美元。
訓練跑不完,有 17% 是記憶體壞掉
美光在 Hot Chips 2026 上丟出一個很硬的數字:Meta 訓練 Llama 3 的過程裡,17% 的非預期訓練中斷是 HBM 故障造成的。
差距是這樣拉開的。AI 運算晶片的算力大約每兩年成長 3 倍,同期間 HBM 頻寬的成長幅度不到 2 倍。處理器等資料的時間愈來愈長,往封裝裡塞更多 HBM 幾乎是唯一解。
代價寫在面積上。典型 GPU 系統單晶片封裝若採用 4 個 12 層 HBM 堆疊,記憶體矽晶片面積約占整個封裝總矽面積的 90%,相當於 GPU 矽晶片面積的 8 倍。
美光把痛點指向熱密度,不是總功耗。多數先進功能都整合在 HBM 底層的基礎晶圓,堆疊高度與活動頻率一起往上之後,那一層受熱最嚴重,可靠性問題最後就變成訓練中斷。
HBM4 的規格是通道數翻倍、I/O 速度提升兩倍、系統頻寬最高 2,800 GB/s,配上 2,000 個 I/O 連接埠。散熱端要靠液冷與混合鍵合,美光正在研發的融合鍵合能減少 DRAM 晶片之間的介電層數量,降低熱阻。
記憶體的另一頭,材料也在換人。
3D NAND 堆到約 300 層以上之後,用了很多年的鎢字線同時卡在三個地方:層數愈多字線愈細愈長,電阻墊高讓讀寫變慢;沉積用的六氟化鎢含氟,殘留的氟會侵蝕絕緣層造成漏電;300 層以上的結構又深又窄,鎢很難填到底,容易留下空洞。
鉬把這三件事一次處理掉。它的前驅體二氯二氧化鉬不含氟,科林研發指出鉬在奈米級線路的電阻率低於鎢,而且不需要額外的黏著層或阻擋層,多數情況電阻可以改善超過 50%。
鎧俠與威騰電子在 2024 年 VLSI 技術研討會發表的論文顯示,把填充品質調到最佳後,鉬字線的漏電失效率可以降到鎢的百分之一,同樣矽晶粒體積下位元密度提升 16.3% 以上。
進度已經拉開。三星的鉬字線產品 2024 年就進入量產,美光 2025 年用科林研發的 ALTUS Halo 設備大規模量產,層數領先的 SK 海力士計畫 2026 年底推出 375 層的鉬製程 NAND。SemiAnalysis 估計鉬在全球 NAND 產能的占比,會從 2025 年的中個位數百分比拉到 2027 年的約 30%。
換材料不會自動換來良率。同一篇論文也指出,鉬填充不良留下空洞時,殘留的氧原子一樣會擴散進絕緣層形成漏電通路。
電廠拉一條專線,或把節點掛到別人家外牆
台電董事長曾文生 23 日晚間談 AI 資料中心選址,給的方向是電廠直供。
他的說法很白:「我拉一個專線,專線由你自主管理」,距離、成本與時間由市場機制決定,最穩定的供電方式就是離電源愈近愈好。
這套做法不是為 AI 想出來的。2022 年 303 停電事故之後,台電開始部署電廠直供科學園區的輸電線路,大潭電廠直供桃園航空城、通霄電廠直供新竹科學園區都是那時候的規劃,後來剛好接上 AI 熱潮。
供電規劃的顆粒度也跟著變細。台電現在逐一掌握每座廠房、每個科學園區的用電狀況,做用電大戶與電網、電源之間的精準配對。
美國有人從反方向解同一題。新創公司 SPAN 推出的 XFRA 把資料中心拆成節點,裝在住宅或小型商業建築旁邊,體積跟家用冷氣室外機差不多。
- 每個 XFRA Node 搭載 Dell PowerEdge 伺服器、16 張液冷版 NVIDIA RTX PRO 6000 Blackwell Server Edition、4 顆 AMD EPYC 處理器、3TB 記憶體
- 液冷加無風扇設計,為的是能安靜地放進住宅環境
- 自家的智慧配電盤即時掌握建築用電,在不影響住戶的前提下把剩餘電力給節點使用
- 依 SPAN 說法,美國一般住宅平均只使用約四成供電容量,其餘六成長時間閒置
SPAN 自己也講清楚了範圍。這類節點適合 AI 推論、內容分發與雲端服務,需要成千上萬顆 GPU 同步訓練大型模型的任務,仍然交給傳統大型資料中心。首批系統預計今年開始導入,合作對象包含 NVIDIA 與美國建商 PulteGroup。
衡量方式也在換。PUE 與 WUE 正在變成 AI 資料中心的規劃指標,而且兩者不一定同步改善,某些冷卻方式降低了設備耗電,卻會增加水資源使用。
模型變強跟企業用起來是兩件事
Sam Altman 近日在訪談裡承認,自己高估了 AI 技術進步帶來商業變革的速度。
他原本以為 GPT-4 在 2023 年 3 月推出之後,產業很快就會被衝擊,實際上軟體業受到的影響比他預期更慢。他給的解釋是經濟本身慣性很強:模型能力可以隨著研究突破快速提升,企業要真正用上,得先動軟體系統、資料存取權限、預算配置、合規流程、員工職責與客戶使用方式。
Yum! Brands 的進度剛好是那條慢車道的實況。
- 全球 155 個國家與地區、超過 5.8 萬家餐廳
- Taco Bell 在美國已有超過 900 家門市使用語音 AI
- 自助點餐機覆蓋集團約三分之二的全球餐廳
- 後台庫存自動化讓缺貨情況減少 85%,企業內部推動超過 400 個 AI Agent
難的部分在這些數字前面。全球數位與技術長 Jim Dausch 說,一家典型餐廳過去可能同時使用多達 30 家軟體供應商,點餐、POS、廚房、配送、菜單、庫存與人力管理分散在不同系統,門市很難即時看到完整營運狀況。集團因此自建 Byte by Yum! 平台,先把核心系統接起來,AI 才有辦法跨品牌與市場複製。
同樣的落差在國家層級也看得到。OECD 去年底資料顯示,日本只有 8.4% 的勞工用過 AI,美國是 50%、英國 32%,新加坡則有 56% 的勞工每週多次使用。
日本的障礙不只是文化。專家指出當地缺乏同時具備工作經驗與基本 AI 知識的人才,有報告預估 2030 年日本 IT 人才缺口可能接近 80 萬人。許多企業仍在使用超過 20 年的舊系統,AI 難以接上既有流程,部分醫院甚至還沒完全數位化病歷。
同一天還有一個相反方向的例子。匿名模型 Ox Alpha 8 月 20 日登上 OpenRouter,鎖定程式開發、AI Agent 任務與推理,上下文視窗約 105 萬 token,開發與營運它的第三方供應商在預覽期間選擇不具名。開發者不知道它是誰做的,照樣用。
機器人破了兩項人類紀錄,卡住的卻是圍籬
第二屆世界人形機器人運動會在北京登場,賽事為期 5 天,超過 2,000 台人形機器人參賽,設有田徑、桌球、足球、舉重與拔河等 51 個項目。
兩個數字被反覆提起。榮耀開發的 Lightning 在一場測試賽以 9.32 秒完成 100 公尺,快過 Usain Bolt 保持的 9.58 秒;北京 X-Humanoid 開發的機器人立定跳高跳出 2.88 公尺,人類世界紀錄是 2.45 公尺。
價格的落差也被記了一筆。小米的機器狗 CyberDog 上市時售價約 1,500 美元,波士頓動力的四足機器人 Spot 當時要超過 7.5 萬美元。
賽場之外的難題完全是另一回事。
Agility Robotics 首席商務長 Daniel Diez 認為,人形機器人進不了工廠與倉儲,原因不是速度不夠快或手部不夠靈巧,而是它們還離不開安全圍籬。圍籬占掉廠房空間、打斷工作流程,很多場地根本挪不出這塊區域,合作案就直接談不成。
Agility 預計今年 12 月向早期客戶部署 Digit V5,稱它是全球第一款協作安全機器人。升級有三項:靠攝影機與感測器偵測人類的新演算法加上即時反應能力;電池與快充讓它一天工作 20 小時,涵蓋三班制;手臂末端改用 ISO 法蘭標準接頭,能沿用機器人產業累積數十年的末端工具目錄。
測試方式很直接。他們把地毯從 Digit 腳下抽走,它會快速跨出半步穩住重心,同時把手上的載重維持在空中。
攻擊那一側已經半自主了
思科威脅情報團隊 Talos 揭露的中國駭客組織 UAT-10147,把 AI 工具整合進了整條攻擊流程。
漏洞利用、偵察、惡意程式開發、驗證,以及入侵後維持活動,每個環節都有 AI 參與。Talos 觀察到 AI 生成的作業劇本、自動化弱點利用指令碼,還有攻擊流程裡異常狀況的自動排除。
他們用的框架包括 Metasploit、ysoserial、PentestGPT 與 DeepAudit。Talos 的判斷是,這波活動已經不是生成式 AI 搭配簡易指令碼,而是從 AI 輔助的指令碼轉向 AI 半自主的攻擊。
規模不小。駭客 C2 伺服器的資料夾裡有一份約 17 萬個網址的攻擊目標名單,主要受害伺服器位於巴西、玻利維亞、中國、加拿大與越南,受害組織涵蓋政府機關、大學、媒體、科技與遊戲產業。
防守側的新工具 8 月 21 日到位。Anthropic 把 Mythos 5 的資安防禦能力擴大提供給企業客戶與資安夥伴,程式碼掃描工具 Claude Security 即日起改用 Mythos 5 執行,原本跑的是 Opus 4.7。掃描結果附上 CWE 分類、信心度與嚴重度評分,用量計入既有方案的 token 額度,每筆修補仍須經人工審核才能實際套用。
同時成立的 Defender Advantage Fund 提供價值 3,500 萬美元的 Claude 使用額度支援開源資安工作,是 Project Glasswing 時期 400 萬美元捐款的近 9 倍。
台灣這邊的案例規模小得多,卻很難防。國家資通安全研究院示警,機關網站的文章轉寄與分享功能遭到濫用,攻擊者在留言欄置入偽冒催繳、罰款的詐騙訊息與釣魚連結。
問題出在信件是從 gov.tw 網域寄出的,能通過 SPF、DKIM、DMARC 等郵件驗證機制。經濟部國際貿易署 8 月 1 日停用該功能,財政部財政資訊中心更早在 7 月 2 日就停用。8 月 19 日追蹤時,仍有少數機關雖然移除了前台的按鈕,帶 forward 參數的轉寄頁面還能被搜尋到,部分甚至依然可以成功寄出未設限的郵件。
本地端的一天
8/16 報告裡,社群把同一顆 Qwen 3.8 27B 塞進手上各級顯示卡量速度。這次換成 GB10。
有人在單顆 NVIDIA GB10(DGX Spark 或 ASUS Ascent GX10)上跑 Qwen3.8-27B 的 NVFP4 版本,搭一顆 DFlash2 W4A16 的 drafter,一般聊天約 39 tok/s,遇到可以重用 prompt 的情況會拉到約 117 tok/s。50k context 的冷啟動首字時間從 29.94 秒降到 23.46 秒。
取捨也寫得很清楚。純聊天用 k9 可以到 42.49 tok/s,但他選了 k15 加 lookup,讓聊天、RAG 與改程式共用同一份設定檔。他另外提醒 RTX 3090 的結果不能直接搬過來,GB10 是共享記憶體、頻寬受限的 SoC。
隔壁串在問一個更現實的問題:手上有 1 萬美元,該不該買兩台 DGX Spark。發問的人想跑 DeepSeek V4 Flash 推論,喜歡它體積小、耗電低、同價位的統一記憶體多,擔心的是硬體很快過時,但又覺得記憶體現在的價格讓「再等等」變得不划算。
還有人用土法省 token。替 web_fetch 加一個 prompt 參數,讓模型先講清楚自己要什麼,抓回來的網頁在一個暫時對話裡抽取完再回主線。同一個頁面從 15K token 降到 1.4K,那段暫時對話用完就丟,不進聊天紀錄。
Fable 5 的 11% 跟輝達的 60 億美元指向同一件事。如果企業繼續拿夠好的模型把手上的活做完,開放權重的成本優勢會持續擴大;如果下一代模型重新把能力差距拉開到值得付溢價,這筆帳才會重算。
- → 輝達 26 日公布財報,第二季營收預估上看 920 億美元,高於年初預估的 780 億美元
- → Anthropic 尚未說明本月故障通報頻率的原因,也未公布本次事故的失敗請求量與影響區域
- → Agility 的 Digit V5 預計 12 月交付早期客戶,能不能真的把安全圍籬拆掉
模型能力不是今天任何一則新聞的瓶頸,卡住的地方分別是價格、HBM 的熱、電網的距離,以及工廠裡那道圍籬。