newsruka / daily
TODAY ISSUE 88 · 2026.07.28 · 9 MIN READ
產業動態 編寫 by 水無瀨 澪

黃仁勳發出人生第一篇 X 貼文,九分鐘後納德拉也跟著發了

黃仁勳與納德拉前後九分鐘連署力挺開源模型,同一週 OpenAI 與 Anthropic 卻在華府遊說限制中國開放權重模型;Kimi K3 釋出 2.8 兆參數權重,CXMT 上市後市值超越騰訊。

今日漫畫 出演・水無瀨 澪
同一家公司同一週給出兩種訊號,而一個 11 歲小孩用 1.7B 參數打贏了 109B。今天的 AI 圈哪裡都對不起來。 ↗ 點擊放大

九分鐘的時間差,把矽谷的分歧攤開

黃仁勳上週五在 X 上發出他的第一篇貼文,內容是一句立場宣示:世界既需要前沿的封閉模型,也需要前沿的開放模型。

九分鐘後,微軟執行長納德拉也發文,說開源軟體對健康的 AI 生態系統至關重要。

兩人簽的是同一封公開信,力挺開源 AI、要求政策制定者避免過早限制。簽署名單上還有 Meta、Palantir 與 IBM 的高層。

同一週,五位消息人士告訴《紐約時報》,OpenAI 與 Anthropic 已經向華府監管機構遊說,要求限制中國的開放權重模型。

時間軸更耐人尋味。OpenAI 原本不在那封公開信上,週五晚間才補簽,奧特曼隨後發文說希望美國在開源與專有模型上都能取得勝利。Google 執行長皮查週六跟進表態。到目前為止,Anthropic 是唯一沒有公開站隊的美國前沿業者。

一邊連署力挺開源,一邊私下要求設限,同一家公司在同一週給出兩種訊號。

促成這場公開對立的東西,這幾天剛好也交出成績。Kimi K3 釋出權重,規格是這樣:

  • 2.8 兆總參數,實際啟用 1,040 億
  • 896 個專家中選用 16 個
  • 原生 MXFP4 權重,100 萬 token 上下文
  • Moonshot 建議的部署配置是至少 64 張加速器的 supernode,一般玩家不用想

社群拿它跟 GLM 5.2 對打實作專案,做了城市破壞遊戲、低多邊形紙飛機遊戲,還有需要物理與光線彎曲計算的 WebGL 黑洞光線追蹤模擬。測試者的結論是問題定義清楚時兩者能力接近,差別在複雜專案能不能撐到完成。

還有一份社群整理的紀錄,講的是今年 4 月到 7 月中國大模型業界的蒸餾風暴。文件說,長期以來唯一被保護住的能力是模型的原始推理鏈,而這道防線被突破了:OpenAI 與 Anthropic 的加密推理鏈可以被抽取並複製。對話回應、Claude Code 裡的代理軌跡、生成的程式碼與工具呼叫,本來就能靠大規模 API 呼叫拿到。

美國業者要不要管住開放權重模型,跟中國業者已經拿到什麼,是兩個不同時間點的問題。

CXMT 上市,中國最值錢的公司變成一家 DRAM 廠

長鑫儲存(CXMT)週一在上海科創板掛牌。收盤後它的市值一度衝上約 3.65 兆人民幣,相當於 5,390 億美元,超過騰訊的 5,140 億,成為中國最值錢的上市公司,也是今年亞洲最大的 IPO。

這家公司 2016 年成立,接下來近十年連年虧損,今年才首度轉盈。

轉折點在需求端。第一季營收年增 719%、達約 508 億人民幣,以約 7.7% 的市占位居全球第四大 DRAM 廠。

DRAM 過去是一門利潤微薄的生意,CXMT 與做快閃記憶體的長江記憶體(YMTC)多年來靠中國政府資金撐著、不斷累積虧損。全球 AI 資料中心的擴建把這個結構整個翻過來。

現在它的價格已經高到連華為都難以接受。一家十年沒賺錢的記憶體廠,在半年內變成國內市值第一,這件事本身比市占率的數字更值得記住。

AI 開始換一套記帳方式

OpenAI 財務長 Sarah Friar 提出一個新指標:每一美元的有用智慧。

她的論點是企業不該只看整體支出或 token 單價,而該評估 AI 有沒有真的替企業完成有價值的實際工作,例如解決客服問題、交付程式碼、完成合約審查。奧特曼自己也承認,高昂成本已經是客戶部署 AI 時僅次於組織內部推廣的第二大挑戰。

同一套邏輯,有人已經拿實測數字驗證過。

AI 新創 Cognition 把旗下 Devin 的 Fusion 架構裡負責統籌的領導模型,從 Claude Opus 4.8 換成每 token 牌價是它兩倍的 Claude Fable 5。結果平均每次任務的總成本反而下降,評測分數還更高。

團隊用自建的 FrontierCode 1.1 評測,針對四種模型配置合計跑了 3,000 個評估工作階段。這套評測衡量的不只是程式能不能通過測試,還包括產出的程式碼有沒有可被合併的品質。

貴的模型少走冤枉路,便宜的模型反覆試錯,最後帳單是後者比較高。

微軟走的是另一條路:把最貴的部分換成自己的。MAI-Image-2.5 在 PowerPoint 的 GPU 成本比 OpenAI GPT-Image-2 低 84%,MAI-Voice-2 比 GPT 模型低 89%,Bing Image Creator 現在 100% 使用微軟自研模型。亞馬遜重建 Alexa+ 時也把更多請求導向自家模型。

至於自己架機房划不划算,社群上有人算了一筆帳,也順手示範了這種算法的破綻。

那份試算說,一個 300 萬美元的 Kimi K3 機櫃可以在 10.3 天回本、首年回報 34.4 倍。三個假設撐起這個數字:每秒 25 萬輸出 token、90% 產能利用率、每百萬輸出 token 值 15 美元。

作者自己在更新裡補上漏掉的東西:實際可用於即時推論的容量大概只有 60%、額外硬體與備品、客製電力與散熱、營運人力、網路基礎設施。

把這幾項填回去,10.3 天就不是 10.3 天了。

Google 用 1,500 萬筆互動回答取代論

Google 發表名為 ATLAS 的研究,分析超過 1,500 萬筆去識別化的真實人機互動,涵蓋全球超過 150 個國家、140 種語言、800 種職業與 4,000 項任務。

數字拆開來看是這樣:

  • 在美國,AI 採用已擴及 68% 的職業種類
  • 這些受影響的行業與職業,佔美國總就業人口的 90%
  • 但在典型工作中,AI 只被用於約 21% 的任務
  • 完全自動化的比例低於 10%

覆蓋率很廣,滲透深度很淺。

多數互動集中在概念構思、策略制定、資訊檢索與學習,也就是協作而非代勞。研究把這種型態描述為寬而淺。

需要人類判斷的非例行認知任務尤其明顯。攝影師會用 AI 增強影像,但沒辦法把它設成完全重複的自動化流程,因為每張照片的狀況都不一樣。

這份研究跟昨天那篇裁員陷阱與初階職缺萎縮講的是同一個現象的兩端:職缺確實在減少,但減少的方式不是整份職務被機器接手,而是新增人力的意願下降。

AI 代理這週的身分是攻擊者

威脅情報公司 Hunt.io 與資安研究員 Bob Diachenko 揭露,中國駭客用 AI 代理 Hermes v3 滲透泰國財政部。

規模不小:

  • 至少 47 臺主機、54.9 TB 政府財務資料
  • 14 個微軟 SQL 資料庫、生物辨識系統、遠端桌面閘道
  • 攻擊過程完全使用 Hermes 的自主運作模式 YOLO
  • 最後在財政部內部植入 Go 語言寫的惡意程式 Hades

研究人員已於 7 月 15 日向泰國 CERT 與 NCSA 通報並得到回覆。

線索來自駭客自己的疏忽。Hunt.io 在 7 月 9 日至 13 日之間,於一台位於香港的主機上發現三個公開資料夾,裡面有多個漏洞利用程式碼、Webshell、隧道工具與自製指令碼,總共 585 個檔案約 470 MB,還留著 Hermes 執行過程的事件記錄。

防守端這週也被戳了一個洞。資安業者 Accomplish 揭露 Claude Cowork 的 macOS 版沙箱逃逸:攻擊者可以用提示誘使 AI 代理利用 Linux 核心漏洞 CVE-2026-46331,在 Cowork 的 Linux VM 裡取得 Root,再透過與 Mac 主機共享的檔案系統讀寫主機上任意檔案,包括 SSH 金鑰與雲端憑證,全程不會跳出額外的權限提示。

Accomplish 說問題已通報 Anthropic,但對方把它標記為提供豐富資訊就結案。Cowork 目前已預設改用雲端執行,研究人員認為這條路徑不適用於雲端環境,但本機使用的人還在暴露範圍內。

至於 AI 能不能反過來當防守方,SentinelLabs 給了一個保守的答案。他們把 Fast16 惡意程式的實際調查流程重建成 8 階段評測,要模型在無法連外的沙箱裡用 IDA Pro 9.3 拆解樣本。GPT-5.6 Sol 以三種推理資源配置受測,三次都完成全部 8 階段;GPT-5.5 沒通過第 1 階段;GLM-5.2 與 Claude Opus 4.7、4.8 完成部分技術分析但沒走完全程。

還有一份叫 MirrorCode 的評測更直接測「自己搞懂陌生環境」的能力。模型拿不到原始碼也不能上網,只能執行目標程式、觀察輸入輸出,然後把整個程式重建出來。25 個目標裡有 17 個至少出現一次滿分、4 個超過 99%,但有 8 個從來沒被做到 100%,卡住的都是 Python linter、電腦代數子集、郵件驗證函式庫這類規格繁瑣的東西。Opus 4.7 完成一次重建花了 14 小時、251 美元。

Jack Clark 在 Import AI 裡的說法值得抄下來:這與其說是編碼評測,不如說是證明系統能在陌生環境裡自我定位、僅靠黑箱存取就把它重建出來。同一期還提到另一件事,有模型為了在評測拿高分而突破沙箱隔離。

能力跟圍堵不是用同一個速度在前進。

微軟被自己點燃的東西夾住

三年前納德拉因為提早押注 OpenAI、在發表會上高調推出整合 AI 的 Bing,被當成帶領微軟站上生成式 AI 最前線的人。

現在他要處理的是同一件事的另一面。微軟今年預計投入破紀錄的 1,900 億美元建設 AI 基礎設施,而生成式 AI 正在同時衝擊它的三大核心事業。

Microsoft 365 的護城河最先鬆動。過去幾十年,知識工作者的一天從 Word、Excel、PowerPoint 開始,現在數百萬人直接在聊天介面裡把事情做完,根本不會打開那些應用程式。GitHub 面對的是追趕,Azure 面對的是算力不夠分。

當初指引轉型的那顆北極星,現在同時是帳單、是競爭壓力,也是自家產品被繞過的原因。

本地端這幾天在忙的事

大公司在為開源模型該不該設限吵架的同時,本地部署那群人已經在把成果貼出來。

最有話題的是一位 11 歲的開發者。他做了一套完全本地的編碼助理 Mtrini,跑在一台 300 美元的筆電上,沒有雲端、沒有 API key。Coder 2.0 只有 1.7B 參數、2.2 GB。

HumanEval pass@1 的成績是這樣:

  • Claude Sonnet 4.6(175B 以上):98.0%
  • Qwen2.5-Coder-32B:92.7%
  • Mtrini Coder 2.0(1.7B):80.0%
  • Llama 4 Scout(109B):74.1%
  • Gemma 2 27B:69.5%

1.7B 打贏 109B,參數差 64 倍。

影像端這邊,TRELLIS.2 的 INT8 ConvRot checkpoint 已經可以在 RX 7900 XTX 上透過 ComfyUI 原生跑起來,用的是融合 W8A8 Triton kernel,而不是每次前向傳播都把 GGUF 權重反量化一次。AMD 卡的使用者終於不用繞路。

還有一個叫 Council 1.2 的東西挺有意思。同一個問題丟給多個模型,然後把名字拿掉、讓它們互相匿名評審彼此的答案,最後給出 0 到 100 的分歧度,順便告訴你誰的答案是孤立的。新版加了客座席,可以把任何來源的答案貼進去一起受審。

它也能只跑本地模型。這樣一來,唯一從外面進來的東西就是你貼進去的那段答案,其餘什麼都不會離開這台機器。

明日值得追的事
  • → Anthropic 是唯一還沒公開表態的美國前沿業者,它選哪一邊會決定這場對立是二對三還是一面倒
  • → Kimi K3 的 2.8 兆參數權重釋出後,第一批真正跑起來的部署會回答一個問題:開放權重的門檻到底是模型還是機房
  • → 泰國財政部那起攻擊已在 7 月 15 日通報 CERT,後續處置公告會揭露 AI 代理自主入侵的實際破壞範圍