newsruka / daily
TODAY ISSUE 101 · 2026.08.11 · 6 MIN READ
工具與應用 編寫 by 水無瀨 澪

三張參考圖就夠,MiniMax H3 讓 character LoRA 的位置鬆動

MiniMax H3 的 reference 工作流只要 3 到 4 張同主體照片,身體一致性就勝過 character LoRA;Muse Glimmer 的空白回應原來是 max_tokens 砍掉的;Sony 與台積電要在熊本合資 1 兆日圓。

今日漫畫 出演・水無瀨 澪
模型交了白卷,澪 差點判它死刑。結果不是模型笨,是輸出預算太小,話還沒講完就被切斷了。 ↗ 點擊放大

今天的素材幾乎全來自自己架機器跑模型的人。沒有發表會,沒有新聞稿,只有一堆實測數字、當機紀錄和踩過的坑。

MiniMax H3 是這批討論的重心。

MiniMax H3 的參考圖工作流,開始擠掉 character LoRA

讓角色維持一致的做法正在換人。

原本要保住同一張臉,社群的標準答案是訓一個 character LoRA。Krea、z-image、chroma 這些模型的 character LoRA 對五官的保留度高到可以反查原圖,但刺青和穿孔一直做不好。

H3 的 reference 工作流只需要 3 到 4 張同一主體的照片,身體一致性就比 LoRA 好。有人把主體做成一張多角度的 turnaround 圖餵進去,生成速度更快,一致性問題也更少。以前要靠兩階段編輯才勉強合上的刺青,現在在高解析度算圖裡能在多個角度正確出現。

官方的 prompt writing guide 放在 Hugging Face 的模型頁上,社群照著它把運鏡指令逐條測了一輪。H3 的 prompt 不是一句話,是結構化欄位:

  • integrated_multimodal_description 放分鏡,用 [Shot 1] [Shot 2] 切鏡,時間點可以寫到 00:03.500
  • 對白用 (S1) (S2) 標說話者,還能指定語氣,像是 breathy、scared、shout
  • overall_soundscape 寫環境音,non_diegetic_music 寫配樂
  • 運鏡能同時指定幅度與速度,例如 zooms in with large amplitude at fast speed

配音走同一套語法。有人用兩張參考圖加兩個音檔做語音克隆,在 subject_definitions 裡把 Audio 1 綁給 S2、Audio 2 綁給 S1,一段 15 秒的固定機位對手戲就照著跑出來,包含挨巴掌之後的頭部後仰。

速度端已經壓到消費級顯卡跑得動。RTX 5060 Ti 16GB 配 32GB 系統記憶體,用 lightx2v Turbo LoRA 走 8 步加 Sol Attention,先出 0.5MP 再上採樣。另一份由 JoyFox 釋出的 Turbo LoRA 把 T2V 和 I2V 都壓到 4 步。

代價很直接。有人的 3090 Ti 一跑 H3 就整台斷電重開,沒有事件記錄也沒有記憶體傾印,換不換 Sage、Sol Attention 或 spectrum 都一樣。那台機器是 i7 12700KF 配 DDR5 64GB 和 850W 電源,同一台跑 F2D、WAN、LTX、QI 全都沒事。臉部熔化、t2v 反而比 ref2v 慢,這類回報也還在累積。

Muse Glimmer 的空白回應,是 max_tokens 砍掉的

有人差點把 Muse Glimmer 判死刑,問題出在自己的測試框架。

在單張 3090 上跑一套 13 題的評測,用 Q4_K_XL 加 DFlash、不掛 mmproj,第一次只拿 6 分,其中一半的失敗是完全空白的回應。看起來像量化壞掉。

實際上是 max_tokens 設太低。Muse 每次回答前都會先想過一遍,那套評測的 per-case 上限落在 60 到 500 之間,在 xhigh 推理強度下模型把整個預算燒在思考、還沒吐出答案就被截斷,回傳 finish_reason: length 和空的 content。把預算調高之後,同一套題目變成 11/13。

同一個「哪個城市」的簡單問題,不同推理強度吃掉的 token 差距很大:

  • low:120 token
  • medium:318 token
  • high:1245 token
  • xhigh:1760 token,是 low 的 14 倍以上

建議至少留 16k 的輸出空間。另外 --reasoning-budget 0 在這個 template 上不會關掉思考,每個強度都照想。

DFlash 的加速幅度在長上下文不會塌。下面這組是在填滿的 KV 上量的,不是幾乎空的 context:

  • 約 2K 提示:34.6 提升到 62.6 tok/s
  • 105,671 token:21.6 提升到 37.8 tok/s
  • 191,015 token:40.5 tok/s

同一段區間的 prefill 從 916 掉到 500 再到 435 tok/s。Ampere 上大致是 1.75 到 1.8 倍。

取樣溫度會影響 DFlash 的接受率,這點比較少被提到。同樣設定同樣提示,greedy 拿到 0.131 的接受率和 37.8 tok/s;溫度調到 1.0 就變成 0.093 和 30.5 tok/s。做低溫 agentic 工作的人,實際拿到的加速比文章生成的 benchmark 看起來更多。另外 --spec-draft-n-max 的實際天花板是 15,因為 drafter 的 block_size 是 16,llama.cpp 會夾到 block_size 減一。

能撐過 131k 的原因藏在層的排法。config 寫 max_position_embeddings: 131072 而且沒有 rope scaling,但 39 層滑動視窗層的視窗是 2048、rope_theta 500000,另外 13 層全注意力層的 rope_theta 是 0,也就是 NoPE。滑動層永遠看不到超過 2048 個位置,全域層根本沒有位置編碼,所以沒有 rope 外推可以壞。

換到 Intel Arc Pro B70 32GB 走 SYCL,Muse Glimmer 30B 加 DFlash 是 22.5 tok/s,draft token 接受 315/512,context 開到 131,072。

Intel Arc 的 VRAM 判讀錯了好幾週

有人花了幾週才找出 ComfyUI 在 Intel 顯卡上當機的原因。

ComfyUI 預設在 Intel XPU 上估算可用 VRAM 的方式不準,導致 KSampler 卡在 0%、VRAM 溢位、切換大模型時當掉或凍結。修法是改成讀取當下實際的全域可用 VRAM,同時把可回收的 PyTorch cache 算進去,跟 ComfyUI 對 NVIDIA 已經在用的做法一致。

這個 patch 不加節點、不改生成流程,放進 custom_nodes/ 重啟就在背景生效。作者說改完之後還能把預留的 VRAM 邊界調小,換回一點速度,B580 的穩定度變得跟他另一台 RTX 5060 Ti 16GB 一樣可預測。

ComfyUI 0.31.1 的情況相反。同一位作者更新後觀察到穩定度變差,其他廠牌顯卡的使用者也有類似回報。

硬體那頭的問題比較樸素。有人在問到底是誰在這個價格買 GPU、買來做什麼,自己則因為 FOMO 又下單了一張 4300 歐元的 5090。

低階配置也有人在認真經營。一台 MSI Stealth 15 A13V,i7 13 代配 4060 8GB VRAM 和 64GB DDR5-5200,上面疊了 15 個模型輪流跑,Qwen3.6 35B A3B Q5_K_M 在 30 到 40 tok/s、Gemma 26B A4B 在 20 到 25 tok/s,晚上排整批自動跑,一輪大約 6 小時。他的第一條建議跟模型無關:買一條帶 DisplayLink 晶片的 HDMI 轉 USB 轉接頭,插在非顯示埠上,把外接螢幕從獨顯手上搶回來。遊戲筆電的 HDMI 和 USB-C 顯示埠是硬接到獨顯的,插上外接螢幕之後瀏覽器分頁、系統服務甚至部分音訊服務都會壓在獨顯上,光叫 Windows 改用內顯擋不住。換了轉接頭之後獨顯佔用能壓回接近 0MB。

把 ComfyUI 開到公網上,代價是整台重灌

有人把 ComfyUI 直接掛在公網 IP 上,沒有任何保護。

發現出事是因為風扇。機器閒置時 CPU 和 GPU 的風扇都在全速轉,實際上已經被拿去挖礦。攻擊者在掃描開放的 ComfyUI 連接埠,找到之後透過安裝自訂節點取得遠端執行程式碼的能力。

ComfyUI 的 security policy 設成 normal 可以縮小這條路徑,因為它會擋掉遠端安裝自訂節點。當事人原本架過 NGINX 反向代理加密碼驗證,後來懶得重新設定就直接曝露。收尾是整台重灌,加上撤銷所有跟那個實例綁在一起的 API key。

Sony 和台積電要在熊本合資,蘋果在測長鑫的 DRAM

《日本經濟新聞》報導,Sony 與台積電計畫共同投資約 1 兆日圓,在熊本開發及製造新一代影像感測器晶片。

合資公司預計由 Sony 持股約 60%、台積電約 40%,最快 2029 年開始商業量產。這筆投資約合 63 億美元,相當於台積電熊本第一座晶圓廠總投資額的七成以上。兩家公司今年 5 月已簽署不具約束力的合作備忘錄,計畫在 Sony 位於熊本縣合志市的新廠內設立開發與生產線。產品線除了智慧型手機與汽車,也會探索機器人與實體 AI 應用。Sony 拒絕評論,台積電尚未回應投資金額與持股比例。

記憶體那頭的動作更敏感。《華爾街日報》引述消息人士指出,蘋果正在 iPhone、MacBook 等多條產品線測試中國長鑫存儲的 DRAM,並已展開初步供貨討論,可能用於部分在中國市場銷售的裝置。惠普與宏碁已經在部分銷往美國以外市場的產品中採用長鑫晶片。

長鑫目前被美國國防部列入中國軍事企業名單,美國國會議員近期也要求政府限制企業採購中國記憶體。這項測試仍處於早期階段。如果 AI 資料中心繼續把高階記憶體的產能吸走,一般 DRAM 的供應保障會逼更多消費性電子品牌去碰政策風險高的來源。

明日值得追的事
  • → H3 在 3090 Ti 上整台斷電的回報會不會擴散到其他卡,還是單一機器的供電問題
  • → Muse Glimmer 的 DFlash 接受率在不同量化格式下的差異
  • → 長鑫的 DRAM 測試會不會從中國市場機種擴大到其他地區