Daedalus 進度戰報
2026-07-12(日)午後 · 票⑥全系列收官 + 票⑤已派工 Codex + GB10 train8 跑穩 · 自動生成 by 克勞德J
票④ MTP align 稅修復
✅ PASS 56.0 t/s
票⑤ TQ workspace 修復
🔄 已派工 Codex,OOM 真點已定位
TP4 單用戶(58 牆)
✅ MTP3 = 80.42 t/s
DSpark 27B drafter 訓練
🔄 GB10 第4次點火跑穩
GB10 prod(7 bots/踹踹)
✅ 重開後全綠
一、票④ 驗收(vLLM MTP align 稅)commit f7332846
- 單用戶 MTP2+cudagraph:56.0 t/s median(門檻 ≥55,修前 28.9);France/needle 探針與 fresh AR 全文一致;回歸 27 tests 過。
- batch8 MTP2 231.9 vs 純 AR 274.9 未追平 → 依 brief single-user exception 收案,暫不進池。
- 修法:mamba state copy 改 64KiB chunk grid(3.77×)+drafter fit 免 device sync+debug reductions 全改 opt-in。
二、KV 量化品質矩陣(decode-true,乾淨 harness)
KV 量化政策由 Wayne 拍板:一律 TBQ(TurboQuant)。fp16 數字僅作 baseline 對照。
| 檔位 | needle 3深度 | 生成品質 | 實測 KV pool(tokens) | 實測壓縮比 |
| fp16(對照) | 3/3 | 基線 | 369,712 | 1× |
| fp8 e5m2 | 0/3 | 數字湯 | 739,440 | 2.0× |
| fp8 e4m3 | 0/3 | 碎片+復讀 | 739,440 | 2.0× |
| TQ k8v4(非nc) | 1/3 | 掉尾碼 | 784,992 | 2.1× |
| TQ 4bit_nc | 3/3 | 乾淨 | 1,006,896 | 2.7× |
| TQ k3v4_nc | 3/3 | 乾淨 | 1,086,128 | 2.9× |
| TQ 3bit_nc | 3/3 | 乾淨 | 1,178,896 | 3.2× |
- fork 自製 sm70 fp8 dense 路徑品質除名(疑 kernel bug 非量化噪聲);dense 進池一律 TQ nc 家族。
- 順帶揪出新 bug:prefix-cache 命中也走壞的 partial-prefill 路徑(同 chunked prefill),dense 服務必帶 no-prefix-caching。
- 併發活測(ladder):fp16 16×16K=23.7萬 tokens、22×16K 全過零 preemption——16 併發中等 context 連 fp16 都裝得下,TBQ 把上限推到 16人×73K。
二之二、TBQ2/TBQ3 三輪實測(llama.cpp fork,07-12)
壓縮比之謎破案:fork 的 auto-asymmetric 對 GQA 6:1 悄悄把 K 升 q8_0——表面壓縮只 2.5-2.7×。關掉(TURBO_AUTO_ASYMMETRIC=0)後全 2-bit 實測 5.43×。
| 檔位 | KiB/token(差分實測) | 壓縮 | 64K 單人 KV | ΔPPL vs f16 | 深篩品質 |
| f16 | 68.0 | 1× | 4.35 GB | — | 5/5 needle |
| turbo2 現行(prod,K=q8_0) | 25.3 | 2.69× | 1.62 GB | +1.74% | ✓ |
| turbo2 全 2-bit | 12.5 | 5.43× | 0.80 GB | +4.12% | 5/5 needle |
| turbo3 現行 | 27.3 | 2.49× | 1.75 GB | +0.48% | ✓ |
| turbo3 全 3-bit ★推薦 | 16.5 | 4.11× | 1.06 GB | +0.55% | ✓ |
- 速度對 KV dtype 中性(短文/25K 都統計平手;v1 牆鐘差距全是噪聲——方法論已修:server timings+多輪去頭中位)。
- PPL=llama-perplexity c4096×16 chunks,同權重同語料,ΔPPL 即 KV 量化純精度代價(f16 基準 6.6506±0.09)。
- 最終建議待裁:prod 切
turbo3 + TURBO_AUTO_ASYMMETRIC=0——對現役精度 3 倍好+容量 +53%,雙優非 trade-off。turbo2 全 2-bit 留作極限容量選項。票⑦候選=turbo2/3 移植進 1cat-vllm 當低位元 preset。
三、TP4 單權重多卡 × 長 context 定牆(vLLM,實測)
結論:容量、速度都不是瓶頸;64K 多併發池卡在一顆 vLLM TQ backend 的記憶體工程 bug(票⑤),util 調參無效。
| 維度 | 實測 | 判定 |
| TQ pool 容量 | 187萬–410萬 tokens(28–48× 併發 @64K) | 遠超需求 |
| decode 速度(np1) | 76 t/s(MTP3 冠軍,TTFT 1–1.7s) | ✓ |
| context 8K / 16K | 71.3 / 65.9 t/s | 可用 |
| context 32K+ | 單用戶 decode step OOM 殺 server | ✗ 過牆 |
- ★ 真牆=vLLM TQ decode workspace 是 O(context)×每序列固定分配:55K 一個人一步就吃 +15GB/卡,util 0.85→0.40 全炸(降 util 只縮 pool 不縮此瞬時)。今天可用 context 上限=16K–32K 之間。
- vLLM 專屬 bug:llama.cpp turbo kernel 同樣 60K 單用戶 decode 順跑(32–41 t/s)——非 TQ 概念問題。
- 票⑤(TQ workspace 分塊)從「長文前置」升級為「64K 服務絕對阻斷」。07-12 午後已派工桌面 Codex(spec=mavis:~/ticket5_spec.md),Codex 已定位兩個 OOM 真點:decode workspace cache 按 padded batch 配置(flash_attn_interface.py)+continuation prefill k_full/v_full 整段 dequant,走最小 patch。過渡期硬約束:pool max-model-len ≤16K(樣板已修 65536→16384)。
四、TP4/MTP 卷宗重開(Wayne 指令)票⑥ 進行中
框架修正:「58 t/s 不可達」只對單卡 llama.cpp 純 AR 成立。Prod 形態=單權重 TP4,頻寬下限 4.8ms/step(≈234 t/s),實測 17-20ms——缺口全是工程稅,可攻。
| 校準實測(同一張 V100) | AR | MTP | 意義 |
| llama.cpp fork 單卡 | 37.3–39.7 | 49.9–64.9(+34~64%) | MTP 概念本身大賺 |
| vLLM TP1 單卡 | 38.1 | 29.6(−22%) | vLLM spec path 稅巨大 |
| vLLM TP4 | 51–58 | 56.0 | 應為 70–90+,攻堅目標 |
- 票⑥ P0 完成(commit 9d9d3c4):六段 CUDA-event 計時,np1/4/8 × AR/MTP2 各 300 steps。AR scheduler+submit 4.7–5.3ms(判準 1.5ms 的 3×)、MTP verify forward 46.8→151.6ms——spec step 整條裸奔未圖化,P1 全步 graph 的肉極大。
- P0 品質閘門 FAIL(守規矩的停):MTP2 temp0 全文與 fresh AR 不一致(story 191 vs 210 chars,三跑穩定),現行 site-packages 也重現=既有 baseline 回歸非儀表污染。
- 票⑥b/⑥c 完成:site drift 四檔全數同步進 repo(含 mamba_mixer2+GGUF 單shard 前置修),嚴格純 repo 起動 prod GGUF 通過=repo 自足;temp0 歧異裁定為 near-tie 合法翻轉(新閘門:正確性探針硬過+首歧異 gap<0.25)。
- ★ TP4 實測破牆:warm np1 AR = 74.30 t/s(>58 帳面牆、>65 門檻)——卷宗重開的核心論點兌現。MTP2 warm 60.28 尚未達 75,np8 MTP −13.7%。
- 票⑥d 品質全勝:根因=compiled spec commit 走「拆開的 GDN 算術」vs AR 的 fused mixed-QKV,64 層 FP rounding 累積。修成同 kernel 後 MTP 輸出與 AR 位元級全同(60/60),spec_core 預設啟用。
- 票⑥e 破關:k*=3 → TP4 單用戶 MTP3 = 80.42 t/s(≥75 ✅),acceptance 鏈長 2.98;k=4 品質淘汰。P3 佔用門控已實作(≤2 seq MTP3/≥3 AR/3-step 遲滯)。
- 票⑥f 收官(07-12 午後,戰役終局):np8 k=1 彩蛋否決——乾淨同條件 A/B(雙邊 capture 1 2 4 8、各 3 輪、900tok×8u)=AR 294 vs MTP-k1 245-256,AR 贏 15-17%(k=1 acceptance 鏈長僅 1.33,spec 稅蓋過收益)。動態門控亦 NO-GO 已撤。最終格局=兩個靜態王者:單用戶 lane MTP3 80.4/批次池純 AR ~295(靜態容量閘 commit ed8693a:max_num_seqs≤2 才自動 MTP3)。pool unit 最終樣板已定(TBQ 4bit_nc+splits96+16K cap)。
- 陷阱入庫:profiler interval=100 會可重現地改變輸出(漂 token),量測一律 interval=300。
- 驗收不變:TP4 單用戶 AR ≥65、MTP ≥75、np8 門控後不再負資產。np 掃描定論:MTP np1 +34%、np4 −26%、np8 −43% → 佔用門控必需。
- DSpark drafter(訓練中)=P5 預留介面:draft-model speculation 形態,配 TP4 潛力 100–150 t/s。
- 池 vs ComfyUI 已裁決=按需分時:queue 空→借卡跑 bench→渲染任務來即還(/free API 對 DisTorch loader 無效,SOP 為進程級)。mavis RAM 已升 64GB。
五、GB10 DSpark 27B drafter 訓練(四次點火戰記)
| # | 結局 | 死因 / 修法 |
| run4 | kernel OOM(2h) | num_workers=4 預取+fp32 optimizer states 吃光 121G 統一記憶體 |
| run5 | earlyoom SIGTERM(2min) | 27B target 白載 54G(只為抓 2 個張量);駐機 watchdog swapoff 助攻 |
| run6 | 主動停 | fp32 master 鏡像仍需 +36G 峰值,換刀 |
| run7 | D-leak ~19G/h(3.5h) | caching allocator 高水位不還 UVM+accept-rate 誤建 autograd graph(第3死觸發 anti-loop→派 Codex 獵殺) |
| train8 | 🔄 跑穩中(07-12) | D-leak 修畢:@no_grad+每步 empty_cache+grad checkpointing → 斜率 +0.065 GiB/h、avail 恆 75G,已過歷史死點兩輪 |
- 護欄:watchdog(avail<14G 連續2次優雅停)+每 10 steps checkpoint(留最新2個)+oom_score_adj=800。
- 90 optimizer steps 預估數天;完訓後 eval accepted-length vs MTP-1,部署家=1cat-vllm TP4。
- 教訓入庫:GB10 UVM 繞過 cgroup/RSS 一切記帳;機上有駐機 cron watchdog(含 swapoff)+earlyoom 兩個隱形玩家。
六、等 Wayne 裁決
- ①
票⑤派工核准 ✅ Wayne 授權主管代派,已派工 Codex(07-12)
- ② dense 進池模型清單(每模型 decode-true 快篩定 preset,4bit_nc 起步)
- ③
池 vs ComfyUI 優先權 ✅ 已裁決=按需分時借卡
- ④ 1cat-vllm 備援:origin=上游 1CatAI 無權推送 → 已改 git bundle 雙備份(mavis 家目錄+/mnt/windows/backups,HEAD ed8693a);要正式遠端請開私有 repo 再指示
- ⑤ 主管 hermes agents 名單
- ⑥ 駐機 watchdog 的 swapoff -a 拔不拔(違反禁令但屬他人 lane)