Daedalus 進度戰報

2026-07-12(日)午後 · 票⑥全系列收官 + 票⑤已派工 Codex + GB10 train8 跑穩 · 自動生成 by 克勞德J
票④ MTP align 稅修復
✅ PASS 56.0 t/s
KV 品質矩陣(七檔)
✅ TBQ nc 全綠
票⑤ TQ workspace 修復
🔄 已派工 Codex,OOM 真點已定位
TP4 單用戶(58 牆)
✅ MTP3 = 80.42 t/s
MTP 品質 vs AR
✅ 位元級全同
票⑥f 最終驗收
✅ 收官:np8 純 AR 定讞
DSpark 27B drafter 訓練
🔄 GB10 第4次點火跑穩
GB10 prod(7 bots/踹踹)
✅ 重開後全綠

一、票④ 驗收(vLLM MTP align 稅)commit f7332846

二、KV 量化品質矩陣(decode-true,乾淨 harness)

KV 量化政策由 Wayne 拍板:一律 TBQ(TurboQuant)。fp16 數字僅作 baseline 對照。
檔位needle 3深度生成品質實測 KV pool(tokens)實測壓縮比
fp16(對照)3/3基線369,712
fp8 e5m20/3數字湯739,4402.0×
fp8 e4m30/3碎片+復讀739,4402.0×
TQ k8v4(非nc)1/3掉尾碼784,9922.1×
TQ 4bit_nc3/3乾淨1,006,8962.7×
TQ k3v4_nc3/3乾淨1,086,1282.9×
TQ 3bit_nc3/3乾淨1,178,8963.2×

二之二、TBQ2/TBQ3 三輪實測(llama.cpp fork,07-12)

壓縮比之謎破案:fork 的 auto-asymmetric 對 GQA 6:1 悄悄把 K 升 q8_0——表面壓縮只 2.5-2.7×。關掉(TURBO_AUTO_ASYMMETRIC=0)後全 2-bit 實測 5.43×
檔位KiB/token(差分實測)壓縮64K 單人 KVΔPPL vs f16深篩品質
f1668.04.35 GB5/5 needle
turbo2 現行(prod,K=q8_0)25.32.69×1.62 GB+1.74%
turbo2 全 2-bit12.55.43×0.80 GB+4.12%5/5 needle
turbo3 現行27.32.49×1.75 GB+0.48%
turbo3 全 3-bit ★推薦16.54.11×1.06 GB+0.55%

三、TP4 單權重多卡 × 長 context 定牆(vLLM,實測)

結論:容量、速度都不是瓶頸;64K 多併發池卡在一顆 vLLM TQ backend 的記憶體工程 bug(票⑤),util 調參無效。
維度實測判定
TQ pool 容量187萬–410萬 tokens(28–48× 併發 @64K)遠超需求
decode 速度(np1)76 t/s(MTP3 冠軍,TTFT 1–1.7s)
context 8K / 16K71.3 / 65.9 t/s可用
context 32K+單用戶 decode step OOM 殺 server✗ 過牆

四、TP4/MTP 卷宗重開(Wayne 指令)票⑥ 進行中

框架修正:「58 t/s 不可達」只對單卡 llama.cpp 純 AR 成立。Prod 形態=單權重 TP4,頻寬下限 4.8ms/step(≈234 t/s),實測 17-20ms——缺口全是工程稅,可攻。
校準實測(同一張 V100)ARMTP意義
llama.cpp fork 單卡37.3–39.749.9–64.9(+34~64%)MTP 概念本身大賺
vLLM TP1 單卡38.129.6(−22%)vLLM spec path 稅巨大
vLLM TP451–5856.0應為 70–90+,攻堅目標

五、GB10 DSpark 27B drafter 訓練(四次點火戰記)

#結局死因 / 修法
run4kernel OOM(2h)num_workers=4 預取+fp32 optimizer states 吃光 121G 統一記憶體
run5earlyoom SIGTERM(2min)27B target 白載 54G(只為抓 2 個張量);駐機 watchdog swapoff 助攻
run6主動停fp32 master 鏡像仍需 +36G 峰值,換刀
run7D-leak ~19G/h(3.5h)caching allocator 高水位不還 UVM+accept-rate 誤建 autograd graph(第3死觸發 anti-loop→派 Codex 獵殺)
train8🔄 跑穩中(07-12)D-leak 修畢:@no_grad+每步 empty_cache+grad checkpointing → 斜率 +0.065 GiB/h、avail 恆 75G,已過歷史死點兩輪

六、等 Wayne 裁決