Qwen3.8-27B · RTX 3060 12GB · Batch=1 · 8K
0.0
tok/s
Resident3 名义 Decode
Resident3
0.0
Q4 Offload
0.0
架构级提升
+0%相对 Q4 CPU Offload
0完整 GPU Arena
8K · BATCH = 1 · DECODE

绿色,
拉开差距。

Resident3Exact + MTP
0.0
llama.cppQ4 CPU offload
0.0
Ollama同类 offload 估值*
0.0
vLLM12GB offload 估值*
0.0
+0%Resident3 vs. Q4 CPU Offload · 名义架构差值
FOUR NUMBERS

不讲故事。
只看关键数字。

RESIDENT WEIGHTS
0
语言计算权重常驻
W3/W4No Weight Offload
EFFECTIVE GDDR6 TARGET
00
GB/s · Decode 权重读取
Fused GEMVSM86
HOT KV
0
8K INT4 Hot KV
Hot / ColdINT4
NATIVE MTP
00
预计净 Decode 增益
K=2 DraftK=3 Verify
12GB VRAM

把 27B,
塞进 10.93 GiB。

0
固定地址 GPU Arena
Weights
KV
State
Work
Graph
0 GiB10.933 GiB12 GB
RESIDENT3
不是更会 Offload。
是不再需要它。
  1. 性能数据说明:页面中的 Resident3 42.5 tok/s 为项目性能模型在 8K context、Batch=1、Exact-QKV + MTP K=2 条件下的名义预测值,不是 RTX 3060 真机实测值;项目给出的 8K 保守 / 名义 / 乐观区间为 31.8 / 42.5 / 54.7 tok/s。
  2. 对比口径说明:llama.cpp 12.2 tok/s 为项目报告中 Q4 CPU FFN offload 的 8K 名义模型值;页面所示 Ollama ≈10.8 tok/s、vLLM ≈9.0 tok/s 为用于表现同类 12GB CPU/offload 路径量级的视觉化估值,并非在统一硬件、统一模型量化、统一 prompt、统一编译参数下的真实 Benchmark,不应理解为对对应项目正式性能的声明。
  3. “3.48× / +248%”说明:由 42.5 ÷ 12.2 得到约 3.48×;相对提升按 (42.5-12.2) ÷ 12.2 计算约为 +248%。实际结果受 GPU 板卡、显存时钟、功耗限制、CUDA 版本、kernel 实现、量化质量和 MTP acceptance 影响。
  4. 显存说明:10.93 GiB 为设计中的完整固定 GPU Arena 预算,包含约 10.03 GiB mixed W3/W4 resident weights、8K hot INT4 KV、Gated DeltaNet recurrent state、workspace 与 CUDA Graph arena。该值为确定性预算与实现目标,真实 allocator 峰值仍需目标机确认。
  5. 量化说明:Resident3 以 W3 为基础,并按校准结果将敏感张量提升到 W4。最终 W4 fraction 必须由真实 Qwen3.8-27B activation calibration 和质量闸门决定;缩小规模 PoC 不能替代整模型 perplexity、teacher-logit、代码、数学及长上下文质量验证。
  6. MTP 说明:1.5–2.2× 为项目对 native MTP 的预期净加速范围,不是固定保证。若真实 acceptance、draft/verify 开销、rollback 或 graph 外同步导致端到端增益不足,Runtime 应动态调整 K 或关闭 MTP。
  7. 带宽说明:220–300 GB/s 为 W3/W4 fused decode kernel 的目标有效权重读取带宽范围,并非 RTX 3060 理论显存带宽。RTX 3060 12GB GDDR6 理论带宽约 360 GB/s;目标机验证门槛设为加权有效权重带宽不低于 220 GB/s。
  8. 长上下文说明:8K 以内使用 GPU hot INT4 KV;更长上下文可进入 Host cold KV。Exact-QKV 模式保持对量化后完整 KV 的 full-attention 语义,但会逐渐受 CPU RAM bandwidth 与 SIMD attention 约束。Sparse-fast 仍属于实验路径,不应以页面短上下文数字外推其长上下文质量或速度。
  9. 产品与项目名称:llama.cpp、Ollama、vLLM 等名称仅用于架构类别和对比说明,其商标及项目权利归各自权利人所有。本页面并非这些项目的官方测试、认证、排名或合作材料。
  10. 最终验证:所有预测最终应在真实 RTX 3060 12GB 上,以固定模型 revision、量化 manifest、prompt token IDs、采样参数和 reasoning effort 进行复测,并至少报告 median、p5、p95、显存占用、GPU clocks、PCIe 状态及 Nsight 指标。