- 性能数据说明:页面中的 Resident3 42.5 tok/s 为项目性能模型在 8K context、Batch=1、Exact-QKV + MTP K=2 条件下的名义预测值,不是 RTX 3060 真机实测值;项目给出的 8K 保守 / 名义 / 乐观区间为 31.8 / 42.5 / 54.7 tok/s。
- 对比口径说明:llama.cpp 12.2 tok/s 为项目报告中 Q4 CPU FFN offload 的 8K 名义模型值;页面所示 Ollama ≈10.8 tok/s、vLLM ≈9.0 tok/s 为用于表现同类 12GB CPU/offload 路径量级的视觉化估值,并非在统一硬件、统一模型量化、统一 prompt、统一编译参数下的真实 Benchmark,不应理解为对对应项目正式性能的声明。
- “3.48× / +248%”说明:由 42.5 ÷ 12.2 得到约 3.48×;相对提升按 (42.5-12.2) ÷ 12.2 计算约为 +248%。实际结果受 GPU 板卡、显存时钟、功耗限制、CUDA 版本、kernel 实现、量化质量和 MTP acceptance 影响。
- 显存说明:10.93 GiB 为设计中的完整固定 GPU Arena 预算,包含约 10.03 GiB mixed W3/W4 resident weights、8K hot INT4 KV、Gated DeltaNet recurrent state、workspace 与 CUDA Graph arena。该值为确定性预算与实现目标,真实 allocator 峰值仍需目标机确认。
- 量化说明:Resident3 以 W3 为基础,并按校准结果将敏感张量提升到 W4。最终 W4 fraction 必须由真实 Qwen3.8-27B activation calibration 和质量闸门决定;缩小规模 PoC 不能替代整模型 perplexity、teacher-logit、代码、数学及长上下文质量验证。
- MTP 说明:1.5–2.2× 为项目对 native MTP 的预期净加速范围,不是固定保证。若真实 acceptance、draft/verify 开销、rollback 或 graph 外同步导致端到端增益不足,Runtime 应动态调整 K 或关闭 MTP。
- 带宽说明:220–300 GB/s 为 W3/W4 fused decode kernel 的目标有效权重读取带宽范围,并非 RTX 3060 理论显存带宽。RTX 3060 12GB GDDR6 理论带宽约 360 GB/s;目标机验证门槛设为加权有效权重带宽不低于 220 GB/s。
- 长上下文说明:8K 以内使用 GPU hot INT4 KV;更长上下文可进入 Host cold KV。Exact-QKV 模式保持对量化后完整 KV 的 full-attention 语义,但会逐渐受 CPU RAM bandwidth 与 SIMD attention 约束。Sparse-fast 仍属于实验路径,不应以页面短上下文数字外推其长上下文质量或速度。
- 产品与项目名称:llama.cpp、Ollama、vLLM 等名称仅用于架构类别和对比说明,其商标及项目权利归各自权利人所有。本页面并非这些项目的官方测试、认证、排名或合作材料。
- 最终验证:所有预测最终应在真实 RTX 3060 12GB 上,以固定模型 revision、量化 manifest、prompt token IDs、采样参数和 reasoning effort 进行复测,并至少报告 median、p5、p95、显存占用、GPU clocks、PCIe 状态及 Nsight 指标。
Q3060 Resident3 · Performance-first inference architecture · Research preview · 2026