Speculation doesn’t beat a memory bottleneck
MTP accepted roughly 0.8 of drafted tokens but produced no wall-clock improvement on CPU-offloaded Flash-Next.
1 linked runFIELD NOTES
Short conclusions with linked evidence and explicit limits.
MTP accepted roughly 0.8 of drafted tokens but produced no wall-clock improvement on CPU-offloaded Flash-Next.
1 linked run