I think we don't have a good draft model for better speculative decoding yet (e.g. DFlash 2). Once we do, it will be faster.
It very well could be faster, but right now it isn’t.
It very well could be faster, but right now it isn’t.