Speculative Decoding for Latency Reduction
A faster way to run large language models without sacrificing output quality.
Emeka Ibrahim
Section
1 story in Inference Throughput.
A faster way to run large language models without sacrificing output quality.