Inference Acceleration for Large Language Models on CPUs

Nov 25, 2024

Inference Acceleration for Large Language Models on CPUs

In this paper, we explore the utilization of CPUs for accelerating the inference of large language models.

Related Research & Thoughts