← Back to Repositories Hub Language License ggerganov/llama.cpp LLM inference in C/C++ on CPU and GPU. Maintainer: ggerganov Last Reviewed: 2026-06-22 Next Review: 2026-12-31 Editorial Owner: AI Delivery Hub Editorial Description & Purpose LLM inference in C/C++ on CPU and GPU. Architecture Summary Built as a modular framework in C++, leveraging asynchronous processing and event loops to orchestrate LLM requests. Core Use Cases High-speed CPU model execution, compiling GGUF models locally. Alternatives Evaluated Alternative open-source orchestration packages 💻 View on GitHub 📖 View Documentation