
llama.cpp
Georgi Gerganov, Diego Devesa
Resumen
El 10 de marzo de 2023, Georgi Gerganov realizó el primer commit de llama.cpp en GitHub. La biblioteca, escrita en C y C++, tenía un objetivo: ejecutar los modelos LLaMA de Meta en la CPU de un portátil sin GPU. En cuestión de semanas, acumuló miles de estrellas y una comunidad creciente de desarrolladores que ampliaban sus capacidades.
La innovación central es la cuantización. Al comprimir los pesos del modelo de punto flotante de 32 bits a enteros de 4 u 8 bits usando el formato GGUF, llama.cpp reduce los requisitos de memoria en un 75 % o más. Un modelo de 7 mil millones de parámetros que necesitaría 28 GB de VRAM en una GPU puede ejecutarse en menos de 6 GB de RAM del sistema. El formato GGUF también agrupa el tokenizador, el vocabulario y la plantilla de chat en un solo archivo, lo que facilita la distribución del modelo.
llama.cpp admite una gama inusualmente amplia de hardware: CPUs x86 con AVX2, Apple Silicon a través de Metal, GPUs NVIDIA con CUDA, GPUs AMD con hipBLAS, GPUs Intel con SYCL e incluso Vulkan. El proyecto incluye herramientas de línea de comandos para generación, evaluación comparativa y conversión de modelos, junto con un servidor HTTP ligero. A partir de 2025, cuenta con más de 900 contribuyentes y 69 000 estrellas en GitHub. Herramientas como Ollama y LM Studio se basan directamente en llama.cpp, haciendo que la inferencia local de LLM sea accesible para usuarios no técnicos. La biblioteca se ha convertido en el estándar de facto para ejecutar modelos de lenguaje grandes en hardware de consumo, permitiendo la experimentación privada y rentable con IA sin dependencias en la nube.
Palabras clave
Información del libro
- Autor
- Georgi Gerganov, Diego Devesa
- Publicado
- 2023-03-10
- Autor
- Georgi Gerganov, Diego Devesa
- Initial Release
- March 10, 2023
- License
- MIT License
- Repository
- github.com/ggml-org/llama.cpp
- Written in
- C, C++
Enlaces
Únete a la comunidad
fans comentando