Last updated
    llama.cpp
    Libro

    llama.cpp

    Georgi Gerganov, Diego Devesa

    2023
    Comunidad

    Resumen

    El 10 de marzo de 2023, Georgi Gerganov realizó el primer commit de llama.cpp en GitHub. La biblioteca, escrita en C y C++, tenía un objetivo: ejecutar los modelos LLaMA de Meta en la CPU de un portátil sin GPU. En cuestión de semanas, acumuló miles de estrellas y una comunidad creciente de desarrolladores que ampliaban sus capacidades.

    La innovación central es la cuantización. Al comprimir los pesos del modelo de punto flotante de 32 bits a enteros de 4 u 8 bits usando el formato GGUF, llama.cpp reduce los requisitos de memoria en un 75 % o más. Un modelo de 7 mil millones de parámetros que necesitaría 28 GB de VRAM en una GPU puede ejecutarse en menos de 6 GB de RAM del sistema. El formato GGUF también agrupa el tokenizador, el vocabulario y la plantilla de chat en un solo archivo, lo que facilita la distribución del modelo.

    llama.cpp admite una gama inusualmente amplia de hardware: CPUs x86 con AVX2, Apple Silicon a través de Metal, GPUs NVIDIA con CUDA, GPUs AMD con hipBLAS, GPUs Intel con SYCL e incluso Vulkan. El proyecto incluye herramientas de línea de comandos para generación, evaluación comparativa y conversión de modelos, junto con un servidor HTTP ligero. A partir de 2025, cuenta con más de 900 contribuyentes y 69 000 estrellas en GitHub. Herramientas como Ollama y LM Studio se basan directamente en llama.cpp, haciendo que la inferencia local de LLM sea accesible para usuarios no técnicos. La biblioteca se ha convertido en el estándar de facto para ejecutar modelos de lenguaje grandes en hardware de consumo, permitiendo la experimentación privada y rentable con IA sin dependencias en la nube.

    Palabras clave

    llama.cppGGUFcuantizaciónLLM localinferenciacódigo abiertoGeorgi Gerganovinferencia en CPUaprendizaje automático

    Información del libro

    Autor
    Georgi Gerganov, Diego Devesa
    Publicado
    2023-03-10
    Autor
    Georgi Gerganov, Diego Devesa
    Initial Release
    March 10, 2023
    License
    MIT License
    Repository
    github.com/ggml-org/llama.cpp
    Written in
    C, C++

    Enlaces

    Únete a la comunidad

    fans comentando