Представьте: один человек, за выходные, пишет код, который меняет целую индустрию. Георгий Георганов, болгарский физик, сделал именно это с llama.cpp, подарив миру возможность запускать мощные ИИ-модели на обычных ноутбуках. Его проект, начавшийся как хобби, стал фундаментом для Ollama, LM Studio и GPT4All, а его репозиторий на GitHub обогнал по скорости роста PyTorch и TensorFlow, набрав более 100 000 звёзд.
Кто это
Георгий Георганов — болгарский физик и программист из Софии. До 2023 года он работал в американской компании над МРТ-оборудованием, а в свободное время занимался хобби-проектами, связанными с наушниками. В феврале 2023 года Meta выпустила модель LLaMA, но её запуск требовал PyTorch, CUDA и дорогих видеокарт NVIDIA, что делало её недоступной для большинства пользователей с обычными ноутбуками. Это была явная проблема: модель существовала, но была практически бесполезна для широкой аудитории.
Как это было сделано
Георганов увидел эту проблему и решил её радикально. Он написал llama.cpp с нуля, используя чистый C/C++ и полностью отказавшись от зависимостей. Проект был задуман как «weekend project», и первый коммит появился 10 марта 2023 года. Ключевая идея заключалась в том, чтобы модель работала на обычном процессоре. Он реализовал квантование, которое сжимает модель так, что она помещается в обычную оперативную память. Это позволило запускать большие языковые модели локально, без облака, API или подписки, сохраняя приватность данных пользователя. Его решение не просто запускало модель, оно изменило культуру: теперь достаточно было скачать один файл в формате GGUF, и модель работала на вашем железе. Именно на этом фундаменте выросли все основные инструменты для локального инференса, такие как Ollama, LM Studio и GPT4All. В феврале 2026 года команда llama.cpp влилась в Hugging Face, сохранив при этом полную техническую автономию и 100% open-source статус проекта. Это не было поглощением, а скорее передачей под долгосрочную опеку, что позволило проекту развиваться дальше, сохраняя свои принципы.
Цифры
- Сроки: Первый коммит 10 марта 2023 года, проект задумывался как «weekend project» vc.ru.
- Популярность: Более 100 000 звёзд на GitHub к марту 2026 года, быстрее, чем PyTorch и TensorFlow vc.ru.
- Сообщество: Более 700 разработчиков со всего мира поддерживают репозиторий vc.ru.
- Производительность: Локальные модели с 13 миллиардами параметров работают на обычных процессорах со скоростью 15 токенов в секунду и оверхедом менее 100 мегабайт vc.ru.
- Инвестиции: В 2023 году основал ggml.ai, поддержанный Натом Фридманом (бывшим CEO GitHub) и Дэниелом Гроссом vc.ru.
Что взять себе
- Решайте реальную проблему: Георганов увидел, что мощные модели недоступны большинству, и создал решение. Ищите такие «узкие места» в своей области.
- Начинайте с малого, итеративно: Проект начался как «weekend project», но быстро набрал обороты благодаря своей ценности. Не бойтесь запускать MVP.
- Фокусируйтесь на производительности и доступности: Чистый C/C++ без зависимостей и оптимизация для CPU сделали llama.cpp универсальным. Простота использования и низкие требования к ресурсам — ключ к массовому принятию.
- Сохраняйте открытость: Open-source модель llama.cpp позволила сообществу активно участвовать в развитии, что привело к экспоненциальному росту и появлению целой экосистемы.