Опыт развёртывания больших языковых моделей на локальных вычислительных системах
Ключевые слова:
большие языковые модели, персональный искусственный интеллект, локальный инференс, llama.cpp, GGUF, квантизация, CUDAАннотация
В статье рассматриваются практические аспекты локального развертывания больших языковых моделей (Large Language Models, LLM) на персональных вычислительных системах. Проведен обзор программного комплекса llama.cpp и формата хранения моделей GGUF, обеспечивающего эффективное использование современных языковых моделей на пользовательском оборудовании. Рассмотрены принципы квантизации моделей и их влияние на требования к оперативной и видеопамяти, приведены рекомендации по выбору уровня квантизации в зависимости от аппаратной конфигурации компьютера. Описаны требования к программному и аппаратному обеспечению, особенности использования графических ускорителей NVIDIA с применением технологии CUDA, а также методика подготовки среды для локального запуска моделей. Представлены практические рекомендации по выбору сборок llama.cpp, загрузке моделей, настройке параметров запуска, организации локального сервера инференса и использованию OpenAI-совместимого API для интеграции языковых моделей в прикладные программные системы. Обсуждаются преимущества локального подхода, связанные с обеспечением конфиденциальности данных, автономностью работы и гибкостью настройки моделей, а также его ограничения, обусловленные вычислительными ресурсами персональных компьютеров. Полученные результаты могут быть использованы разработчиками, исследователями, преподавателями и специалистами, заинтересованными в развертывании персональных систем искусственного интеллекта без использования облачной инфраструктуры.
Библиографические ссылки
[1] ggml-org. llama.cpp : репозиторий исходного кода / ggml-org. — Текст : электронный // GitHub : [сайт]. — URL: https://github.com/ggml-org/llama.cpp (дата обращения: 01.07.2026).
[2] Chia, A. GGUF Format: A Complete Guide to Local LLM Inference / A. Chia. — Текст : электронный // DataCamp : [сайт]. — 2024. — URL: https://www.datacamp.com/tutorial/gguf-format-a-complete-guide (дата обращения: 28.06.2026).
[3] Васильянов, А. И. Устройства NVIDIA серии Jetson для работы с нейросетями / А. И. Васильянов, В. И. Бондаренко. — Текст : электронный // Вестник Донецкого национального университета. Серия Г: Технические науки. — 2025. — № 1. — С. 93–103. — ISSN 2663-4228. — URL: https://e.lanbook.com/journal/issue/371619 (дата обращения: 01.07.2026).
[4] Hugging Face : [сайт]. — Текст : электронный. — URL: https://huggingface.co (дата обращения: 01.07.2026).
[5] Коллекции квантизованных моделей GGUF от Unsloth. — Текст : электронный // Hugging Face : [сайт]. — URL: https://huggingface.co/unsloth (дата обращения: 01.07.2026).
Загрузки
Опубликован
Выпуск
Раздел
Лицензия
Copyright (c) 2026 Системная инженерия и инфокоммуникации

Это произведение доступно по лицензии Creative Commons «Attribution-ShareAlike» («Атрибуция — На тех же условиях») 4.0 Всемирная.