Опыт развёртывания больших языковых моделей на локальных вычислительных системах

Авторы

Ключевые слова:

большие языковые модели, персональный искусственный интеллект, локальный инференс, llama.cpp, GGUF, квантизация, CUDA

Аннотация

В статье рассматриваются практические аспекты локального развертывания больших языковых моделей (Large Language Models, LLM) на персональных вычислительных системах. Проведен обзор программного комплекса llama.cpp и формата хранения моделей GGUF, обеспечивающего эффективное использование современных языковых моделей на пользовательском оборудовании. Рассмотрены принципы квантизации моделей и их влияние на требования к оперативной и видеопамяти, приведены рекомендации по выбору уровня квантизации в зависимости от аппаратной конфигурации компьютера. Описаны требования к программному и аппаратному обеспечению, особенности использования графических ускорителей NVIDIA с применением технологии CUDA, а также методика подготовки среды для локального запуска моделей. Представлены практические рекомендации по выбору сборок llama.cpp, загрузке моделей, настройке параметров запуска, организации локального сервера инференса и использованию OpenAI-совместимого API для интеграции языковых моделей в прикладные программные системы. Обсуждаются преимущества локального подхода, связанные с обеспечением конфиденциальности данных, автономностью работы и гибкостью настройки моделей, а также его ограничения, обусловленные вычислительными ресурсами персональных компьютеров. Полученные результаты могут быть использованы разработчиками, исследователями, преподавателями и специалистами, заинтересованными в развертывании персональных систем искусственного интеллекта без использования облачной инфраструктуры.

Биографии авторов

  • Сергей Мартынов, АГТУ

    магистрант направления подготовки «Инфокоммуникационные технологии и системы связи» Астраханского государственного технического университета, г. Астрахань, Россия

  • Алексей Осовский, АГТУ

    кандидат технических наук, доцент кафедры «Связь» Астраханского государственного технического университета, г. Астрахань, Россия

  • Денис Кутузов, АГТУ

    кандидат технических наук, доцент кафедры «Связь» Астраханского государственного технического университета, г. Астрахань, Россия

Библиографические ссылки

[1] ggml-org. llama.cpp : репозиторий исходного кода / ggml-org. — Текст : электронный // GitHub : [сайт]. — URL: https://github.com/ggml-org/llama.cpp (дата обращения: 01.07.2026).

[2] Chia, A. GGUF Format: A Complete Guide to Local LLM Inference / A. Chia. — Текст : электронный // DataCamp : [сайт]. — 2024. — URL: https://www.datacamp.com/tutorial/gguf-format-a-complete-guide (дата обращения: 28.06.2026).

[3] Васильянов, А. И. Устройства NVIDIA серии Jetson для работы с нейросетями / А. И. Васильянов, В. И. Бондаренко. — Текст : электронный // Вестник Донецкого национального университета. Серия Г: Технические науки. — 2025. — № 1. — С. 93–103. — ISSN 2663-4228. — URL: https://e.lanbook.com/journal/issue/371619 (дата обращения: 01.07.2026).

[4] Hugging Face : [сайт]. — Текст : электронный. — URL: https://huggingface.co (дата обращения: 01.07.2026).

[5] Коллекции квантизованных моделей GGUF от Unsloth. — Текст : электронный // Hugging Face : [сайт]. — URL: https://huggingface.co/unsloth (дата обращения: 01.07.2026).

Загрузки

Опубликован

26.07.2026

Как цитировать

Опыт развёртывания больших языковых моделей на локальных вычислительных системах. (2026). Системная инженерия и инфокоммуникации, 3, 43-50. https://sys-engine.ru/index.php/SEI/article/view/60