Local LLM и Private AI — можно ли запускать модели внутри компании
Когда компании нужны локальные модели, что они умеют по сравнению с облачными, какая нужна инфраструктура и как устроен приватный AI-контур.
Владимир Павлунин · опубликовано
Короткий ответ
Можно ли запускать LLM внутри компании?
Да. Открытые модели запускаются на собственных серверах или рабочих станциях с помощью стандартных инструментов — llama.cpp, Ollama, vLLM — и данные при этом не покидают периметр. Локальные модели уступают лучшим облачным в сложных задачах, поэтому на практике строят гибридный контур — чувствительные данные обрабатываются локально, остальное идёт в облачные модели через шлюз с правилами и аудитом.
Главное
- Локальные модели решают вопрос «куда уходят данные», а не вопрос качества.
- Рабочая архитектура — гибридная — маршрутизация запросов по классу данных через Model Gateway.
- Сначала классификация данных и требования безопасности, потом выбор моделей и железа.
- Модели нужно проверять на своих задачах и своём коде, а не по публичным рейтингам.
Запрет — не стратегия
Служба безопасности, запрещающая передавать код и данные во внешние сервисы, права по существу. Но запрет без альтернативы не останавливает использование AI — он делает его невидимым: люди копируют фрагменты в личные аккаунты, и компания теряет и контроль, и следы. Рабочая альтернатива — контур, в котором правила передачи данных задаёт и проверяет сама компания.
Как устроен приватный AI-контур
- Классификация данных. Что можно отдавать облачным моделям, что — только локальным, что нельзя обрабатывать AI вовсе.
- Model Gateway. Единая точка доступа: маршрутизация по классу данных, аутентификация, лимиты, журнал запросов, фильтрация секретов.
- Локальные модели. Сервер инференса внутри периметра для чувствительных данных.
- Облачные модели. Корпоративные договоры с запретом обучения на ваших данных — для всего остального.
- Аудит. Кто, что и в какую модель отправлял — чтобы инцидент можно было расследовать.
Инструменты разработчиков и агентов подключаются к шлюзу, а не к поставщикам напрямую. Поэтому модель можно заменить, не трогая рабочие места.
Как выбирать модели
Публичные рейтинги мало говорят о том, как модель поведёт себя на вашем коде и ваших документах. Надёжнее собрать набор из двадцати-тридцати собственных задач с известным правильным результатом и прогонять на нём кандидатов — и повторять проверку при выходе новых поколений.
Ограничения
- Собственная инфраструктура — это эксплуатация: обновления, мониторинг, отказоустойчивость.
- При небольшом объёме запросов локальный инференс дороже облачного в пересчёте на запрос.
- Открытые модели выходят часто: выбранная сегодня через полгода может быть не лучшей. Архитектура со шлюзом делает замену дешёвой.
Что дальше
Приватный контур — часть общей платформы, описанной в материале AI в цикле разработки. Как это делается в виде услуги — на странице Private / Local AI.
Вопросы и ответы
Когда локальные модели действительно нужны?
Когда данные нельзя передавать третьим лицам — требования регулятора или заказчика, коммерческая тайна, персональные данные, закрытый контур без интернета. Вторая причина — предсказуемая стоимость при большом объёме однотипных запросов.
Насколько локальные модели хуже облачных?
Зависит от задачи. С классификацией, извлечением данных, поиском по документам и типовым кодом открытые модели справляются хорошо. В сложном многошаговом рассуждении и работе агентов с большими кодовыми базами лучшие облачные модели пока заметно сильнее. Разрыв меняется с каждым поколением, поэтому оценку стоит повторять.
Какое железо нужно для локальной модели?
Определяется размером модели и числом одновременных пользователей. Небольшие модели работают на рабочей станции с современной видеокартой или на компьютерах с большим объёмом унифицированной памяти; для команды нужен сервер с GPU и сервер инференса вроде vLLM. Точный расчёт делается после выбора моделей под конкретные задачи.
Нарушает ли использование облачных AI-сервисов закон о персональных данных?
Само по себе — нет, но передача персональных данных третьему лицу, тем более за рубеж, требует правовых оснований и оформления. Это вопрос к юристу компании. Технически риск снимается тем, что персональные данные не попадают в облачные запросы — за счёт маршрутизации и обезличивания.
Источники
- llama.cpp — LLM inference in C/C++ ggml-org (GitHub) · проверено 2026-09-20
- vLLM documentation vLLM project · проверено 2026-09-20
- Ollama Ollama · проверено 2026-09-20
- Федеральный закон «О персональных данных» от 27.07.2006 № 152-ФЗ КонсультантПлюс · 2006-07-27 · проверено 2026-09-20
- OWASP Top 10 for Large Language Model Applications OWASP · проверено 2026-09-20