К содержанию
Владимир Павлунин

Local LLM и Private AI — можно ли запускать модели внутри компании

Когда компании нужны локальные модели, что они умеют по сравнению с облачными, какая нужна инфраструктура и как устроен приватный AI-контур.

· опубликовано

Короткий ответ

Можно ли запускать LLM внутри компании?

Да. Открытые модели запускаются на собственных серверах или рабочих станциях с помощью стандартных инструментов — llama.cpp, Ollama, vLLM — и данные при этом не покидают периметр. Локальные модели уступают лучшим облачным в сложных задачах, поэтому на практике строят гибридный контур — чувствительные данные обрабатываются локально, остальное идёт в облачные модели через шлюз с правилами и аудитом.

Главное

  • Локальные модели решают вопрос «куда уходят данные», а не вопрос качества.
  • Рабочая архитектура — гибридная — маршрутизация запросов по классу данных через Model Gateway.
  • Сначала классификация данных и требования безопасности, потом выбор моделей и железа.
  • Модели нужно проверять на своих задачах и своём коде, а не по публичным рейтингам.

Запрет — не стратегия

Служба безопасности, запрещающая передавать код и данные во внешние сервисы, права по существу. Но запрет без альтернативы не останавливает использование AI — он делает его невидимым: люди копируют фрагменты в личные аккаунты, и компания теряет и контроль, и следы. Рабочая альтернатива — контур, в котором правила передачи данных задаёт и проверяет сама компания.

Как устроен приватный AI-контур

  1. Классификация данных. Что можно отдавать облачным моделям, что — только локальным, что нельзя обрабатывать AI вовсе.
  2. Model Gateway. Единая точка доступа: маршрутизация по классу данных, аутентификация, лимиты, журнал запросов, фильтрация секретов.
  3. Локальные модели. Сервер инференса внутри периметра для чувствительных данных.
  4. Облачные модели. Корпоративные договоры с запретом обучения на ваших данных — для всего остального.
  5. Аудит. Кто, что и в какую модель отправлял — чтобы инцидент можно было расследовать.

Инструменты разработчиков и агентов подключаются к шлюзу, а не к поставщикам напрямую. Поэтому модель можно заменить, не трогая рабочие места.

Как выбирать модели

Публичные рейтинги мало говорят о том, как модель поведёт себя на вашем коде и ваших документах. Надёжнее собрать набор из двадцати-тридцати собственных задач с известным правильным результатом и прогонять на нём кандидатов — и повторять проверку при выходе новых поколений.

Ограничения

  • Собственная инфраструктура — это эксплуатация: обновления, мониторинг, отказоустойчивость.
  • При небольшом объёме запросов локальный инференс дороже облачного в пересчёте на запрос.
  • Открытые модели выходят часто: выбранная сегодня через полгода может быть не лучшей. Архитектура со шлюзом делает замену дешёвой.

Что дальше

Приватный контур — часть общей платформы, описанной в материале AI в цикле разработки. Как это делается в виде услуги — на странице Private / Local AI.

Вопросы и ответы

Когда локальные модели действительно нужны?

Когда данные нельзя передавать третьим лицам — требования регулятора или заказчика, коммерческая тайна, персональные данные, закрытый контур без интернета. Вторая причина — предсказуемая стоимость при большом объёме однотипных запросов.

Насколько локальные модели хуже облачных?

Зависит от задачи. С классификацией, извлечением данных, поиском по документам и типовым кодом открытые модели справляются хорошо. В сложном многошаговом рассуждении и работе агентов с большими кодовыми базами лучшие облачные модели пока заметно сильнее. Разрыв меняется с каждым поколением, поэтому оценку стоит повторять.

Какое железо нужно для локальной модели?

Определяется размером модели и числом одновременных пользователей. Небольшие модели работают на рабочей станции с современной видеокартой или на компьютерах с большим объёмом унифицированной памяти; для команды нужен сервер с GPU и сервер инференса вроде vLLM. Точный расчёт делается после выбора моделей под конкретные задачи.

Нарушает ли использование облачных AI-сервисов закон о персональных данных?

Само по себе — нет, но передача персональных данных третьему лицу, тем более за рубеж, требует правовых оснований и оформления. Это вопрос к юристу компании. Технически риск снимается тем, что персональные данные не попадают в облачные запросы — за счёт маршрутизации и обезличивания.

Источники

  1. llama.cpp — LLM inference in C/C++ ggml-org (GitHub) · проверено 2026-09-20
  2. vLLM documentation vLLM project · проверено 2026-09-20
  3. Ollama Ollama · проверено 2026-09-20
  4. Федеральный закон «О персональных данных» от 27.07.2006 № 152-ФЗ КонсультантПлюс · 2006-07-27 · проверено 2026-09-20
  5. OWASP Top 10 for Large Language Model Applications OWASP · проверено 2026-09-20