Запросы «AI в закрытом контуре», «on-prem LLM» и «нейросеть персональные данные 152-ФЗ» в 2026 году — не паранойя compliance, а рабочая необходимость: банки, медицина, промышленность, кадровые и документные системы не могут отправлять ПДн в публичный API без юридической проработки. При этом бизнес хочет RAG по регламентам, суммаризацию договоров и помощника оператору — внутри периметра.
В OtherCode мы проектируем такие контуры для AI-разработки и сложных enterprise-систем: от выбора модели до аудита и эксплуатации. Ниже — практическая схема без юридических гарантий (конкретный кейс всегда согласуется с вашим DPO и юристом).
Когда нужен закрытый контур для AI
| Ситуация | Почему облачный API рискован | Типовое решение |
|---|---|---|
| ПДн сотрудников и клиентов в промптах | Трансграничная передача, субобработчики | On-prem / private cloud в РФ |
| Коммерческая тайна, чертежи, ТЗ | Утечка в training / логах провайдера | Локальный inference, без обучения на данных |
| Отраслевые регламенты (медицина, финансы) | Жёсткие требования к месту обработки | Выделенный AI-сервер + сегментация сети |
| Госзаказ и грифы | Запрет выноса за контур | Air-gapped или VPN-only сегмент |
Закрытый контур здесь — не обязательно «сервер без интернета». Это контролируемый периметр: данные не покидают согласованную инфраструктуру, доступ логируется, модели и зависимости — воспроизводимы.
Архитектура AI-сервера в периметре
Типовой стек, который мы собираем для заказчиков:
[Пользователи / операторы]
↓ HTTPS (внутр. CA)
[API Gateway + auth (SSO/LDAP)]
↓
[RAG-сервис] ←→ [Vector DB / PostgreSQL + pgvector]
↓ ↑
[LLM inference] [Хранилище документов (шифрование)]
(vLLM / Ollama / только с ACL по ролям
Triton + GGUF)
↓
[Журналы аудита, метрики, алерты]
Слои, которые нельзя пропустить
- Идентификация — кто задал вопрос; привязка к роли и к набору документов.
- Минимизация данных в промпте — маскирование ФИО, паспортов, счетов до отправки в модель (если политика требует).
- Retrieval с ACL — пользователь видит в ответе только те чанки, к которым у него есть право в ECM/БД.
- Запрет обучения на прод-данных без отдельного решения и правового основания.
- Журналирование — запрос, user id, источники цитат, версия модели; срок хранения по политике.
- Обновления — план патчей ОС, CUDA, образов моделей без «ручного ssh когда-нибудь».
Подробнее о продуктовом RAG — в статье про внедрение ИИ. О безопасности контура в целом — кибербезопасность 2026.
Персональные данные и 152-ФЗ: что учитывать в продукте
Мы не заменяем юриста, но в ТЗ закладываем технические меры, которые аудиторы и DPO обычно ожидают увидеть:
| Требование (логика compliance) | Техническая реализация |
|---|---|
| Определение целей обработки | Отдельные сценарии (HR-бот ≠ клиентский чат) |
| Ограничение доступа | RBAC, least privilege, SSO |
| Учёт действий | Audit log, SIEM-интеграция |
| Локализация | Серверы и бэкапы в согласованном регионе |
| Договор с оператором / субоператором | DPA в контракте на внедрение и поддержку |
| Удаление / актуализация | TTL индексов, переиндексация при отзыве документа |
Если в контур попадают биометрия или особые категории — требования жёстче; нейро-проекты (BCI) мы выносим в отдельную оценку — см. нейроинтерфейсы.
Типовые ошибки
- «Развернули Ollama на ноутбуке юриста» — нет аудита, бэкапов, патчей.
- Смешали тестовые и боевые ПДн в одном индексе embeddings.
- Отправили тот же контур в публичный API «для сравнения качества».
- Нет eval — модель галлюцинирует по регламентам, операторы теряют доверие и обходят систему.
On-prem LLM: что выбрать под задачу
| Класс модели | Когда достаточно | Железо (ориентир) |
|---|---|---|
| 7B–14B quantized | FAQ, классификация, черновики | 1× GPU 24 GB |
| 32B–70B | Сложный RAG, юридические тексты | 2× GPU 48–80 GB или квантизация |
| API-only в периметре | Уже есть лицензия enterprise у вендора | Выделенный endpoint без интернета |
Качество ответа зависит не только от VRAM: важны чанкинг, цитаты, eval на ваших документах. Иногда гибрид «малая модель + правила + retrieval» бьёт «большую модель без RAG».
Этапы внедрения с OtherCode
- Аудит данных — какие категории ПДн, откуда документы, кто пользователи.
- Пилот в изолированном сегменте — 50–200 документов, метрики качества.
- Производственный контур — HA, мониторинг, runbook, обучение операторов.
- Сопровождение — обновление моделей, переиндексация, реакция на инциденты.
Связанные материалы: локальный сервер для разработки с AI, оптимизация разработки с AI.
FAQ
Можно ли использовать YandexGPT / GigaChat в закрытом контуре?
Зависит от договора и схемы размещения у провайдера. Часто enterprise-контракт допускает выделенный endpoint; для части заказчиков нужен полностью свой inference — тогда open-weight модели on-prem.
Нужен ли air-gap?
Редко. Чаще достаточно private network, исходящего интернета нет у inference-сервера, обновления — через доверенный канал.
Кто оператор ПДн при on-prem у заказчика?
Обычно заказчик; интегратор — по договору поручения / субоператор с ограниченным доступом. Фиксируется в DPA.
Сколько это стоит?
Зависит от GPU, HA и объёма RAG. Ориентиры по железу — в статье про локальный AI-сервер.
Итог: AI в закрытом контуре — это архитектура (auth, RAG, ACL, аудит) плюс юридически согласованные процессы. On-prem LLM решает задачу периметра, но не отменяет eval, минимизацию ПДн в промптах и дисциплину эксплуатации.
Направления OtherCode: AI-разработка · сложные проекты · все направления

