Поделиться
Поделиться

Запросы «AI в закрытом контуре», «on-prem LLM» и «нейросеть персональные данные 152-ФЗ» в 2026 году — не паранойя compliance, а рабочая необходимость: банки, медицина, промышленность, кадровые и документные системы не могут отправлять ПДн в публичный API без юридической проработки. При этом бизнес хочет RAG по регламентам, суммаризацию договоров и помощника оператору — внутри периметра.

В OtherCode мы проектируем такие контуры для AI-разработки и сложных enterprise-систем: от выбора модели до аудита и эксплуатации. Ниже — практическая схема без юридических гарантий (конкретный кейс всегда согласуется с вашим DPO и юристом).

Когда нужен закрытый контур для AI

Ситуация Почему облачный API рискован Типовое решение
ПДн сотрудников и клиентов в промптах Трансграничная передача, субобработчики On-prem / private cloud в РФ
Коммерческая тайна, чертежи, ТЗ Утечка в training / логах провайдера Локальный inference, без обучения на данных
Отраслевые регламенты (медицина, финансы) Жёсткие требования к месту обработки Выделенный AI-сервер + сегментация сети
Госзаказ и грифы Запрет выноса за контур Air-gapped или VPN-only сегмент

Закрытый контур здесь — не обязательно «сервер без интернета». Это контролируемый периметр: данные не покидают согласованную инфраструктуру, доступ логируется, модели и зависимости — воспроизводимы.

Архитектура AI-сервера в периметре

Типовой стек, который мы собираем для заказчиков:

[Пользователи / операторы]
        ↓ HTTPS (внутр. CA)
[API Gateway + auth (SSO/LDAP)]

[RAG-сервис] ←→ [Vector DB / PostgreSQL + pgvector]
        ↓              ↑
[LLM inference]    [Хранилище документов (шифрование)]
  (vLLM / Ollama /   только с ACL по ролям
   Triton + GGUF)

[Журналы аудита, метрики, алерты]

Слои, которые нельзя пропустить

  1. Идентификация — кто задал вопрос; привязка к роли и к набору документов.
  2. Минимизация данных в промпте — маскирование ФИО, паспортов, счетов до отправки в модель (если политика требует).
  3. Retrieval с ACL — пользователь видит в ответе только те чанки, к которым у него есть право в ECM/БД.
  4. Запрет обучения на прод-данных без отдельного решения и правового основания.
  5. Журналирование — запрос, user id, источники цитат, версия модели; срок хранения по политике.
  6. Обновления — план патчей ОС, CUDA, образов моделей без «ручного ssh когда-нибудь».

Подробнее о продуктовом RAG — в статье про внедрение ИИ. О безопасности контура в целом — кибербезопасность 2026.

Персональные данные и 152-ФЗ: что учитывать в продукте

Мы не заменяем юриста, но в ТЗ закладываем технические меры, которые аудиторы и DPO обычно ожидают увидеть:

Требование (логика compliance) Техническая реализация
Определение целей обработки Отдельные сценарии (HR-бот ≠ клиентский чат)
Ограничение доступа RBAC, least privilege, SSO
Учёт действий Audit log, SIEM-интеграция
Локализация Серверы и бэкапы в согласованном регионе
Договор с оператором / субоператором DPA в контракте на внедрение и поддержку
Удаление / актуализация TTL индексов, переиндексация при отзыве документа

Если в контур попадают биометрия или особые категории — требования жёстче; нейро-проекты (BCI) мы выносим в отдельную оценку — см. нейроинтерфейсы.

Типовые ошибки

  • «Развернули Ollama на ноутбуке юриста» — нет аудита, бэкапов, патчей.
  • Смешали тестовые и боевые ПДн в одном индексе embeddings.
  • Отправили тот же контур в публичный API «для сравнения качества».
  • Нет eval — модель галлюцинирует по регламентам, операторы теряют доверие и обходят систему.

On-prem LLM: что выбрать под задачу

Класс модели Когда достаточно Железо (ориентир)
7B–14B quantized FAQ, классификация, черновики 1× GPU 24 GB
32B–70B Сложный RAG, юридические тексты 2× GPU 48–80 GB или квантизация
API-only в периметре Уже есть лицензия enterprise у вендора Выделенный endpoint без интернета

Качество ответа зависит не только от VRAM: важны чанкинг, цитаты, eval на ваших документах. Иногда гибрид «малая модель + правила + retrieval» бьёт «большую модель без RAG».

Этапы внедрения с OtherCode

  1. Аудит данных — какие категории ПДн, откуда документы, кто пользователи.
  2. Пилот в изолированном сегменте — 50–200 документов, метрики качества.
  3. Производственный контур — HA, мониторинг, runbook, обучение операторов.
  4. Сопровождение — обновление моделей, переиндексация, реакция на инциденты.

Связанные материалы: локальный сервер для разработки с AI, оптимизация разработки с AI.

FAQ

Можно ли использовать YandexGPT / GigaChat в закрытом контуре?
Зависит от договора и схемы размещения у провайдера. Часто enterprise-контракт допускает выделенный endpoint; для части заказчиков нужен полностью свой inference — тогда open-weight модели on-prem.

Нужен ли air-gap?
Редко. Чаще достаточно private network, исходящего интернета нет у inference-сервера, обновления — через доверенный канал.

Кто оператор ПДн при on-prem у заказчика?
Обычно заказчик; интегратор — по договору поручения / субоператор с ограниченным доступом. Фиксируется в DPA.

Сколько это стоит?
Зависит от GPU, HA и объёма RAG. Ориентиры по железу — в статье про локальный AI-сервер.


Итог: AI в закрытом контуре — это архитектура (auth, RAG, ACL, аудит) плюс юридически согласованные процессы. On-prem LLM решает задачу периметра, но не отменяет eval, минимизацию ПДн в промптах и дисциплину эксплуатации.

Направления OtherCode: AI-разработка · сложные проекты · все направления