Поделиться
Поделиться

«Локальный сервер для нейросетей», «сколько стоит сервер для AI» и «разработка с AI без облака» — частые запросы от команд, которые уперлись в лимиты API, утечки кода в чужие логи и запрет security на отправку документов в публичный ChatGPT. Локальный контур — не всегда дешевле облака, но часто единственный способ легально и предсказуемо встроить AI в процесс.

В OtherCode поднимаем такие серверы для внутренней разработки и для закрытых контуров заказчиков. Ниже — зачем это нужно, из чего состоит стенд и реалистичные вилки бюджета на 2026 год (без привязки к одному вендору).

Зачем локальный сервер, если есть API

Причина Что даёт on-prem / локальный стенд
ПДн и коммерческая тайна Код и документы не уходят к субоператору API
Предсказуемая latency Нет очередей «в пятницу вечером у OpenAI»
Стоимость на объёме После порога токенов свой GPU дешевле подписки
Кастомные модели Fine-tune, GGUF, внутренние веса
Офлайн и периметр Завод, НИИ, изолированные сети
Единый стандарт для команды Один endpoint для IDE, CI, RAG-песочницы

Минусы тоже честные: CapEx, администрирование, электричество, обновления CUDA, простой железа без резерва. Для MVP на 2 человека часто хватает облака; для отдела 10+ и постоянного RAG — локальный сервер часто выигрывает за 6–18 месяцев.

Для чего используют в разработке

  1. AI-assisted coding — приватный аналог Copilot (Continue, Cody self-hosted, tabby).
  2. RAG по внутренней wiki и репозиториям — онбординг, поиск по Confluence/GitLab.
  3. Тестирование промптов и агентов до выката в prod-контур.
  4. OCR и разбор документов на тестовых выборках без выноса в облако.
  5. CI-джобы — суммаризация diff, генерация release notes (с политикой «без секретов в промпте»).

Процессы команды — в оптимизации разработки с AI; продуктовый RAG — отдельный материал.

Конфигурации: от «рабочей станции» до стойки

Уровень 1 — рабочая станция / мини-сервер (команда 1–3 чел.)

Компонент Ориентир
GPU 1× RTX 4090 24 GB или RTX 5090
CPU 16–24 ядра
RAM 64–128 GB
SSD 2 TB NVMe
Бюджет железа ≈ 350 000 – 550 000 ₽

Подходит: 7B–14B модели, быстрый coding assist, небольшой RAG до ~100k чанков.

Уровень 2 — сервер в стойке (команда 5–15, RAG, 32B+)

Компонент Ориентир
GPU 1–2× RTX 6000 Ada 48 GB или A6000
CPU 32+ ядер
RAM 256 GB
SSD 4 TB NVMe + HDD под архивы
Бюджет железа ≈ 1,2 – 2,5 млн ₽

Подходит: 32B–70B в квантизации, параллельные разработчики, серьёзный vector store.

Уровень 3 — enterprise / закрытый контур

Компонент Ориентир
GPU 2–4× A100 80 GB / H100 (или аналоги у российских интеграторов)
Отказоустойчивость 2 узла, бэкапы, мониторинг
Бюджет от 5 млн ₽ (сильно зависит от поставки и SLA)

Нужен для AI в закрытом контуре с ПДн, HA и аудита.

Цены — ориентиры рынка РФ на 2026 год, без НДС и без стоимости внедрения.

Скрытые статьи расходов

Статья Комментарий
Электричество GPU 300–700 W под нагрузкой — считайте в TCO
Администрирование Патчи, бэкапы, мониторинг — 0,2–0,5 FTE
Лицензии Не у всех моделей коммерческое использование бесплатно
Интеграция SSO, RAG, CI — разработка, не только «купили железо»
Обновление GPU Цикл 3–4 года для активной нагрузки

Программный стек (типовой)

  • Inference: vLLM, Ollama, llama.cpp, Triton
  • RAG: PostgreSQL + pgvector, Qdrant self-hosted
  • Оркестрация: Docker Compose → Kubernetes при росте
  • Мониторинг: Prometheus, Grafana, логи запросов
  • Доступ: reverse proxy, mTLS, VPN

Мы не привязываем заказчика к одному вендору — выбор LLM зависит от задачи и периметра.

Когда локальный сервер не нужен

  • Пилот на 2 недели без ПДн — хватит API.
  • Редкие запросы (< 1 млн токенов/мес) — подписка проще.
  • Нет админа и не планируется — облако с DPA надёжнее «пыли на GPU».

Как мы помогаем

  1. Расчёт TCO — API vs on-prem под ваш объём.
  2. Спецификация железа под сценарий (coding / RAG / OCR).
  3. Развёртывание в периметре заказчика или в ЦОД.
  4. Интеграция с GitLab, IDE, процессами AI-разработки.

FAQ

Хватит ли Mac Studio M2 Ultra?
Для личного coding assist — да. Для командного RAG на 32B и PostgreSQL — обычно нет, нужен дискретный GPU с большим VRAM.

Можно ли арендовать GPU в РФ вместо покупки?
Да. Имеет смысл для пиков и обучения; для постоянного inference с ПДн часто выгоднее свой сервер в периметре.

Сколько VRAM нужно для Llama 70B?
В Q4 — порядка 40–48 GB; комфортнее 2× 48 GB для запаса и параллельных запросов.

Окупается ли за год?
При 10+ разработчиках и активном RAG/API часто да. Калькулятор: (токены/мес × цена токена × 12) vs CapEx + электричество + админ.


Итог: локальный сервер для разработки с AI — инвестиция в контроль, приватность и предсказуемость. Старт с уровня 1 (одна мощная GPU) закрывает большинство командных сценариев; закрытый контур с ПДн требует уровня 2–3 и юридической схемы.

Читайте также: AI в закрытом контуре и 152-ФЗ · AI-разработка · направления студии