от 400 000 ₽

установка на вашем сервере

от 800 000 ₽

под ключ + RAG

от 1,5 млн ₽

secure on-prem

Локальные LLM для бизнеса

Основатель: Павел Стасиньский

Локальный запуск LLM на вашем сервере или подобранном GPU-контуре: установка, доступ пользователей, RAG и интеграции. От 400 000 ₽.

Запросы «локальный запуск llm», «сервер для локальной llm», «установка локальной llm» и «локальное развертывание llm» — про периметр и железо, не про демо-чат.

Bober Systems ставит локальные LLM для бизнеса: от стека на вашем GPU до office on-prem с RAG, CRM и SLA. Живой эталон железа — /personal-ai-server (2× A100, Qwen).

Модель без процессов бесполезна: связываем с базой знаний, документами и учётными системами. Закрытый контур безопасности — /secure-ai.

От сервера до доступа сотрудников

Установка, под ключ, secure

Установка на вашем сервере

от 400 000 ₽

  • — Подбор модели под GPU / CPU
  • — Runtime (vLLM / Ollama / аналог)
  • — OpenAI-совместимый API
  • — Документация и передача доступов

Локальный LLM под ключ

от 800 000 ₽

  • — Сервер / GPU под задачу (или ваше железо)
  • — Чат для сотрудников + роли
  • — Базовый RAG по регламентам
  • — Мониторинг, бэкапы, обучение IT

Secure / office on-prem

от 1 500 000 ₽

  • — Закрытый контур без внешних LLM API
  • — SSO / VPN / журнал запросов
  • — Интеграции CRM / 1С / документы
  • — SLA и сопровождение

В заявке укажите: уже есть ли GPU/сервер, нужен ли только софт или железо, число пользователей, нужен ли RAG и on-prem без облака.

Когда нужен локальный LLM

  • — Данные нельзя отправлять в публичный ChatGPT / облачные API
  • — Нужен сервер для локальной LLM и предсказуемый TCO
  • — IT хочет установку и развёртывание под свой периметр
  • — Сотрудникам нужен чат и поиск по регламентам без утечки

Что получаете

  • — Рабочий inference на вашем или подобранном железе
  • — API и чат для сотрудников с ролями
  • — Опционально: локальный RAG по документам компании
  • — Мониторинг GPU/host, runbook и передача IT

Этапы

01

Требования

Модель, QPS, латентность, GPU/CPU, сеть, compliance.

02

Установка

Runtime, API, чат, мониторинг. Пилот на одном отделе.

03

Production

Роли, RAG, интеграции, обучение IT, критерии приёмки.

Контур

  • — Сервер / GPU → inference runtime → модель (Qwen / Llama / др.)
  • — Доступ: API, Open WebUI / корпоративный чат, SSO по ТЗ
  • — Опционально: embeddings + векторная БД + ACL на документы
  • — Мониторинг: host, GPU, температура, очередь, журнал запросов

Частые вопросы

Чем отличается от /personal-ai-server?
Эта страница — оффер «локальные LLM для бизнеса» (установка, доступ, RAG). Personal AI Server — конкретный GPU-контур и демо-железо.
Нужен ли обязательно свой GPU?
Нет. Можно ваш сервер, наш подбор железа или изолированное РФ-облако. Сравниваем TCO на аудите.
Какую локальную LLM выбрать?
Зависит от языка, VRAM и задачи. Гайд — /guides/lokalnaya-llm-kakuyu-vybrat. Пилот на ваших промптах — от 100 000 ₽.
Можно без облака полностью?
Да — пакет Secure / office on-prem и /secure-ai.

Получить оценку проекта

Опишите процесс, который нужно автоматизировать. Ответим в течение 4 рабочих часов, после 30-минутного созвона пришлём план и вилку бюджета за 24 часа.

Услуга: Self-hosted AI

Ответим в течение 4 рабочих часов. После 30-минутного созвона пришлём предварительный план и вилку бюджета в течение 24 часов.

Напишите в свободной форме — что нужно сделать и как с вами связаться.

Telegram Позвонить