Personal AI Server — свой LLM-контур на GPU

Personal AI Server — свой LLM-контур на GPU

Основатель: Павел Стасиньский

Собираем и запускаем персональный AI-сервер: 2× A100, Qwen 3.8 Flash Next, дашборд inference и агент в Telegram. Данные остаются у вас.

Bober AI Systems ставит Personal AI Server под ключ: от open-air стенда с 2× A100 до офисного on-prem контура.

Живой пример: Qwen 3.8 Flash Next · llama-flashnext на 2 GPU, дашборд Host/Inference/Health и агент в Telegram, который проверяет медиа, грузит в Drive и чистит диск по команде.

Qwen 3.8 Flash Next на 2× A100

Демо-стенд: open-air шасси, два серверных GPU, дашборд Host · Inference · Health и агент в Telegram, который работает с файлами на диске сервера.

От софта до контура под ключ

Стек на вашем железе

от 500 000 ₽

  • — Inference + модель (например Qwen 3.8 Flash Next)
  • — API / OpenAI-совместимый endpoint
  • — Базовый мониторинг host / GPU
  • — Документация и передача доступов

Personal AI Server под ключ

от 1 200 000 ₽

  • — Подбор / сборка GPU-контура (в т.ч. 2× A100)
  • — Proxmox / CT, сеть, хранилище
  • — Дашборд Host · Inference · Health
  • — Telegram-агент для операций на сервере

Secure / office on-prem

от 1 800 000 ₽

  • — Закрытый контур без утечки во внешние LLM
  • — SSO / VPN / политики доступа
  • — Аудит, бэкапы, SLA-сопровождение
  • — Интеграции CRM / RAG / агенты

В заявке укажите: уже есть ли GPU (A100 / H100 / др.), нужен ли только софт или железо под ключ, модель (Qwen / др.), доступ из Telegram / API.

Зачем свой сервер, а не только API

  • — Чувствительные документы и чаты не уходят во внешние LLM
  • — Нужен стабильный decode / prefill на своём железе
  • — Хотите агента, который реально работает на диске и в терминале
  • — Облако дорого или недоступно по политике компании

Что получаете

  • — Рабочий inference-стек на ваших или подобранных GPU
  • — Модель вроде Qwen 3.8 Flash Next (или аналог под задачу)
  • — Мониторинг host / GPU / temperatures / KV cache
  • — Опционально: Telegram-агент для файлов и операций

Как строим контур

01

Железо и сеть

GPU (в т.ч. 2× A100), питание, risers, Proxmox/CT, хранилище.

02

Inference

Стек под модель, API, KV cache, метрики prefill/decode.

03

Операции

Дашборд 24h + агент в Telegram для рутинных задач на сервере.

Контур Personal AI Server

  • — GPU-ноды → inference runtime → модель (Qwen Flash Next и др.)
  • — Мониторинг: CPU (EPYC), RAM, диск, сеть, температуры, IPMI
  • — Доступ: API, локальный UI, Telegram-агент с human-in-the-loop

Частые вопросы

Это облако или свой сервер?
Свой контур: home lab, офис или private cloud. Данные не обязаны уходить во внешние LLM API.
Обязательно 2× A100?
Нет. Подбираем GPU под модель и бюджет. 2× A100 — рабочий эталон для Qwen Flash Next в нашем демо.
Что с Telegram-агентом?
Опционально: агент выполняет операции на сервере (файлы, диск, проверки) с подтверждением человеком.
Можно только софт без покупки железа?
Да — пакет «стек на вашем железе» от 500 000 ₽, если GPU уже есть.

Получить оценку проекта

Опишите процесс, который нужно автоматизировать. Ответим в течение 4 рабочих часов, после 30-минутного созвона пришлём план и вилку бюджета за 24 часа.

Услуга: Personal AI Server

Ответим в течение 4 рабочих часов. После 30-минутного созвона пришлём предварительный план и вилку бюджета в течение 24 часов.

Напишите в свободной форме — что нужно сделать и как с вами связаться.

Telegram Позвонить