Новости

Аренда GPU-сервера для корпоративного RAG: конфигурация и бюджет

Дмитрий Потоцкий 1 мин чтения
Аренда GPU-сервера для корпоративного RAG: конфигурация и бюджет

ИТ-руководитель открывает прайс и видит аренду GPU-сервера от 50 000 рублей в месяц. Но за январь—май 2026 года выделенная GPU-инфраструктура в России обходилась заказчикам в среднем в 2,3 млн рублей в месяц. Разница — в 46 раз.

Защитить бюджет ценой «от» не получится. Сначала опиши нагрузку и рассчитай сервер. Потом запроси ставку именно на эту конфигурацию. В качестве примера возьмём корпоративный RAG — поиск ответов по внутренним документам без обучения большой модели с нуля.

Для RAG-пилота хватит одного сервера

Первый корпоративный RAG запускай на одном узле. Согласно руководству NVIDIA по конфигурации сертифицированных систем, одиночному серверу не нужна скоростная сеть для связи с другими узлами. InfiniBand, RoCE, NVLink и NVSwitch понадобятся, когда серверов станет несколько.

Свободное место рядом с серверами

Так из заявки исчезает дорогой запас «на ИИ». «Телеком биржа» заявляет канал до 400 Гбит/с. Кластеру он пригодится, одному RAG-серверу — нет.

Переходить к кластеру пора в двух случаях: модель вместе с рабочими данными не помещается в память одного узла или компания дообучает большую модель. «Телеком биржа» позволяет арендовать несколько физических серверов и развернуть Kubernetes, но для первого сервиса это уже следующий этап.

Форм-факторы и классы ускорителей разобраны в отдельном материале о серверах с GPU для ИИ, графики и Big Data. Здесь задача уже: рассчитать один узел под RAG.

Считай сервер от GPU

У «Телеком биржи» больше 100 готовых конфигураций. Выбирать среди них по числу ядер или объёму RAM рано. Сначала определи объём видеопамяти и количество GPU, затем считай процессоры и системную память.

Для инференса NVIDIA рекомендует сбалансированные узлы на 2, 4 или 8 GPU. На каждый ускоритель приходится минимум шесть физических ядер CPU. Системной памяти нужно хотя бы вдвое больше, чем суммарной видеопамяти.

Возьмём рабочий RAG-пилот с четырьмя GPU. Это расчётное допущение, а не характеристика услуги конкретного провайдера.

Нижняя граница по процессору:

4 GPU × 6 физических ядер = 24 физических ядра

В требованиях NVIDIA также указаны два процессорных сокета и базовая частота от 2,1 ГГц. Значит, заявка на два CPU с 24 ядрами суммарно проходит нижнюю границу. Добавлять ядра без профиля загрузки незачем: дефицит видеопамяти они всё равно не закроют.

Объём RAM зависит от памяти ускорителей:

Память одной GPUСуммарная видеопамятьМинимум RAM
24 ГБ96 ГБ192 ГБ
48 ГБ192 ГБ384 ГБ
80 ГБ320 ГБ640 ГБ

Формула одна: 2 × 4 × V, где V — память одной GPU. Модули нужно равномерно распределить между сокетами и каналами. Поэтому 384 ГБ в заявке стоит расписать, например, как 12 совместимых модулей ECC RDIMM по 32 ГБ.

Назначать конкретную модель GPU без размера модели, длины контекста и числа одновременных запросов рано. Поставщик должен указать модель ускорителя, объём памяти и режим выделения. Уточни, получит ли сервер всю карту или её ресурсы разделят между клиентами.

Диски считаются от базы знаний

Примем, что исходные документы занимают 2 ТБ. Ещё 2 ТБ отдадим индексу и производным данным. Столько же — временным файлам, обновлениям и журналам. Итого нужно 6 ТБ рабочего пространства.

Четыре NVMe по 3,84 ТБ в RAID10 дадут 7,68 ТБ полезной ёмкости:

4 × 3,84 ТБ ÷ 2 = 7,68 ТБ

После размещения расчётных 6 ТБ останется 1,68 ТБ. Но если исходные документы занимают не 2, а 4 ТБ, запаса уже нет. Тогда запрашивай восемь накопителей по 3,84 ТБ в RAID10 или выноси базу знаний во внешнее хранилище.

«Телеком биржа» заявляет аппаратные RAID-контроллеры, но не раскрывает состав накопителей каждой конфигурации. Не принимай строку «NVMe RAID» без расшифровки. В коммерческом предложении должны быть точные модели дисков, ресурс записи, схема массива и полезная ёмкость после RAID.

Аренда подходит для пилота, договор — для рабочего сервиса

«Телеком биржа» обещает запустить сервер от двух минут, увеличить мощность без замены собственного оборудования и разместить узел в ЦОДе Tier III. Компания проверяет гипотезу без капитальной закупки — в этом и состоит смысл аренды на старте.

Михаил Воронин из K2 Cloud тоже называет облачные GPU форматом для проверки гипотез и запуска минимально жизнеспособного продукта. Для пилота схема здравая: сначала измеряешь загрузку GPU и число одновременных запросов, затем решаешь, нужна ли собственная платформа.

Но стойка в ЦОДе ещё не делает пилот рабочим сервисом. Евгений Мартынов из «Рег.облака» советует проверять доступность ресурсов, предсказуемость производительности, набор ускорителей и гарантии уровня сервиса. Требования 152-ФЗ, PCI DSS и отраслевых норм закрепляй в договоре отдельно. Уровень Tier III их не подтверждает.

Сравнивать аренду с покупкой имеет смысл только после коммерческого предложения. Формула такая:

стоимость покупки, размещения и поддержки ÷ месячная аренда

Если рассчитанный сервер арендуют по ставке M, за год компания заплатит 12 × M. Пока M неизвестна, любой срок окупаемости будет выдумкой. Для собственного оборудования добавь стоимость размещения сервера в ЦОДе, каналов, ремонта и резервных узлов.

Спецификация под корпоративный RAG

Исходные данные для расчёта: база из 2 ТБ документов, четыре GPU и один рабочий RAG-сервис. Поставщику можно отправить такую заявку:

  • Один выделенный сервер высотой 4U с поддержкой четырёх двухслотовых GPU.
  • Четыре GPU по V ГБ каждая. Точную модель и режим выделения поставщик указывает в ответе.
  • Два CPU с базовой частотой от 2,1 ГГц, суммарно не меньше 24 физических ядер — по шесть ядер на GPU.
  • Не меньше 8V ГБ ECC RDIMM: 192 ГБ для карт по 24 ГБ, 384 ГБ для 48 ГБ, 640 ГБ для 80 ГБ.
  • Четыре NVMe по 3,84 ТБ в RAID10 — 7,68 ТБ после отказоустойчивого зеркалирования.
  • Два сетевых порта по 25 Гбит/с для доступа к сервису и хранилищу. Межсерверный канал 400 Гбит/с одному узлу не нужен.
  • Два блока питания с горячей заменой. Мощность поставщик рассчитывает по TDP выбранных GPU и CPU.
  • Размещение в ЦОДе Tier III.
  • SLA с временем реакции, сроком замены отказавшего узла и компенсацией за простой.
  • Свободные отсеки под четыре дополнительных накопителя или подключение внешнего хранилища.

Если сервис помещается в две GPU, нижняя граница падает до 12 физических ядер и 4V ГБ RAM. Для восьми GPU нужны минимум 48 ядер и 16V ГБ RAM. Модель не помещается в один узел — запрашивай кластер и отдельную схему межсерверной сети.

Аренда даёт возможность проверить RAG до покупки платформы. За эту свободу компания платит каждый месяц, и вывести сумму из рекламных 50 000 рублей нельзя. Запроси одну конфигурацию на 1, 6 и 12 месяцев. После пилота у тебя будут фактическая загрузка GPU, пиковое число запросов и срок жизни проекта. Вот тогда покупку можно честно сравнить с арендой.