Выбор сервера под задачу

GPU для промышленного ИИ: покупать сервер или арендовать

Дмитрий Потоцкий 1 мин чтения
GPU для промышленного ИИ: покупать сервер или арендовать

Компания запускает поиск по внутренним документам и помощника на модели 7B. Для дообучения нужны 4–8 GPU на несколько часов, а сервер с восемью NVIDIA H100 стоит 15–44 млн ₽. После запуска модели дорогой узел рискует большую часть недели ждать следующего задания.

На бюджетном комитете нужно защитить один из трёх вариантов: аренда для пилота, покупка сервера под постоянную нагрузку или гибрид — свой узел для инференса, облако для редкого дообучения. Решение зависит не от желания «держать ИИ у себя», а от загрузки GPU и допустимого простоя.

Сначала подтверждай поставку, потом защищай конфигурацию

Согласованный сервер может исчезнуть до подписания договора. По оценке ИТ-института, спрос на GPU-мощности в России превышает предложение на 50%. «Сервер Молл» сообщает, что партии из 20–30 GPU-серверов разбирают за день, иногда — за несколько часов.

Серверный ящик у пустой стойки

Дефицит касается не только H100. Решения по проектам с H200, B200 и B300 поставщики принимают за дни: покупатель либо фиксирует оборудование и условия, либо партия уходит другому заказчику. В 2025 году двухмесячная задержка одного проекта с H200 привела к двукратному росту его стоимости — такой случай приводит коммерческий директор «Сервер Молл» Сергей Алимушкин.

Рынок предлагает три канала поставки. Заказ от производителя занимает 10–12 недель. Покупка через промежуточного клиента — 6–8 недель. Оборудование со склада доступно быстрее, но продавец включает дефицит в цену, а поддержка может оказаться номинальной.

С конца 2024 года NVIDIA усилила проверку конечных получателей и отслеживание серийных номеров, сообщает ComNews. Поставщик может запросить сведения о компании и фотографии установленного оборудования. К 2026 году поставки H100 в Россию сократились до десятков ускорителей, по данным Techora.

Поэтому в заявке на бюджет лучше фиксировать не единственный артикул, а границы закупки:

  • платформа класса NVIDIA HGX с восемью H100;
  • максимальная цена и крайняя дата решения;
  • допустимые каналы и срок поставки;
  • происхождение оборудования;
  • гарантия на весь узел, а не на отдельные ускорители;
  • условия проверки конечного получателя.

Так закупщик сможет сменить производителя сервера, не пересобирая проект. Но заменить платформу на набор похожих по характеристикам ускорителей без теста нельзя: паспортные терафлопсы ещё не показывают скорость твоей модели.

Редкое дообучение не окупает восемь H100

Считаем сценарий компании с одной моделью 7B. Несколько раз в месяц команда запускает дообучение на 4–8 GPU, затем использует модель для поиска по документам и ответов сотрудникам. Сервис должен отвечать не дольше трёх секунд.

По данным ИТ-института, дообучение модели такого размера занимает 4–8 GPU на несколько часов. Возьмём верхнюю границу: восемь ускорителей работают по восемь часов четыре раза в месяц. Получается 256 GPU-часов, или 32 часа загрузки всего восьмиускорительного узла.

В 30-дневном месяце у узла 720 часов. Дообучение займёт 32 из них — около 4,4%. Покупать сервер за 15–44 млн ₽ только ради такой работы нельзя обосновать загрузкой. Даже если запускать обучение каждую неделю по 16 часов, утилизация узла останется около 9%.

В этом сценарии дообучение нужно арендовать. Neocloud предлагает посекундный расчёт и автоматическое масштабирование, поэтому компания платит за часы работы, а не за месяц простоя. Рост доли GPU-облаков с 12,3% в 2024 году до 27,4% в 2026-м показывает, что такой выбор перестал быть временной мерой для пилотов.

Собственный сервер появляется в расчёте, когда его постоянно занимает инференс. Techora называет коридор утилизации 60–90% экономически оправданным для своей инфраструктуры. Для одного узла это 432–648 часов в месяц.

Порог в 60% — не обещание окупаемости. Он лишь отсекает покупку, при которой оборудование заведомо простаивает. Для финансового решения всё равно нужно сравнить цену аренды за 432–648 часов с капитальными затратами, электричеством, размещением и поддержкой собственного сервера.

Получается простое правило. Редкие запуски обучения уходят в облако. Постоянный инференс с загрузкой выше 60% можно переносить на свой узел. Если обучение приходит всплесками, а инференс работает ежедневно, эти две нагрузки не нужно насильно помещать на одно железо.

Китайские ускорители сначала проверяй на своей модели

В Россию уже поставляют ускорители Metax, Biren BR100 и BR104, Moore Threads MTT S4000 и Iluvatar BI‑V150. ИТ-институт также сообщает, что YADRO Vegman, Aquarius и Rikor начинают интегрировать китайские GPU в свои платформы.

Для инференса такой вариант заслуживает теста. В собранных ИТ-институтом бенчмарках разрыв с NVIDIA H100 на инференсе минимален, а на обучении LLM китайские ускорители отстают на 20–40%.

Эти числа нельзя переносить прямо в смету. Скорость зависит от модели, точности вычислений, размера батча, драйверов и программного стека. Возьми у поставщика узел на тест и прогони свою модель с целевым контекстом и ограничением ответа в три секунды.

Если альтернативная платформа укладывается в задержку и держит нужное число одновременных запросов, переплата за H100 инференсу не помогает. Если узел нужен прежде всего для обучения и срок расчёта влияет на выпуск модели, отставание на 20–40% уже превращается в рабочие часы команды.

Спецификация под задачу

Берём типовой сценарий: одна модель 7B, дообучение на 4–8 GPU несколько раз в месяц и постоянный сервис ответов с задержкой до трёх секунд. Инференс занимает узел не меньше 432 часов в месяц — это нижняя граница загрузки 60%.

Ускорители: восемь NVIDIA H100 в сервере на платформе класса NVIDIA HGX. В документации NVIDIA HGX объединяет GPU, NVLink, NVIDIA networking и программный стек для ИИ и высокопроизводительных вычислений.

Связь между GPU: NVLink и NVSwitch внутри сертифицированной HGX-платформы. Shared NVSwitch Mode позволяет передавать GPU виртуальным машинам, если командам или сервисам нужно разделить один узел.

Процессоры, память, накопители и сетевые адаптеры: только из сертифицированной спецификации выбранного сервера HGX. Исходные материалы не дают нагрузки на подготовку данных, размер датасета и объём кэша, поэтому назвать 1 или 2 ТБ памяти либо определённое число NVMe означало бы придумать конфигурацию. Поставщик должен подтвердить совместимость узла целиком и передать его ведомость компонентов.

Питание и корпус: заводская конфигурация выбранной HGX-платформы с резервированием блоков питания. До заказа площадка должна подтвердить электрическую мощность, охлаждение, массу и глубину корпуса по паспорту конкретной модели.

Бюджет: 15–44 млн ₽ за один сервер с восемью H100, по данным Techora. Разброс почти втрое отражает канал поставки, состояние оборудования, комплектацию и дефицит. Проси расшифровку цены по всему узлу.

Резерв: второй идентичный сервер, если простой инференса недопустим. Аппаратный бюджет составит 30–88 млн ₽: 2 × (15–44 млн ₽). Два разных узла усложнят перенос нагрузки и поддержку, поэтому резерв лучше собирать на той же платформе и с тем же программным стеком.

Эта спецификация дорога для редкого обучения: при четырёх восьмичасовых запусках в месяц узел занят лишь на 4,4%. Зато при постоянном инференсе ты не зависишь от наличия свободных облачных GPU. За независимость платишь вторым сервером, своей эксплуатацией и запасом мощности площадки.

Что нести на бюджетный комитет

Для пилота и редкого дообучения модели 7B арендуй 4–8 GPU на время расчёта. Покупка восьми H100 при загрузке в несколько процентов замораживает 15–44 млн ₽ в простаивающем сервере.

При постоянном инференсе и подтверждённой загрузке 60–90% закладывай один восьмиускорительный узел. Обучение всплесками оставь в облаке: оно не должно занимать собственную платформу лишь несколько часов в месяц.

Если сервис не может ждать ремонта, нужны два одинаковых узла и аппаратный бюджет 30–88 млн ₽. RAID и резервные блоки питания не заменяют второй сервер при отказе системной платы, NVSwitch или самого узла.

Перед заказом запроси у поставщика срок поставки по конкретному каналу, происхождение оборудования, заводскую ведомость компонентов, гарантию на весь сервер и порядок проверки конечного получателя. Для сравнения платформ используй подбор серверов с GPU под ИИ и Big Data.

Решение укладывается в одну строку: аренда — пока GPU нужны эпизодически; свой сервер — когда инференс занимает его хотя бы 432 часа в месяц; два сервера — когда простой стоит дороже второго узла.