Новости

Спрос на ИИ-серверы растёт. Что закладывать в закупку

Дмитрий Потоцкий 1 мин чтения
Спрос на ИИ-серверы растёт. Что закладывать в закупку

86% участников опроса NVIDIA собираются увеличить бюджет на ИИ в 2026 году. Деньги уже закладывают, хотя у многих компаний спецификация будущего сервера пока сводится к двум словам: «нужны GPU».

Рост спроса заставляет раньше проверять сроки поставки, питание и охлаждение. Но он не отвечает, сколько ускорителей нужно твоей компании. Для закупки нужны собственная нагрузка, целевая скорость и результат теста на сопоставимом оборудовании.

Отчёт NVIDIA не заменяет расчёт нагрузки

В опросе NVIDIA State of AI участвовали более 3200 респондентов из финансов, ретейла, здравоохранения, телекома и производства. 64% компаний уже используют ИИ в работе, ещё 28% оценивают варианты внедрения. Это широкий срез, но не независимое исследование рынка оборудования.

Стойки с трубами жидкостного охлаждения

Показатель выручки тоже требует аккуратной формулировки. 88% респондентов сообщили, что ИИ повлиял на рост годовой выручки их компаний. Это не означает, что NVIDIA удвоила собственную выручку: отчёт State of AI 2026 не содержит финансовой отчётности производителя и сравнения его результатов по годам.

Для спецификации сервера эти проценты бесполезны. Они показывают направление бюджетов, но ничего не говорят о размере модели, числе запросов, времени обучения и допустимом простое.

Под словом «ИИ» скрываются разные серверы

62% участников опроса NVIDIA включили анализ данных в число основных ИИ-нагрузок, 61% — генеративный ИИ. Ещё 44% компаний внедряли или оценивали ИИ-агентов в конце 2025 года.

Эти задачи по-разному используют железо. Пакетный анализ данных может упираться в объём памяти и чтение набора данных. Инференс — выполнение уже обученной модели — зависит от размера модели, длины контекста, числа одновременных запросов и требуемого времени ответа. Обучение добавляет обмен данными между ускорителями.

Поэтому запрос «сервер для ИИ» нельзя сразу переводить в коммерческое предложение. Сначала запиши одну рабочую операцию: например, обработать десять одновременных запросов к модели при согласованном времени ответа. Если постоянной нагрузки ещё нет, сравни покупку GPU-сервера с арендой до заказа оборудования.

GB200 NVL72 — не ориентир для корпоративного пилота

NVIDIA GB200 NVL72 объединяет 36 процессоров Grace и 72 ускорителя Blackwell в стойке с жидкостным охлаждением. Все ускорители входят в единый домен NVLink с пропускной способностью обмена 130 ТБ/с.

По спецификации NVIDIA GB200 NVL72 платформа ускоряет инференс моделей с триллионом параметров до 30 раз, а обучение — до четырёх раз относительно H100. Это заявления производителя для указанных сценариев, а не универсальный коэффициент для любой модели.

Такая стойка нужна, когда нагрузка распределяется по десяткам связанных GPU. Генерация внутренних документов, классификация обращений или пилот корпоративного помощника этого ещё не доказывают.

Даже младшая конфигурация GB200 NVL4 содержит четыре GPU и два Grace CPU. NVIDIA указывает её совместимость с жидкостно-охлаждаемыми серверами MGX. Вместе с ценой оборудования придётся считать контуры охлаждения, электропитание и готовность помещения. Отдельный разбор иммерсионного охлаждения серверов поможет оценить инженерную часть проекта, хотя NVL72 использует собственную жидкостную схему, а не погружение оборудования.

Для стоек с воздушным охлаждением NVIDIA предлагает RTX PRO 6000 Blackwell Server Edition. Однако одной совместимости со стойкой мало: в материалах программы сертификации нет цены, энергопотребления всей системы и результата на твоей модели.

Сертификация отсекает несовместимые системы, но не выбирает победителя

Короткий список стоит начинать с NVIDIA-Certified Systems. По документации программы такие системы проверяют с TensorFlow и PyTorch, TensorRT и Triton, а также RAPIDS. Серверы дата-центров тестируют как отдельные узлы и в связке из двух узлов.

Сертификат подтверждает, что конкретное сочетание GPU, сервера, сети и программного окружения прошло набор испытаний NVIDIA. Он не обещает нужное тебе время ответа и не сравнивает стоимость вариантов.

После сертификации смотри MLPerf. Этот набор тестов измеряет время, за которое система обучает модель до заданного показателя качества. MLCommons проводит несколько прогонов, отбрасывает лучший и худший результаты, затем усредняет остальные.

Сравнивай строки с одной моделью, набором данных, целевым качеством и сценарием. Для закупки бери результаты из категории Available: по правилам MLPerf Training туда попадают компоненты, которые уже можно купить или арендовать. Preview относится к системам следующего раунда, RDI — к экспериментальному и внутреннему оборудованию.

Бенчмарк останется фильтром, а не приёмочным испытанием. Финальный кандидат должен выполнить твою модель на твоих данных.

Спецификация под задачу

Возьмём типовой пилот: одна модель помещается вместе с программным окружением в 32 ГБ памяти GPU, сервис принимает до десяти одновременных запросов, а обучение крупных моделей компания не планирует. Это условие закупки: если тест показывает, что 32 ГБ не хватает, конфигурация ниже отпадает целиком.

Для такого пилота короткий список можно строить вокруг NVIDIA RTX PRO 4500 Blackwell с 32 ГБ GDDR7. Этот объём указан в документации NVIDIA-Certified Systems. Готовая конфигурация выглядит так:

  • Один RTX PRO 4500 Blackwell 32 ГБ. Второй ускоритель добавляй только после теста, который покажет нехватку пропускной способности или памяти.
  • 16 физических ядер CPU. Расчётное допущение — одно ядро обслуживает два параллельных запроса и подготовку данных: десять запросов дают пять ядер, ещё три уходят системным службам. Удваиваем восемь ядер до 16, чтобы не менять процессор при росте сервиса.
  • 128 ГБ ECC RDIMM. Закладываем 32 ГБ системе, 64 ГБ под подготовку данных и промежуточные буферы, ещё 32 ГБ оставляем под рост. Если рабочий набор на CPU превышает 64 ГБ, прибавляй его превышение к общему объёму памяти.
  • Два NVMe по 1,92 ТБ в RAID1. Допущение — три версии модели и связанные файлы занимают по 300 ГБ, временные данные — ещё 500 ГБ. Получается 1,4 ТБ; оставшиеся 520 ГБ нужны для обновления модели и служебных операций. RAID1 даёт 1,92 ТБ полезного объёма, а не 3,84 ТБ.
  • Сеть 25 Гбит/с до хранилища. Теоретический предел — 3,125 ГБ/с: 32 ГБ данных передаются примерно за 10 секунд без учёта протокольных потерь и скорости накопителей. При редкой загрузке модели хватит 10 Гбит/с, но передача тех же 32 ГБ займёт не меньше 26 секунд.
  • Два блока питания с резервированием. Их мощность поставщик должен рассчитать по выбранному CPU, GPU, дискам и вентиляторам, оставив запас согласно требованиям производителя сервера.
  • Корпус из списка NVIDIA-Certified Systems с местом ещё под один GPU, свободными слотами памяти и отсеками для двух дополнительных NVMe. Форм-фактор выбирай после проверки длины ускорителя, числа занимаемых слотов и воздушного потока.

Эта спецификация отвечает на задачу пилота, а не крупного обучения. Если модель не помещается в 32 ГБ, сначала переходи к ускорителю с большим объёмом памяти. Если один запрос уже занимает почти всю память GPU, второй ускоритель не превратит два устройства в единый пул автоматически: это должна поддерживать модель и программный стек.

При постоянной загрузке двух GPU сравни стоимость покупки с арендой на фактическом числе часов. При потребности в четырёх и более ускорителях придётся заново считать сеть между GPU, питание стойки и охлаждение. Механически умножать пилотный сервер нельзя.

Что новость меняет для закупщика

Рост ИИ-бюджетов означает, что наличие подходящего сервера нужно проверять раньше. Запас из ускорителей без подтверждённой нагрузки он не оправдывает.

Принеси директору не график рынка, а четыре строки: какую операцию выполняет модель, какой результат нужен, на каком сервере это проверили и сколько стоит один месяц работы. После этого решение становится проверяемым:

  • модель помещается в один GPU и пилот проходит по скорости — покупай один ускоритель с возможностью поставить второй;
  • нагрузка возникает несколько дней в месяц — сравни аренду с полной стоимостью собственного узла;
  • задача требует десятков связанных GPU — считай стойку, сеть, питание и охлаждение как единый проект;
  • поставщик показывает рекламный множитель — проси результат MLPerf на сопоставимой модели или запускай свой тест.