В 4U помещаются восемь двухслотовых ускорителей PCIe 5.0 ×16 мощностью до 600 Вт каждый. Но восемь GPU и два процессора по 350 Вт дают расчётный предел 5,5 кВт — ещё без памяти, накопителей, сетевых плат и вентиляторов.
Вердикт такой: G4208P G3 стоит включить в короткий список для локального обучения, постоянного инференса и HPC, если площадка принимает узел глубиной до 928,1 мм, массой до 65 кг и с потреблением свыше 5,5 кВт. Для обычной виртуализации и 1С восемь GPU не окупают четыре занятых юнита, дополнительное питание и охлаждение.
Восемь слотов не означают восемь проверенных H200
В спецификации G4208P G3 YADRO перечисляет H200 NVL, RTX PRO 6000 Blackwell, L40S, A30, A16, RTX 6000 Ada, RTX 4000 Ada, L4 и MetaX C500. Платформа принимает до восьми GPU двойной ширины и позволяет объединять по два или четыре ускорителя через NVLink Bridge.

Это перечень совместимых моделей, а не отчёт об испытании каждой возможной сборки. В сообщении об интеграции новых ускорителей, опубликованном www1.ru, подтверждена стабильная работа конфигурации с четырьмя H200 и успешная валидация RTX PRO 6000 Blackwell. Проверки восьми H200 в опубликованных данных нет.
Для заявки поставщику разница принципиальна. Формулировка «сервер поддерживает H200» не подтверждает, что выбранные восемь ускорителей прошли испытания вместе с конкретными процессорами, памятью, накопителями и схемой резервирования питания.
Перед выбором самой платформы полезно сверить архитектуру узла с профилем ИИ-задачи. G4208P G3 даёт широкий набор GPU, но не отменяет расчёт под модель, объём данных и режим работы.
H200 — для обмена между GPU, RTX PRO 6000 — для определённого инференса
H200 стоит рассматривать для обучения и вычислений, где ускорители постоянно обмениваются данными. Основание здесь даёт не название поколения, а результаты предыдущих испытаний платформы с H100 NVL.

В тесте YADRO с описанной конфигурацией узел с восемью H100 NVL примерно втрое опередил восемь RTX 4090 при обучении малых моделей и в 2,7 раза — при инференсе. На больших нейросетях пара GPU с NVLink дала прирост более чем в 1,5 раза относительно обмена через PCIe.
Эти коэффициенты нельзя переносить на H200. Тест сравнивал H100 NVL и RTX 4090. Он показывает другое: при большой модели скорость межсоединения и доступная память могут влиять на результат сильнее, чем паспортная вычислительная мощность отдельного ускорителя.
У RTX PRO 6000 Blackwell свой сценарий. В тесте The Value Engineering использовали vLLM 0.23.0 и 0.26, плотную Qwen3.6-27B, MoE-модели Qwen3.6-35B-A3B и DeepSeek-V4-Flash, многопоточное обслуживание и пакетную обработку. Для генерации токенов Qwen3.6-35B-A3B с квантованием NVFP4 RTX PRO 6000 показала в среднем на 49% больше производительности на доллар, чем H100 NVL.
Результат держится на конкретных условиях. NVFP4 сокращает объём весов вдвое относительно FP8, а RTX PRO 6000 поддерживает этот формат аппаратно. На длинных входных контекстах прирост оказался минимальным, а на плотных моделях разрыв между ускорителями сокращался. Поэтому «на 49% выгоднее» — вывод для MoE-инференса с преобладанием генерации токенов, а не общий рейтинг GPU.
Питание может закрыть проект раньше бенчмарка
G4208P G3 оснащают четырьмя блоками CRPS Platinum по 3200 Вт. Спецификация YADRO допускает резервирование 2+2 или 3+1.
Посчитаем верхнюю границу для компонентов, мощность которых известна:
- восемь GPU по 600 Вт — 4,8 кВт;
- два процессора по 350 Вт — 0,7 кВт;
- вместе — 5,5 кВт.
При схеме 2+2 нагрузку несут два блока общей мощностью 6,4 кВт. После GPU и CPU остаётся не более 0,9 кВт на память, накопители, платы, вентиляторы и потери преобразования. Потребление этих компонентов зависит от заказанной комплектации, поэтому заранее обещать резервирование 2+2 для восьми 600-ваттных GPU нельзя.
В заявке поставщику нужен энергопрофиль всей сборки: обычное потребление, пик и доступная схема резервирования на пике. Ответ «четыре блока по 3200 Вт» ничего не доказывает без этого расчёта.
Охлаждение накладывает ещё одно ограничение. YADRO разрешает эксплуатацию сервера при температуре окружающей среды от 5 до 40 °C, но для полной конфигурации с восемью GPU по 600 Вт снижает верхнюю границу до 30 °C на входе. Штатная система включает 12 двухроторных вентиляторов с резервированием N+2 и горячей заменой; дополнительная система добавляет ещё четыре вентилятора.
Шкаф нужно проверить по глубине, массе и теплу
Корпус занимает 4U и имеет размеры 447 × 844,3 × 174,8 мм. С дополнительным охлаждением глубина вырастает до 928,1 мм. Максимальная масса — 65 кг.
Для одного узла проверь полезную глубину шкафа, допустимую нагрузку на направляющие и место для кабелей сзади. Номинальная глубина шкафа не равна расстоянию между монтажными плоскостями.
Для десяти узлов расчёт выглядит так:
- 10 × 4U = 40U;
- 10 × 65 кг = до 650 кг;
- 10 × 5,5 кВт = до 55 кВт только на GPU и CPU.
В эти 55 кВт не входят память, накопители, сетевые платы, вентиляторы и потери блоков питания. Это не расчёт потребления стойки, а нижняя граница для проверки площадки. К ней нужно добавить фактический профиль остальных компонентов, сетевое оборудование и запас по охлаждению.
Спецификация под задачу
Локальное обучение и обмен данными между GPU
В заявку стоит закладывать такую базовую сборку:
- YADRO G4208P G3, 4U;
- четыре NVIDIA H200 NVL;
- два Intel Xeon Scalable 4-го или 5-го поколения, до 350 Вт каждый;
- DDR5-5600 RDIMM или LRDIMM ECC;
- NVMe в четырёх универсальных отсеках под активные наборы данных;
- NVLink Bridge для групп из двух или четырёх GPU;
- четыре блока CRPS Platinum по 3200 Вт;
- дополнительную систему охлаждения, если её требует расчёт YADRO.
Четыре H200 — опубликованная граница подтверждённой стабильной работы этой платформы. Объём оперативной памяти и NVMe нельзя честно назначить без размера модели, набора данных и способа их загрузки. В заявке зафиксируй эти три исходных значения и потребуй от поставщика расчёт ёмкости с запасом, а не произвольные 1–2 ТБ «на всякий случай».
Компромисс: такая сборка использует только половину GPU-слотов. Зато у неё есть опубликованное подтверждение стабильной работы, а энергопрофиль проще согласовать с резервированием.
Постоянный MoE-инференс с NVFP4
Для сервиса, который большую часть времени генерирует токены, можно рассматривать другую сборку:
- YADRO G4208P G3, 4U;
- восемь NVIDIA RTX PRO 6000 Blackwell Server Edition;
- два Intel Xeon Scalable 4-го или 5-го поколения;
- DDR5-5600 ECC;
- NVMe под веса моделей и локальный кэш;
- четыре блока CRPS Platinum по 3200 Вт;
- дополнительную систему охлаждения;
- питание и резервирование по расчёту полной комплектации YADRO.
Основания два: RTX PRO 6000 Blackwell входит в официальную матрицу совместимости, а тест The Value Engineering показал преимущество по производительности на доллар для Qwen3.6-35B-A3B с NVFP4 и преобладанием генерации токенов.
Для длинного входного контекста и плотных моделей этот аргумент слабеет. До закупки повтори тест на своей модели, длине запроса, размере пакета и требуемой задержке. Кроме того, запроси отдельное подтверждение, что точная восьмиускорительная сборка сохраняет согласованную схему резервирования питания.
Если GPU будут заняты лишь несколько смен в месяц, сначала переведи рабочий график ускорителей в решение о покупке. Сервер не становится выгоднее аренды только потому, что помещает восемь карт.
Что записать в заявку поставщику
Не заказывай «G4208P G3 на восемь GPU». Заказывай одну проверяемую конфигурацию под измеримую нагрузку.
Для обучения и интенсивного обмена между ускорителями исходная точка — четыре H200. Для постоянного MoE-инференса с NVFP4 — восемь RTX PRO 6000 Blackwell, но только после расчёта питания и испытания точной сборки.
До согласования счёта получи четыре ответа:
- испытана ли заказанная комбинация GPU, процессоров, памяти и накопителей;
- сохраняется ли нужное резервирование БП при пиковой мощности;
- удерживает ли площадка температуру на входе ниже 30 °C при полной GPU-конфигурации;
- какая поддержка входит сверх стандартной гарантии YADRO на один год в режиме 9×5.
Если поставщик не подтверждает хотя бы один пункт, эту сборку ещё рано защищать перед директором.