Новости

AMD Helios: что проверить в ЦОДе до заказа стойки с 72 MI455X

Дмитрий Потоцкий 2 мин чтения
AMD Helios: что проверить в ЦОДе до заказа стойки с 72 MI455X

Поставщик прислал спецификацию AMD Helios. В ней 72 GPU и 2,9 экзафлопса FP4. В приложении к письму — шкаф шириной 1,2 м, глубиной 1,3 м и массой до 7000 фунтов, или примерно 3,2 т. Оценка цены: $5–5,5 млн (chipsandcheese.com, cnbc.com).

Тебе нужно решить, поместится ли Helios в ЦОД и запустит ли твой inference без неприятных сюрпризов. Сравнивать стойку с NVIDIA только по FP4 нельзя: закупку могут остановить пол, жидкостный контур, незрелый fabric или CUDA-расширение без рабочего пути на ROCm.

Helios — один вычислительный домен, а не 72 отдельных GPU

В стойке стоят 18 compute trays. Каждый tray содержит четыре Instinct MI455X и один 96-ядерный EPYC 9006. Все 72 ускорителя связаны в единый scale-up-домен; системы на MI355X ограничивались восемью GPU в pod (cnbc.com, chipsandcheese.com).

Это меняет границу отказа. В обычном восьмиускорительном сервере можно вывести одну ноду из планировщика и оставить кластер работать. В Helios нужно заранее выяснить, что произойдёт при отказе tray, одного из 12 scale-up-коммутаторов, сетевого адаптера или ветки охлаждения. Спецификация с суммарными FLOPS на этот вопрос не отвечает.

Та же проблема возникает при обновлении прошивок и ROCm. Если стойка работает как единый домен, rolling update может потребовать дробить workload или освобождать крупный пул GPU. До закупки запроси у поставщика процедуру обслуживания: какие компоненты заменяют на ходу, как fabric перестраивает маршруты и сколько ускорителей теряет планировщик при каждом типе отказа.

Для размещения модели важнее 31 ТБ HBM4

Один MI455X получает 432 ГБ HBM4 с пропускной способностью 23,3 ТБ/с. Вся стойка — 31 ТБ памяти и 1,7 ПБ/с совокупной пропускной способности. Пиковые показатели составляют 2,9 EFLOPS в FP4 и 1,4 EFLOPS в FP8.

Начни расчёт не с экзафлопсов, а с рабочего набора модели. Сложи веса в выбранной точности, KV-cache для целевого batch size и context length, служебные буферы runtime и запас под фрагментацию. Затем проверь, как этот объём раскладывается по 432 ГБ каждого ускорителя.

31 ТБ в стойке нельзя считать общей памятью с одинаковой ценой доступа. Тензор, который не помещается в локальную HBM, приходится передавать через fabric. Поэтому в модели размещения нужны не только общий объём и число GPU, но и схема tensor, pipeline и expert parallelism.

AMD заявляет до 34 раз больше token throughput и до 18 раз меньшую стоимость токена у MI455X по сравнению с MI355X. Эти цифры получены на DeepSeek-V4-Flash и не описывают произвольную модель, размер контекста или режим batching. Подставлять их в расчёт мощности для собственного inference нельзя.

UALoE убирает лишние переходы внутри стойки, но требует проверки поставок

Scale-up fabric использует UALink over Ethernet, или UALoE. Он соединяет всю стойку по схеме single-hop all-to-all и даёт 260 ТБ/с двунаправленной пропускной способности через 12 коммутаторов. Каждый MI455X содержит 36 интерфейсов по 400 Гбит/с.

За пределы стойки трафик выводят адаптеры Pensando. AMD указывает до 43 ТБ/с scale-out bandwidth на Helios; платформа также предусматривает Ultra Ethernet с Pollara 400G и будущими Vulcano 800G (amd.com, tomshardware.com).

На схеме это законченная сеть. В поставке — зависимость от экосистемы, которая ещё формируется. Для внедрения UALink нужны решения Astera Labs, Auradine, Enfabrica и Xconn, а поставки switching silicon ожидаются во второй половине 2026 года. Сам Helios AMD тоже планирует начать поставлять позднее в 2026 году.

Поэтому в запросе поставщику нужны part number и дата доступности каждого сетевого компонента. Формулировки «UALink ready» недостаточно: она не говорит, какое железо войдёт в первую поставку, какая версия прошивки потребуется и кто будет разбирать межвендорный инцидент.

Заявленное преимущество над Vera Rubin привязано к одному профилю

По данным AMD, Helios даёт до 15% больше AI compute, на 50% больше HBM и на 50% больше scale-out bandwidth, чем NVIDIA Vera Rubin NVL72. Эти показатели описывают возможности платформы, но не latency твоего API.

Сравнение inference ещё уже. AMD смоделировала Kimi K2 Thinking с входным контекстом 32K и выходом 8K. Преимущество Helios по throughput на GPU составило до 15% при низкой интерактивности, до 12% при средней и до 10% при высокой.

Изменишь batch size, длину контекста, квантование или SLO по time to first token — изменится и результат. Для capacity planning нужен прогон твоих запросов с их распределением по длине, а не одна средняя последовательность.

ROCm поддерживает PyTorch, TensorFlow и JAX. Это подтверждает поддержку фреймворков, но ничего не обещает твоим CUDA-расширениям, кастомным kernels и обвязке профилировщика. Составь список зависимостей, собери контейнер под ROCm и проверь не только запуск модели, но и нужные операции: загрузку чекпойнта, continuous batching, speculative decoding, сбор метрик и аварийный перезапуск worker.

Стойка может потребовать отдельного проекта по размещению

Helios использует шкаф Open Rack Wide шириной 1,2 м и глубиной 1,3 м. Его масса достигает 7000 фунтов — около 3,2 т (chipsandcheese.com, cnbc.com). Здесь заканчивается обычная проверка свободных юнитов.

Нужны допустимая точечная и распределённая нагрузка на фальшпол, ширина дверей и поворотов, грузоподъёмность лифта, маршрут от разгрузочной зоны до ряда. Отдельно проверь сервисные зазоры: шкаф должен не только въехать, но и оставить место для подключения и замены tray.

Паспортной мощности в research нет, поэтому придумывать число под PDU нельзя. Запроси у вендора максимальную и типичную потребляемую мощность, число вводов, требования к резервированию и параметры жидкостного контура. Затем сверь их с доступной мощностью ряда и температурой теплоносителя на площадке.

Цена тоже требует одинаковой базы сравнения. Futurum Group оценивает Helios в $5–5,5 млн, а Vera Rubin — в $3,5–4 млн. Эти оценки нельзя превращать в стоимость токена без цены сетевой обвязки, подготовки площадки, энергии, охлаждения, поддержки и простоя при вводе.

Поставки в конце 2026 года дают время на стенд

Microsoft планирует использовать Helios для frontier inference и сервисов Azure AI. Meta заявила старт с 1 ГВт на стойках Helios; обязательства по развёртыванию также объявили OpenAI, Oracle и TCS.

Список клиентов показывает интерес к платформе, но не совместимость с твоим стеком. У крупных заказчиков будут свои контракты, инженеры AMD на площадке и объёмы, которые оправдывают доработку софта. Эти условия нельзя переносить на одиночную стойку.

Первые поставки ожидаются позднее в 2026 году. Используй этот срок для теста MI455X или доступного ROCm-стенда, аудита расширений и расчёта TCO. В конфигурацию Helios входит EPYC Venice 9006, поэтому требования CPU-платформы и её график стоит проверить отдельно в материале про AMD EPYC 9006 Venice (amd.com, chipsandcheese.com).

Карточка проверки до запроса цены

До коммерческого предложения закрой пять пунктов:

  1. Сверь габариты 1,2 × 1,3 м и массу до 3,2 т с полом, дверями, лифтом, поворотами и сервисными проходами (chipsandcheese.com, cnbc.com).
  2. Посчитай веса, KV-cache и буферы для целевых batch size, context length и точности. Результат должен помещаться в схему из 72 × 432 ГБ HBM4, а не просто в суммарные 31 ТБ.
  3. Запроси топологию UALoE и Ultra Ethernet, part number коммутаторов, сроки switching silicon и поведение системы при отказе tray или switch (chipsandcheese.com, tomshardware.com).
  4. Прогони свой inference в ROCm. Зафиксируй TTFT, tokens/s, p95/p99 latency, потребление HBM и время восстановления worker. Цифры DeepSeek-V4-Flash и Kimi K2 Thinking оставь только для сверки методики AMD.
  5. Сравни стоимость введённой в работу стойки: оборудование, сеть, переделку ряда, охлаждение, энергию, поддержку и миграцию софта. Оценки $5–5,5 млн для Helios и $3,5–4 млн для Vera Rubin покрывают только исходную цену систем, а не твой проект.

Если один пункт остаётся без числа или письменного ответа поставщика, бюджетировать Helios рано. Стойка начинается не с 2,9 EFLOPS. Она начинается с дверного проёма, нагрузки на пол и модели, которая действительно запускается в ROCm.