Новости

Ускорители Meta MTIA: почему 10 Пфлопс не помогают выбрать сервер

Вадим Заплетин 1 мин чтения
Ускорители Meta MTIA: почему 10 Пфлопс не помогают выбрать сервер

Администратор готовит закупку GPU-сервера и видит обещание MTIA с производительностью до 10 Пфлопс. Переносить эту цифру в обоснование нельзя: доступные материалы подтверждают для MTIA 400 другие показатели — 6 Пфлопс в FP8, 12 Пфлопс в MX4 и 3 Пфлопс в BF16.

На решение о закупке MTIA 400 пока не влияет. Это внутренний ASIC Meta для инференса генеративных и рекомендательных моделей. Компания не продаёт и не сдаёт ускоритель в аренду, а независимых тестов и результатов MLPerf нет. Ждать коммерческого сервера с MTIA незачем.

Что известно об MTIA 400

Сводка Awesome Agents, которая пересказывает данные Meta, называет MTIA 400 вторым поколением собственных ускорителей компании. Чип рассчитан на инференс — выполнение уже обученных моделей — и работает внутри инфраструктуры Meta.

Силовые кабели за плотной стойкой

Паспортные характеристики выглядят так:

  • 6 Пфлопс в формате FP8;
  • 12 Пфлопс в формате MX4;
  • 3 Пфлопс в формате BF16;
  • 288 ГБ памяти HBM;
  • пропускная способность памяти 9,2 ТБ/с;
  • энергопотребление 1,2 кВт;
  • 1,2 Тбит/с для обмена внутри группы ускорителей;
  • 100 Гбит/с для внешнего подключения.

Число «до 10 Пфлопс» из адреса страницы не совпадает ни с одним из подтверждённых режимов MTIA 400. Утверждение о четырёх новых ускорителях тоже нельзя считать установленным: первичная публикация Meta не загрузилась при сборе материалов, а сторонний пересказ не заменяет анонс производителя.

Пфлопсы нельзя сравнивать без формата вычислений

MTIA 400 выдаёт 12 Пфлопс в MX4 и 6 Пфлопс в FP8. Это не две оценки одной и той же операции. MX4 хранит числа с меньшей точностью, поэтому ускоритель выполняет больше операций за такт, но модель должна сохранять требуемое качество после такого снижения точности.

Для ориентира сводка Awesome Agents приводит 3,958 Пфлопс FP8 у NVIDIA H100 SXM5 и 2,610 Пфлопс FP8 у AMD MI300X. По этим цифрам MTIA 400 выглядит быстрее обоих ускорителей. Такой вывод преждевременен.

Пиковая производительность не показывает задержку ответа, число токенов в секунду, время загрузки модели и потери на обмене между ускорителями. У MTIA 400 нет независимого теста на одной модели и с одинаковыми настройками. Есть только паспортный потолок и заявление Meta о конкурентоспособности с коммерческими ускорителями.

Если поставщик сравнивает MX4 одного чипа с FP8 другого, попроси повторить тест в одинаковом формате. Иначе в таблице сравниваются разные вычисления.

288 ГБ HBM меняют архитектуру узла сильнее, чем Пфлопсы

У MTIA 400 заявлено 288 ГБ HBM с пропускной способностью 9,2 ТБ/с. В той же сводке указаны 80 ГБ у H100 SXM5 и 192 ГБ у MI300X.

Большая память позволяет разместить на одном ускорителе больше весов модели, кэша запросов и рабочего набора. Это сокращает необходимость делить модель между несколькими устройствами, где часть времени уходит на передачу данных.

Но 288 ГБ сами по себе не отвечают на вопрос о производительности корпоративного сервиса. Для расчёта нужны размер весов после квантования, объём кэша на запрос, длина контекста, число одновременных запросов и допустимая задержка. В материалах по MTIA 400 таких результатов нет.

Поэтому анонс задаёт полезный ориентир для технического задания: сначала объём памяти и тест рабочей модели, затем пиковые Пфлопсы. Этот порядок стоит сохранить при выборе сервера с GPU для ИИ.

Одна стойка MTIA потребляет не меньше 86,4 кВт

Стойка Meta содержит 72 ускорителя MTIA 400. Каждый потребляет до 1,2 кВт. Только ASIC требуют:

72 × 1,2 кВт = 86,4 кВт

В расчёт не входят центральные процессоры, оперативная память, сетевое оборудование, накопители и потери системы питания. Значит, 86,4 кВт — нижняя граница для ускорителей, а не мощность стойки из электрического проекта.

Паспортный вычислительный пик той же стойки составляет:

72 × 6 Пфлопс FP8 = 432 Пфлопс FP8

Это сумма характеристик чипов. Приложение получит меньше из-за обмена данными, неполной загрузки вычислительных блоков и операций, которые нельзя выполнить в FP8.

Такая плотность объясняет, почему MTIA проектировали вместе со стойкой, сетью и инфраструктурой Meta. Перенести один показатель чипа в обычный GPU-сервер не получится: питание, охлаждение и обмен между ускорителями определяют конфигурацию не меньше самих вычислительных блоков.

Спецификация под задачу

Считаем корпоративный инференс-сервис с двумя одинаковыми экземплярами модели. Это допущение для закупочного задания, а не характеристика MTIA: рабочий набор одного экземпляра после замеров занимает 150 ГБ, сервис работает постоянно, второй экземпляр нужен для параллельной обработки и обслуживания без полной остановки.

Добавим 20% запаса на кэш и изменение модели:

150 ГБ × 1,2 = 180 ГБ на экземпляр

Ускоритель с 80 ГБ не вместит такой экземпляр целиком. Устройство со 192 ГБ проходит по объёму с запасом 12 ГБ. Для двух экземпляров нужны два независимых пула минимум по 180 ГБ либо один общий пул от 360 ГБ, если платформа и программный стек умеют объединять память без неприемлемой задержки.

В запрос поставщику стоит включить такую спецификацию:

УзелТребованиеПочему столько
Ускорители2 пула памяти по 192 ГБ или большеПо 180 ГБ на каждый экземпляр модели
Формат вычисленийFP8 и BF16FP8 — рабочий режим инференса, BF16 нужен для проверки качества и совместимости
Память сервера512 ГБ ECC RDIMMДва рабочих набора по 150 ГБ дают 300 ГБ; оставшиеся 212 ГБ уходят операционной системе, подготовке данных и запасу
Локальные накопители2 × 3,84 ТБ NVMe в RAID 1Зеркало сохраняет локальную копию весов и служебные данные при отказе одного накопителя
Сеть2 × 100 Гбит/сОдин порт под рабочий трафик, второй под резервирование или обмен между узлами
ПитаниеДва блока с резервированием, каждый держит узел целикомОтказ одного блока не останавливает инференс
Проверка перед приёмкойТест на рабочей модели в FP8 и BF16Паспортные Пфлопсы не показывают задержку и число обработанных запросов

Конкретную модель GPU выбирай после испытания. В доступных данных нет независимого теста, который позволил бы честно пересчитать MTIA 400, H100 и MI300X в запросы или токены в секунду.

Если рабочий набор занимает до 60 ГБ, конфигурацию можно пересчитать под ускорители с 80 ГБ: 60 × 1,2 = 72 ГБ. Если он превышает 160 ГБ, устройство со 192 ГБ уже оставляет меньше 20% запаса — ищи больший объём памяти или проверяй разделение модели между несколькими GPU.

При нерегулярной загрузке сначала сравни стоимость владения с арендой. В статье о том, покупать GPU-сервер или арендовать, разобраны сценарии, где собственный узел простаивает большую часть месяца.

Что записать в решение о закупке

MTIA не включай в короткий список оборудования: заказать ускоритель, проверить его на своей модели и закрепить результат в договоре сейчас нельзя. Закупку ради него не откладывай.

Из анонса возьми четыре требования к доступной платформе:

  • рабочая модель помещается в память с запасом не меньше 20%;
  • поставщик называет формат вычислений рядом с показателем производительности;
  • энергопитание рассчитано на весь узел, а не только на TDP ускорителей;
  • результат подтверждён воспроизводимым тестом на твоей модели.

Если поставщик показывает только Пфлопсы, спецификация ещё не готова. Запроси объём памяти на ускоритель, FP8- и BF16-режимы, потребление узла под нагрузкой, схему межсоединения и задержку на одном согласованном наборе запросов. Эти данные можно проверить при приёмке. Число из презентации — нельзя.