Администратор готовит закупку GPU-сервера и видит обещание MTIA с производительностью до 10 Пфлопс. Переносить эту цифру в обоснование нельзя: доступные материалы подтверждают для MTIA 400 другие показатели — 6 Пфлопс в FP8, 12 Пфлопс в MX4 и 3 Пфлопс в BF16.
На решение о закупке MTIA 400 пока не влияет. Это внутренний ASIC Meta для инференса генеративных и рекомендательных моделей. Компания не продаёт и не сдаёт ускоритель в аренду, а независимых тестов и результатов MLPerf нет. Ждать коммерческого сервера с MTIA незачем.
Что известно об MTIA 400
Сводка Awesome Agents, которая пересказывает данные Meta, называет MTIA 400 вторым поколением собственных ускорителей компании. Чип рассчитан на инференс — выполнение уже обученных моделей — и работает внутри инфраструктуры Meta.

Паспортные характеристики выглядят так:
- 6 Пфлопс в формате FP8;
- 12 Пфлопс в формате MX4;
- 3 Пфлопс в формате BF16;
- 288 ГБ памяти HBM;
- пропускная способность памяти 9,2 ТБ/с;
- энергопотребление 1,2 кВт;
- 1,2 Тбит/с для обмена внутри группы ускорителей;
- 100 Гбит/с для внешнего подключения.
Число «до 10 Пфлопс» из адреса страницы не совпадает ни с одним из подтверждённых режимов MTIA 400. Утверждение о четырёх новых ускорителях тоже нельзя считать установленным: первичная публикация Meta не загрузилась при сборе материалов, а сторонний пересказ не заменяет анонс производителя.
Пфлопсы нельзя сравнивать без формата вычислений
MTIA 400 выдаёт 12 Пфлопс в MX4 и 6 Пфлопс в FP8. Это не две оценки одной и той же операции. MX4 хранит числа с меньшей точностью, поэтому ускоритель выполняет больше операций за такт, но модель должна сохранять требуемое качество после такого снижения точности.
Для ориентира сводка Awesome Agents приводит 3,958 Пфлопс FP8 у NVIDIA H100 SXM5 и 2,610 Пфлопс FP8 у AMD MI300X. По этим цифрам MTIA 400 выглядит быстрее обоих ускорителей. Такой вывод преждевременен.
Пиковая производительность не показывает задержку ответа, число токенов в секунду, время загрузки модели и потери на обмене между ускорителями. У MTIA 400 нет независимого теста на одной модели и с одинаковыми настройками. Есть только паспортный потолок и заявление Meta о конкурентоспособности с коммерческими ускорителями.
Если поставщик сравнивает MX4 одного чипа с FP8 другого, попроси повторить тест в одинаковом формате. Иначе в таблице сравниваются разные вычисления.
288 ГБ HBM меняют архитектуру узла сильнее, чем Пфлопсы
У MTIA 400 заявлено 288 ГБ HBM с пропускной способностью 9,2 ТБ/с. В той же сводке указаны 80 ГБ у H100 SXM5 и 192 ГБ у MI300X.
Большая память позволяет разместить на одном ускорителе больше весов модели, кэша запросов и рабочего набора. Это сокращает необходимость делить модель между несколькими устройствами, где часть времени уходит на передачу данных.
Но 288 ГБ сами по себе не отвечают на вопрос о производительности корпоративного сервиса. Для расчёта нужны размер весов после квантования, объём кэша на запрос, длина контекста, число одновременных запросов и допустимая задержка. В материалах по MTIA 400 таких результатов нет.
Поэтому анонс задаёт полезный ориентир для технического задания: сначала объём памяти и тест рабочей модели, затем пиковые Пфлопсы. Этот порядок стоит сохранить при выборе сервера с GPU для ИИ.
Одна стойка MTIA потребляет не меньше 86,4 кВт
Стойка Meta содержит 72 ускорителя MTIA 400. Каждый потребляет до 1,2 кВт. Только ASIC требуют:
72 × 1,2 кВт = 86,4 кВт
В расчёт не входят центральные процессоры, оперативная память, сетевое оборудование, накопители и потери системы питания. Значит, 86,4 кВт — нижняя граница для ускорителей, а не мощность стойки из электрического проекта.
Паспортный вычислительный пик той же стойки составляет:
72 × 6 Пфлопс FP8 = 432 Пфлопс FP8
Это сумма характеристик чипов. Приложение получит меньше из-за обмена данными, неполной загрузки вычислительных блоков и операций, которые нельзя выполнить в FP8.
Такая плотность объясняет, почему MTIA проектировали вместе со стойкой, сетью и инфраструктурой Meta. Перенести один показатель чипа в обычный GPU-сервер не получится: питание, охлаждение и обмен между ускорителями определяют конфигурацию не меньше самих вычислительных блоков.
Спецификация под задачу
Считаем корпоративный инференс-сервис с двумя одинаковыми экземплярами модели. Это допущение для закупочного задания, а не характеристика MTIA: рабочий набор одного экземпляра после замеров занимает 150 ГБ, сервис работает постоянно, второй экземпляр нужен для параллельной обработки и обслуживания без полной остановки.
Добавим 20% запаса на кэш и изменение модели:
150 ГБ × 1,2 = 180 ГБ на экземпляр
Ускоритель с 80 ГБ не вместит такой экземпляр целиком. Устройство со 192 ГБ проходит по объёму с запасом 12 ГБ. Для двух экземпляров нужны два независимых пула минимум по 180 ГБ либо один общий пул от 360 ГБ, если платформа и программный стек умеют объединять память без неприемлемой задержки.
В запрос поставщику стоит включить такую спецификацию:
| Узел | Требование | Почему столько |
|---|---|---|
| Ускорители | 2 пула памяти по 192 ГБ или больше | По 180 ГБ на каждый экземпляр модели |
| Формат вычислений | FP8 и BF16 | FP8 — рабочий режим инференса, BF16 нужен для проверки качества и совместимости |
| Память сервера | 512 ГБ ECC RDIMM | Два рабочих набора по 150 ГБ дают 300 ГБ; оставшиеся 212 ГБ уходят операционной системе, подготовке данных и запасу |
| Локальные накопители | 2 × 3,84 ТБ NVMe в RAID 1 | Зеркало сохраняет локальную копию весов и служебные данные при отказе одного накопителя |
| Сеть | 2 × 100 Гбит/с | Один порт под рабочий трафик, второй под резервирование или обмен между узлами |
| Питание | Два блока с резервированием, каждый держит узел целиком | Отказ одного блока не останавливает инференс |
| Проверка перед приёмкой | Тест на рабочей модели в FP8 и BF16 | Паспортные Пфлопсы не показывают задержку и число обработанных запросов |
Конкретную модель GPU выбирай после испытания. В доступных данных нет независимого теста, который позволил бы честно пересчитать MTIA 400, H100 и MI300X в запросы или токены в секунду.
Если рабочий набор занимает до 60 ГБ, конфигурацию можно пересчитать под ускорители с 80 ГБ: 60 × 1,2 = 72 ГБ. Если он превышает 160 ГБ, устройство со 192 ГБ уже оставляет меньше 20% запаса — ищи больший объём памяти или проверяй разделение модели между несколькими GPU.
При нерегулярной загрузке сначала сравни стоимость владения с арендой. В статье о том, покупать GPU-сервер или арендовать, разобраны сценарии, где собственный узел простаивает большую часть месяца.
Что записать в решение о закупке
MTIA не включай в короткий список оборудования: заказать ускоритель, проверить его на своей модели и закрепить результат в договоре сейчас нельзя. Закупку ради него не откладывай.
Из анонса возьми четыре требования к доступной платформе:
- рабочая модель помещается в память с запасом не меньше 20%;
- поставщик называет формат вычислений рядом с показателем производительности;
- энергопитание рассчитано на весь узел, а не только на TDP ускорителей;
- результат подтверждён воспроизводимым тестом на твоей модели.
Если поставщик показывает только Пфлопсы, спецификация ещё не готова. Запроси объём памяти на ускоритель, FP8- и BF16-режимы, потребление узла под нагрузкой, схему межсоединения и задержку на одном согласованном наборе запросов. Эти данные можно проверить при приёмке. Число из презентации — нельзя.