Новости

Huawei OceanStor A Series: что меняется при закупке СХД для ИИ

Дмитрий Потоцкий 1 мин чтения
Huawei OceanStor A Series: что меняется при закупке СХД для ИИ

Два узла OceanStor A800 высотой 8U выдали 698 GiB/s в тесте 3D U-Net и обслужили нагрузку 255 ускорителей NVIDIA H100. Такой результат ставит Huawei в шорт-лист для ИИ-кластера. Но ничего не говорит о работе 1С, обычной виртуализации или транзакционной базы.

Твоя задача — не выбрать Huawei по месту в рейтинге, а понять, какую линейку запросить на пилот. Для обучения моделей это OceanStor A Series. Для баз и виртуальных машин — OceanStor Dorado, которую нужно оценивать по другим тестам.

MLPerf проверил обучение моделей, а не корпоративные базы

MLCommons выпустил результаты MLPerf Storage v2.0 для 26 поставщиков. В набор испытаний вошли обучение 3D U-Net и checkpointing — сохранение состояния модели, чтобы продолжить обучение после остановки.

Рука техника на корпусе серверной стойки

По сообщению Huawei о результатах MLPerf Storage v2.0, OceanStor A Series заняла первые места по производительности одной системы, одного юнита стойки и одного клиента. Тестирование Huawei проводила вместе с Цзинаньским институтом суперкомпьютерных технологий.

Результат подтверждает конкретную вещь: A Series способна отдавать данные кластеру GPU при обучении моделей и быстро записывать контрольные точки. Переносить эти цифры на другие нагрузки нельзя. В MLPerf Storage v2.0 нет 1С, OLTP-баз и обычного пула виртуальных машин.

A600 — для десятков H100, A800 — для сотен

OceanStor A600 и A800 закрывают разные масштабы ИИ-кластера.

Двухузловая A600 занимает 2U. В тесте она обслужила 76 ускорителей H100 и показала 108 GiB/s на один юнит стойки, а также 104 GiB/s на одного клиента. Это подтверждённая граница именно испытанной конфигурации, а не обещание линейного роста при добавлении любого числа GPU.

Двухузловая A800 занимает 8U. Она удерживала полосу 698 GiB/s и обеспечила обучение на 255 H100. По плотности это около 87 GiB/s на юнит: ниже результата A600, зато одна система обслуживает кластер втрое большего масштаба.

Для сохранения контрольных точек Huawei приводит отдельные результаты на одном клиенте с восемью имитируемыми GPU:

МодельЧтениеЗапись
Llama 3 8B40,2 GiB/s20,5 GiB/s
Llama 3 70B68,8 GiB/s62,4 GiB/s

Эти цифры пригодятся при расчёте окна checkpointing. Например, контрольная точка объёмом 1 TiB при записи 62,4 GiB/s теоретически уйдёт примерно за 16,4 секунды: 1024 GiB ÷ 62,4 GiB/s. Это нижняя граница без учёта сети, параллельной нагрузки и служебных операций. На своей модели измеряй полное время от команды сохранения до готовности продолжить обучение.

Если кластер занимается не только обучением, сначала раздели требования к вычислителям и хранилищу. Отдельный материал показывает, как нагрузка на большие массивы влияет на выбор серверов.

Для 1С и виртуализации смотри на Dorado

Закупку СХД под 1С, виртуальные машины или транзакционные базы нельзя обосновать результатом 3D U-Net. Здесь важны задержка коротких операций, производительность на смешанном чтении и записи, поведение при отказе контроллера и доступные протоколы.

Компактное хранилище данных в офисной серверной

Для таких сценариев Huawei предлагает OceanStor Dorado 8000 и 18000. В даташите OceanStor Dorado 8000/18000 производитель заявляет задержку 0,05 мс и 21 млн SPC-1 IOPS. Архитектура SmartMatrix полносвязная, система расширяется до 32 контроллеров.

Это характеристики платформы, а не готовая конфигурация под твою базу. В закупочной спецификации нужны модель, число контроллеров, полезная ёмкость, протокол доступа и результаты стендового теста с твоим соотношением чтения и записи.

Huawei выпускает файловые, блочные, объектные и комбинированные хранилища. Но доступные материалы не дают точной матрицы протоколов для каждой модели. Сначала определи подходящий класс СХД по способу работы с данными, затем запроси у поставщика матрицу именно для предложенной конфигурации и версии ПО.

Доступность нужно закрепить в договоре

В даташите Dorado 8000/18000 заявлена доступность 99,99999%. Это соответствует примерно 3 секундам недоступности в год, если пересчитать процент арифметически. Но такой расчёт ничего не гарантирует без списка исключений и метода измерения.

Руки специалиста с дисковым модулем у стойки

Huawei также заявляет сохранение данных при отказах контроллеров, дисковых полок и трёх дисков. Формулировка производителя охватывает конфигурации с отказом семи из восьми либо трёх из четырёх контроллеров или полок. Ещё одно обещание — обновление оборудования через три поколения в течение десяти лет без миграции данных.

Эти пункты стоит перенести из презентации в проектную спецификацию:

  • какие отказы покрывает схема защиты;
  • какая конфигурация нужна для заявленного уровня доступности;
  • входит ли обновление контроллеров без миграции в договор поддержки;
  • кто отвечает за совместимость поколений;
  • за какой срок поставщик заменит контроллер, полку и диск.

Без этих условий семь девяток остаются характеристикой из даташита, а не обязательством перед твоей компанией.

Система управления Dorado прогнозирует заполнение на 365 дней, проблемы производительности на 60 дней и отказы дисков на 14 дней. Huawei также заявляет сокращение восстановления после сбоя с двух часов до десяти минут. Проверять здесь нужно не наличие функции в интерфейсе, а результат: какие события она распознаёт, куда отправляет уведомление и с какого момента начинается отсчёт десяти минут.

Цен, сроков поставки и стоимости поддержки в рассмотренных материалах нет. Поэтому сравнить полную стоимость владения Huawei с другими СХД по этой новости нельзя.

Спецификация под задачу

Для ИИ-кластера на 64–76 H100 отправной точкой станет двухузловая OceanStor A600 высотой 2U. Подтверждённый тестом ориентир — 108 GiB/s на юнит и нагрузка до 76 H100. В запросе на пилот зафиксируй свою модель, размер контрольной точки, число одновременных клиентов и допустимое время сохранения.

Для кластера на 200–255 H100 рассматривай двухузловую OceanStor A800 высотой 8U. Ориентир MLPerf — 698 GiB/s на 3D U-Net и 255 H100. Если ускорителей меньше 200, сравни A800 с несколькими A600 по цене стойко-места, сети и поддержки: результаты теста не доказывают, что крупная система будет выгоднее при неполной загрузке.

Параметр закупкиКластер до 76 H100Кластер до 255 H100
Модель для пилотаOceanStor A600OceanStor A800
Испытанная конфигурациядва узла, 2Uдва узла, 8U
Подтверждённая нагрузка76 H100255 H100
Ориентир MLPerf108 GiB/s на 1U698 GiB/s на систему
Проверка на пилотечтение, запись, полное время checkpointingте же замеры при одновременной работе всех клиентов
Главный компромиссменьше запас по масштабучетыре раза больше стойко-места

Для 1С, виртуализации и транзакционных баз не подставляй Dorado в эту таблицу автоматически. Запрашивай отдельный пилот Dorado 8000 или 18000: модель выбирают после замера рабочей ёмкости, задержки, IOPS, доли записи и требований к отказоустойчивости. Данных для честного выбора между 8000 и 18000 в рассмотренных документах нет.

Если поставщик предлагает Huawei только со ссылкой на первое место в MLPerf, аргумента недостаточно. Для ИИ запроси A600 или A800 и повтори checkpointing на своих данных. Для корпоративных баз запроси Dorado с точной конфигурацией контроллеров, протоколами, полезной ёмкостью после защиты и сжатия, условиями поддержки и стендовым тестом своей нагрузки.