Новости

Китайские GPU для корпоративной LLM: что доказал тест Rubytech

Дмитрий Потоцкий 1 мин чтения
Китайские GPU для корпоративной LLM: что доказал тест Rubytech

Восемь китайских GPU запустили российскую модель Cotype 3 без ускорителей NVIDIA. На контексте 27 000 токенов первый токен появился примерно через 8 секунд, следующий — через 111 мс или дольше. Это около девяти токенов в секунду на один поток.

Результат годится, чтобы включить ПАК Rubytech в короткий список для пилота. Для закупки данных пока мало: компания не назвала модель GPU, объём памяти, число одновременных запросов, потребление системы и состав стенда с NVIDIA H100, с которым сравнивала результат.

Тест подтвердил совместимость модели и платформы

20 августа 2026 года Rubytech сообщила о завершении испытаний Cotype 3 от MWS AI на ПАК «Машина искусственного интеллекта Скала^р». Модификация комплекса получила восемь GPU китайского производства. Модель работала без ускорителей NVIDIA, а инженеры проверяли скорость запросов, отклик и устойчивость под повышенной нагрузкой. Результаты опубликованы в пресс-релизе Rubytech.

Инженер сравнивает два сервера

Для закупщика это подтверждает не равенство двух платформ, а саму возможность перенести российскую LLM на другой аппаратный стек. Связка прошла испытания и выдала измеримый результат. Проект без NVIDIA уже можно обсуждать с поставщиком предметно.

Но заменить ускорители в спецификации недостаточно. Rubytech отдельно указывает, что настройка драйверов, программной среды и оркестрации ускорила отдельные сценарии в 2–2,2 раза по сравнению с исходным окружением. Значит, в смету входят не только сервер и GPU, но и адаптация стека, нагрузочный тест и повторная проверка после обновления драйвера либо модели.

Если поставщик показывает только паспортную производительность ускорителей, он пропускает половину работы. Ускорение Rubytech получено после настройки всей связки, а не одной платы.

Девять токенов в секунду ещё не описывают пользовательскую нагрузку

При TPOT 111 мс система генерирует до девяти токенов в секунду на измеренном потоке:

1000 / 111 ≈ 9 токенов/с

Ответ длиной 300 токенов займёт не меньше 33,3 секунды после появления первого токена:

300 × 0,111 = 33,3 секунды

С учётом TTFT около 8 секунд пользователь получит полный ответ примерно через 41 секунду. Расчёт предполагает один поток и неизменную межтокенную задержку. Для другой длины ответа ориентир меняется по формуле:

8 + 0,111 × число токенов

Для внутреннего помощника, который разбирает договор, техническое описание или длинную переписку, такой профиль можно принять на пилот. Контекст на 27 000 токенов ближе к обработке объёмного документа, чем к короткому диалогу.

Для интерактивного помощника восемь секунд до первого слова уже заметны. Здесь нельзя спрятать задержку за общей пропускной способностью: сотрудник видит именно время до начала ответа.

Главного числа для корпоративного сервиса нет — сколько запросов система обрабатывает одновременно. Один быстрый поток ничего не говорит о работе отдела на 50 человек, если в утренний пик десять сотрудников отправят запросы в одну минуту.

Сравнение с H100 пока нельзя перенести в закупочную записку

Rubytech называет производительность восьми китайских GPU сопоставимой с конфигурациями на NVIDIA H100 в распространённых сценариях инференса. Однако публикация не раскрывает модель китайского ускорителя, число H100 в сравнительном стенде, размер модели, формат вычислений и профиль параллельной нагрузки.

Без этих данных слово «сопоставимо» нельзя перевести в цену одного ответа или число пользователей на сервер. Система с одной H100 и узел с восемью H100 дадут разные основания для сравнения. То же относится к длине входа: результат на 27 000 токенов не описывает поток коротких запросов по 500–1000 токенов.

У производителя Moore Threads, например, есть ускоритель MTT S5000 с поддержкой FP8, PyTorch, vLLM и SGLang. Компания публикует собственные показатели для обучения и инференса в спецификации MTT S5000. Но Rubytech не назвала использованную модель GPU. Поэтому характеристики S5000 нельзя приписывать испытанному ПАК.

Тест также не относится к обучению моделей. Rubytech проверяла инференс — выполнение запросов уже готовой моделью. Заявления Moore Threads о масштабировании обучения DeepSeek, Qwen и Llama описывают другой ускоритель и другую методику.

Если нагрузка появляется лишь несколько дней в месяц, сначала сравни покупку GPU-сервера и аренду. Альтернативный ускоритель не исправит экономику проекта, в котором оборудование простаивает большую часть времени.

Пилот должен повторять твою нагрузку

Поставщик должен прогнать ту модель, которую ты собираешься использовать, на твоей выборке запросов. Отдельный демонстрационный промпт не покажет, как платформа держит очередь, длинный контекст и отказ одного ускорителя.

Для сравнения зафиксируй одинаковые условия на китайской платформе и стенде с H100:

  • точное название и объём памяти каждого GPU;
  • версию модели, драйверов и среды инференса;
  • длину входа и ожидаемого ответа;
  • число параллельных запросов;
  • TTFT и TPOT по медиане и 95-му перцентилю;
  • долю запросов с ошибками и исчерпанием памяти;
  • потребление всего узла от розетки;
  • поведение после отказа одного GPU.

Такой подход совпадает с методикой LLM-Inference-Bench: авторы сравнивают аппаратные платформы на одинаковых семействах моделей и размерах от 7B до 70B. Их результаты нельзя напрямую переносить на Cotype 3 и стенд Rubytech, но принцип сравнения подходит для приёмочных испытаний.

Потребление измеряй для всего узла, а не по TDP ускорителя. В стоимость войдут CPU, память, охлаждение, блоки питания и потери преобразования. Без этого нельзя сравнить стоимость владения двух платформ.

Для более широкого выбора корпуса и схемы размещения пригодится разбор серверов с GPU под ИИ и обработку данных. Здесь различия выходят за пределы модели ускорителя: восемь плат требуют подходящего шасси, питания и охлаждения.

Спецификация под задачу

Считаем пилот для внутреннего помощника по корпоративным документам. Он получает контекст до 27 000 токенов, формирует ответы до 300 токенов и обслуживает до десяти одновременных запросов. Это допущение для расчёта, а не опубликованная конфигурация Rubytech.

Базовая спецификация пилота:

  • ПАК «Машина искусственного интеллекта Скала^р» с восемью китайскими GPU. Именно такая конфигурация прошла тест Cotype 3. Модель ускорителя и объём памяти поставщик обязан указать до заказа.
  • Cotype 3 в той же версии, которая пойдёт в эксплуатацию. Обновление весов или среды инференса требует повторного прогона.
  • Контекст 27 000 токенов и выход 300 токенов. При опубликованных TTFT и TPOT расчётный ответ занимает около 41 секунды на поток.
  • Десять параллельных запросов. Это условие нашего типового сценария. Публикация Rubytech такой результат не подтверждает, поэтому поставщик должен измерить его на пилоте.
  • Локальное хранилище для модели, контейнеров и журналов испытания. Объём и тип накопителей определяют после раскрытия размера модели и схемы загрузки; число из пресс-релиза вывести нельзя.
  • Два блока питания с раздельным подключением. Для промышленного узла отказ одного блока не должен останавливать тест или сервис. Номинальную мощность выбирают после замера потребления полной конфигурации.
  • Сеть по требованиям к загрузке модели и обмену между узлами. Пропускную способность нельзя назначить до раскрытия топологии GPU и сценария масштабирования.

Эта спецификация намеренно оставляет несколько строк без числа. Подставлять типовой объём памяти или мощность блока питания опасно: модель ускорителя неизвестна, а восемь разных GPU дают разную нагрузку на питание, охлаждение и шину.

Если пользователи отправляют короткие запросы, проведи отдельный прогон на своём распределении длины контекста. Если одновременных запросов больше десяти, увеличивай нагрузку ступенями до появления очереди и роста 95-го перцентиля TTFT. Если сервис нельзя останавливать, одного восьмиускорительного узла недостаточно: потребуется второй узел либо подтверждённый режим работы после отказа GPU.

Компромисс здесь прямой. Китайская платформа уменьшает зависимость от NVIDIA, но часть экономии уйдёт на адаптацию программной среды, тестирование обновлений и запас комплектующих. Посчитать выгоду можно лишь после цены ПАК, замера потребления и согласованного срока ремонта.

В пилот — да, в закупку по пресс-релизу — нет

ПАК Rubytech прошёл достаточную проверку, чтобы запросить коммерческий пилот для инференса Cotype 3 с длинным контекстом. Он работал без NVIDIA, а компания опубликовала TTFT, TPOT и эффект настройки программного стека.

Принимать решение о закупке рано. В предложении поставщика должны появиться точная конфигурация, цена, энергопотребление, параллельная производительность и результаты отказного теста.

Правило приёмки простое: сравни обе платформы на одной версии модели, одинаковых запросах и одинаковом числе потоков. Если поставщик выдержал согласованные TTFT и TPOT, раскрыл железо и посчитал стоимость владения, китайские GPU можно переносить из пилота в проект. Без этих цифр «сопоставимо с H100» остаётся результатом стенда Rubytech, а не расчётом для твоей нагрузки.