Компания запускает поиск по внутренним документам и помощника на модели 7B. Для дообучения нужны 4–8 GPU на несколько часов, а сервер с восемью NVIDIA H100 стоит 15–44 млн ₽. После запуска модели дорогой узел рискует большую часть недели ждать следующего задания.
На бюджетном комитете нужно защитить один из трёх вариантов: аренда для пилота, покупка сервера под постоянную нагрузку или гибрид — свой узел для инференса, облако для редкого дообучения. Решение зависит не от желания «держать ИИ у себя», а от загрузки GPU и допустимого простоя.
Сначала подтверждай поставку, потом защищай конфигурацию
Согласованный сервер может исчезнуть до подписания договора. По оценке ИТ-института, спрос на GPU-мощности в России превышает предложение на 50%. «Сервер Молл» сообщает, что партии из 20–30 GPU-серверов разбирают за день, иногда — за несколько часов.

Дефицит касается не только H100. Решения по проектам с H200, B200 и B300 поставщики принимают за дни: покупатель либо фиксирует оборудование и условия, либо партия уходит другому заказчику. В 2025 году двухмесячная задержка одного проекта с H200 привела к двукратному росту его стоимости — такой случай приводит коммерческий директор «Сервер Молл» Сергей Алимушкин.
Рынок предлагает три канала поставки. Заказ от производителя занимает 10–12 недель. Покупка через промежуточного клиента — 6–8 недель. Оборудование со склада доступно быстрее, но продавец включает дефицит в цену, а поддержка может оказаться номинальной.
С конца 2024 года NVIDIA усилила проверку конечных получателей и отслеживание серийных номеров, сообщает ComNews. Поставщик может запросить сведения о компании и фотографии установленного оборудования. К 2026 году поставки H100 в Россию сократились до десятков ускорителей, по данным Techora.
Поэтому в заявке на бюджет лучше фиксировать не единственный артикул, а границы закупки:
- платформа класса NVIDIA HGX с восемью H100;
- максимальная цена и крайняя дата решения;
- допустимые каналы и срок поставки;
- происхождение оборудования;
- гарантия на весь узел, а не на отдельные ускорители;
- условия проверки конечного получателя.
Так закупщик сможет сменить производителя сервера, не пересобирая проект. Но заменить платформу на набор похожих по характеристикам ускорителей без теста нельзя: паспортные терафлопсы ещё не показывают скорость твоей модели.
Редкое дообучение не окупает восемь H100
Считаем сценарий компании с одной моделью 7B. Несколько раз в месяц команда запускает дообучение на 4–8 GPU, затем использует модель для поиска по документам и ответов сотрудникам. Сервис должен отвечать не дольше трёх секунд.
По данным ИТ-института, дообучение модели такого размера занимает 4–8 GPU на несколько часов. Возьмём верхнюю границу: восемь ускорителей работают по восемь часов четыре раза в месяц. Получается 256 GPU-часов, или 32 часа загрузки всего восьмиускорительного узла.
В 30-дневном месяце у узла 720 часов. Дообучение займёт 32 из них — около 4,4%. Покупать сервер за 15–44 млн ₽ только ради такой работы нельзя обосновать загрузкой. Даже если запускать обучение каждую неделю по 16 часов, утилизация узла останется около 9%.
В этом сценарии дообучение нужно арендовать. Neocloud предлагает посекундный расчёт и автоматическое масштабирование, поэтому компания платит за часы работы, а не за месяц простоя. Рост доли GPU-облаков с 12,3% в 2024 году до 27,4% в 2026-м показывает, что такой выбор перестал быть временной мерой для пилотов.
Собственный сервер появляется в расчёте, когда его постоянно занимает инференс. Techora называет коридор утилизации 60–90% экономически оправданным для своей инфраструктуры. Для одного узла это 432–648 часов в месяц.
Порог в 60% — не обещание окупаемости. Он лишь отсекает покупку, при которой оборудование заведомо простаивает. Для финансового решения всё равно нужно сравнить цену аренды за 432–648 часов с капитальными затратами, электричеством, размещением и поддержкой собственного сервера.
Получается простое правило. Редкие запуски обучения уходят в облако. Постоянный инференс с загрузкой выше 60% можно переносить на свой узел. Если обучение приходит всплесками, а инференс работает ежедневно, эти две нагрузки не нужно насильно помещать на одно железо.
Китайские ускорители сначала проверяй на своей модели
В Россию уже поставляют ускорители Metax, Biren BR100 и BR104, Moore Threads MTT S4000 и Iluvatar BI‑V150. ИТ-институт также сообщает, что YADRO Vegman, Aquarius и Rikor начинают интегрировать китайские GPU в свои платформы.
Для инференса такой вариант заслуживает теста. В собранных ИТ-институтом бенчмарках разрыв с NVIDIA H100 на инференсе минимален, а на обучении LLM китайские ускорители отстают на 20–40%.
Эти числа нельзя переносить прямо в смету. Скорость зависит от модели, точности вычислений, размера батча, драйверов и программного стека. Возьми у поставщика узел на тест и прогони свою модель с целевым контекстом и ограничением ответа в три секунды.
Если альтернативная платформа укладывается в задержку и держит нужное число одновременных запросов, переплата за H100 инференсу не помогает. Если узел нужен прежде всего для обучения и срок расчёта влияет на выпуск модели, отставание на 20–40% уже превращается в рабочие часы команды.
Спецификация под задачу
Берём типовой сценарий: одна модель 7B, дообучение на 4–8 GPU несколько раз в месяц и постоянный сервис ответов с задержкой до трёх секунд. Инференс занимает узел не меньше 432 часов в месяц — это нижняя граница загрузки 60%.
Ускорители: восемь NVIDIA H100 в сервере на платформе класса NVIDIA HGX. В документации NVIDIA HGX объединяет GPU, NVLink, NVIDIA networking и программный стек для ИИ и высокопроизводительных вычислений.
Связь между GPU: NVLink и NVSwitch внутри сертифицированной HGX-платформы. Shared NVSwitch Mode позволяет передавать GPU виртуальным машинам, если командам или сервисам нужно разделить один узел.
Процессоры, память, накопители и сетевые адаптеры: только из сертифицированной спецификации выбранного сервера HGX. Исходные материалы не дают нагрузки на подготовку данных, размер датасета и объём кэша, поэтому назвать 1 или 2 ТБ памяти либо определённое число NVMe означало бы придумать конфигурацию. Поставщик должен подтвердить совместимость узла целиком и передать его ведомость компонентов.
Питание и корпус: заводская конфигурация выбранной HGX-платформы с резервированием блоков питания. До заказа площадка должна подтвердить электрическую мощность, охлаждение, массу и глубину корпуса по паспорту конкретной модели.
Бюджет: 15–44 млн ₽ за один сервер с восемью H100, по данным Techora. Разброс почти втрое отражает канал поставки, состояние оборудования, комплектацию и дефицит. Проси расшифровку цены по всему узлу.
Резерв: второй идентичный сервер, если простой инференса недопустим. Аппаратный бюджет составит 30–88 млн ₽: 2 × (15–44 млн ₽). Два разных узла усложнят перенос нагрузки и поддержку, поэтому резерв лучше собирать на той же платформе и с тем же программным стеком.
Эта спецификация дорога для редкого обучения: при четырёх восьмичасовых запусках в месяц узел занят лишь на 4,4%. Зато при постоянном инференсе ты не зависишь от наличия свободных облачных GPU. За независимость платишь вторым сервером, своей эксплуатацией и запасом мощности площадки.
Что нести на бюджетный комитет
Для пилота и редкого дообучения модели 7B арендуй 4–8 GPU на время расчёта. Покупка восьми H100 при загрузке в несколько процентов замораживает 15–44 млн ₽ в простаивающем сервере.
При постоянном инференсе и подтверждённой загрузке 60–90% закладывай один восьмиускорительный узел. Обучение всплесками оставь в облаке: оно не должно занимать собственную платформу лишь несколько часов в месяц.
Если сервис не может ждать ремонта, нужны два одинаковых узла и аппаратный бюджет 30–88 млн ₽. RAID и резервные блоки питания не заменяют второй сервер при отказе системной платы, NVSwitch или самого узла.
Перед заказом запроси у поставщика срок поставки по конкретному каналу, происхождение оборудования, заводскую ведомость компонентов, гарантию на весь сервер и порядок проверки конечного получателя. Для сравнения платформ используй подбор серверов с GPU под ИИ и Big Data.
Решение укладывается в одну строку: аренда — пока GPU нужны эпизодически; свой сервер — когда инференс занимает его хотя бы 432 часа в месяц; два сервера — когда простой стоит дороже второго узла.