Latham & Watkins три года закупала GPU-серверы NVIDIA, но не отказалась от Harvey и других коммерческих ИИ-сервисов. Собственное оборудование заняло закрытую площадку в стороннем дата-центре. Облако осталось рядом.
В этом и состоит вывод для ИТ-руководителя: повторять закупку целиком не нужно. Собственная инфраструктура нужна для чувствительных данных и постоянной вычислительной нагрузки. Остальные задачи дешевле и быстрее оставить в облаке.
Latham покупает контроль над данными
Latham запускает на своих серверах только выбранные задачи. ИТ-директор фирмы Рене Мендоса объяснил eWeek причину: часть клиентской информации нельзя передавать ни одному облачному поставщику.

Оборудование стоит не в офисе фирмы, а в арендованной зоне стороннего дата-центра. Доступ к ней имеет только персонал Latham. Это выделенная инфраструктура, а не сервер под столом и не общедоступное облако.
На этих мощностях инженеры дообучают открытые модели NVIDIA Nemotron 3 под внутренние процессы. Собственный контур также позволяет глубже связать модели с корпоративными системами. При этом Latham продолжает пользоваться Harvey и продуктами крупных технологических компаний.
Фирма выбрала гибридную схему:
- чувствительные данные и дообучение моделей — на контролируемом оборудовании;
- готовые функции без закрытых данных — в коммерческих сервисах;
- новые сценарии — там, где их дешевле проверить до закупки железа.
Если твои данные разрешено обрабатывать у облачного поставщика, одна только новость о Latham не обосновывает покупку серверов.
Собственный GPU-узел должен работать, а не ждать задачи
Профессор права Penn State Dickinson Law Дэрил Лим связывает экономику GPU-инфраструктуры с полезной загрузкой: серверы должны регулярно выполнять работу, за которую компания готова платить. Цена оборудования сама по себе ничего не говорит без часов занятости.
Latham не раскрыла ни стоимость инфраструктуры, ни загрузку ускорителей. Financial Times сообщает лишь о нескольких серверах с несколькими GPU в каждом. eWeek уточняет, что фирма использует NVIDIA H200 и оценивает системы Blackwell и Vera Rubin.
Поэтому нельзя взять расходы Latham и сравнить их со своим бюджетом. Таких данных нет.
Рабочее правило проще. Если команда запускает обучение или обработку отдельными проектами, арендуй ускорители на время этих проектов. Рассматривай собственный узел, когда одна и та же нагрузка возвращается каждую неделю, а закрытые данные нельзя вынести во внешний сервис.
Для денежного сравнения считай не цену одной видеокарты, а расходы на покупку и аренду при своём графике загрузки. В расчёт входят сервер, размещение, электричество, охлаждение, резервирование и время инженеров.
Масштаб Latham не похож на обычную юридическую фирму
По данным Financial Times, выручка Latham за прошлый год составила 8,3 млрд долларов. В компании работает более 900 технических специалистов. Около 100 из них заняты ИИ.
Такая команда может обслуживать несколько поколений ускорителей, дообучать модели и связывать их с внутренними системами. У компании на 200 сотрудников обычно нет отдельной сотни инженеров для этой работы.
Оценка инфраструктуры масштаба Latham достигает десятков или сотен миллионов долларов в год, сообщает Financial Times. Это оценка масштаба, а не раскрытые расходы фирмы: сумму Latham не назвала.
Организационный порог здесь важнее модели GPU. Для своего контура нужны владельцы четырёх зон ответственности: модели, данные, серверная платформа и информационная безопасность. Если все четыре роли сходятся на одном администраторе, начинать с нескольких H200 рано.
Гибридная схема ограничивает цену ошибки
Облако позволяет проверить задачу до закупки. Ты видишь, сколько GPU-часов она потребляет, как часто запускается и какой объём данных приходится передавать. После этого можно отделить постоянную нагрузку от экспериментов.
Свой контур закрывает другую проблему: компания сама определяет, где лежат данные, кто получает к ним доступ и какие модели запускаются рядом с внутренними системами. Именно так поступает Latham.
Получается не спор «сервер или облако», а распределение задач:
- закрытые данные с повторяемой нагрузкой — собственная или выделенная инфраструктура;
- нерегулярное обучение — аренда GPU;
- готовая функция вроде поиска или подготовки черновика — коммерческий сервис, если его условия подходят политике данных;
- временный пилот — облако до появления измеренной нагрузки.
Только после такого разделения выбирай платформу для локального запуска и дообучения моделей. Покупать H200 лишь потому, что их использует Latham, — значит переносить чужую нагрузку в свой бюджет.
Спецификация под задачу
Конфигурация Latham не опубликована. Ниже — не её копия, а расчёт для компании, которая уже прошла облачный пилот и выделила две постоянные закрытые нагрузки.
Берём такие исходные данные:
- одновременно работают две задачи;
- каждой задаче команда выделяет по два GPU;
- локальный набор моделей, контрольных снимков и рабочих данных занимает до 8 ТБ;
- две среды обработки требуют по 96 ГБ оперативной памяти;
- подготовка данных требует ещё 192 ГБ;
- под систему и запас оставляем 128 ГБ памяти;
- допустим останов одной задачи при обслуживании узла, но не потеря данных после отказа одного диска.
Из двух одновременных задач по два ускорителя получаем четыре GPU. Память считаем так: 96 × 2 + 192 + 128 = 512 ГБ. Для 8 ТБ рабочих данных нужен массив с двукратным запасом: 16 ТБ полезной ёмкости оставят место под новые версии моделей и временные наборы.
Под этот сценарий запрашивай у поставщика такую конфигурацию:
- один сервер на четыре NVIDIA H200;
- два процессора, которые дают достаточно линий PCIe для четырёх ускорителей и сетевых карт;
- 512 ГБ ECC RDIMM;
- два системных SSD по 3,84 ТБ в RAID1;
- четыре NVMe по 7,68 ТБ в RAID10 — 15,36 ТБ полезной ёмкости;
- две сетевые линии по 100 Гбит/с, если обучение читает данные из внешнего хранилища;
- два резервируемых блока питания и два независимых ввода электропитания;
- стоечный корпус, рассчитанный производителем на четыре H200;
- место в стойке, питание и охлаждение с запасом под второй такой узел.
Мощность блоков питания и требуемое охлаждение нельзя честно назвать без выбранной платформы: они зависят от исполнения H200, процессоров и корпуса. Поставщик должен приложить расчёт максимального потребления всей конфигурации, а не только GPU.
Если одновременно работает одна задача на двух ускорителях, начни с двух GPU и корпуса с местом под ещё два. Если требуется продолжать работу при отказе сервера, одного узла мало: бери два узла и распределяй задачи между ними. Если наборы данных вырастают с 8 до 20 ТБ, не набивай вычислительный корпус дисками — выноси данные в отдельное хранилище и считай сеть под фактический поток чтения.
Компромисс прямой. Четыре H200 дают закрытый контур для двух параллельных задач, но оплачивать придётся весь узел, даже когда работает один ускоритель. Облако снимает простой с твоего бюджета, зато часть данных покидает контролируемую площадку.
Что требовать от поставщика
Фраза «сервер для ИИ» не описывает нагрузку. В запросе укажи модель, число одновременных задач, объём данных, допустимый простой и план роста на два года.
В коммерческом предложении должны быть названы исполнение и число GPU, доступная память ускорителей, схема межсоединения, линии PCIe, максимальное потребление, тепловыделение, сетевые интерфейсы и условия установки следующего узла. Разные компоновки GPU-систем рассчитаны на разные вычисления, поэтому сравнивать предложения только по названию ускорителя нельзя.
Latham уже оценивает Blackwell и Vera Rubin, хотя использует H200. Это не повод ждать следующего поколения. Это повод записать собственную нагрузку и проверить, что именно новое оборудование изменит: время одной задачи, число параллельных запусков или объём модели. Если ответа нет, поколение GPU пока не влияет на решение.
Свой сервер, облако или гибрид
Выбирай собственную инфраструктуру, когда данные нельзя передавать облачному поставщику, нагрузка повторяется и у компании есть люди для эксплуатации платформы.
Оставляй облако, если работа идёт отдельными проектами, а ускорители между ними простаивают.
Бери гибрид, если закрытого контура требует лишь часть задач. Latham выбрала именно этот вариант: собственные серверы для чувствительных вычислений, коммерческие сервисы — для остального.
Перед запросом цены сделай три вещи:
- Отдели нагрузки с закрытыми данными.
- Запиши число одновременных задач, модели, объём данных и часы работы за месяц.
- Сравни стоимость занятых GPU-часов с сервером, размещением и командой на два-три года.
Без этих данных H200 остаётся строкой в счёте. С ними появляется конфигурация, которую можно защитить перед директором.