Выбирать нужно не GPU, а финансовую модель нагрузки

Вопрос «арендовать GPU или купить сервер» часто начинается со сравнения одной почасовой ставки с ценником оборудования. Это удобное сравнение, но неполное. Аренда включает эластичность и перенос части эксплуатационного риска на поставщика. Покупка создаёт фиксированные расходы, зато при стабильной загрузке каждый дополнительный час может стоить дешевле.

Поэтому решение определяется не брендом ускорителя, а профилем работы: сколько GPU-часов действительно нужно в месяц, насколько равномерно они распределены, какой запас памяти требуется, допустима ли очередь, что происходит при отказе и сколько стоит перенос проекта на другую конфигурацию.

FinOps Foundation определяет полную стоимость владения как совокупность приобретения, управления, поддержки, связи, труда, простоя и других расходов. Для ИИ-контура это особенно важно: видеокарта — заметная строка, но не вся смета. Серверу нужны процессоры, память, диски, сеть, питание, охлаждение, резервирование, мониторинг и человек, который обновит драйвер до того, как обновление решит обновить планы на выходные.

Сначала опишите нагрузку

До расчёта денег соберите хотя бы четыре недели телеметрии на арендованном или тестовом контуре. Для каждого сценария фиксируйте:

  • фактические GPU-часы и календарные часы доступности;
  • пиковое число одновременных запросов;
  • входные и выходные токены либо другой объём работы;
  • p50 и p95 времени ответа, длину очереди и число тайм-аутов;
  • долю принятых пользователями результатов;
  • время простоя между пакетами;
  • часы инженеров на сопровождение, исправления и оценку качества.

GPU может числиться занятым весь месяц, но приносить пользу несколько часов в день. И наоборот: пакетная обработка бухгалтерских документов запускается ночью на восемь часов и полностью загружает ускоритель. Средняя загрузка у этих систем может выглядеть одинаково, а требования к аренде и владению будут разными.

Публичные бенчмарки помогают понять порядок производительности, но не заменяют тест своей модели. MLPerf разделяет сценарии по характеру нагрузки и измеряет пропускную способность и задержку при заданных требованиях к качеству. Для бизнеса это практический сигнал: сравнивать нужно одинаковую модель, квантизацию, длину контекста, пакетирование и целевой SLA.

Полная месячная стоимость собственного сервера

Сначала приведите все расходы к одному месяцу. Упрощённая формула выглядит так:

`Свой контур в месяц = (покупка − остаточная стоимость) / срок использования + размещение + электричество + поддержка + труд + резерв на отказ + лицензии`

Покупная цена должна включать весь сервер, а не только GPU. Остаточная стоимость — консервативная оценка суммы, которую удастся вернуть при продаже или повторном использовании. Срок лучше выбирать не по бухгалтерскому максимуму, а по периоду, в котором оборудование останется полезным для конкретных моделей.

Энергопотребление нельзя считать только по паспорту GPU. Например, NVIDIA указывает для L40S 48 ГБ памяти и максимальную потребляемую мощность 350 Вт, но полный сервер включает остальные компоненты и потери охлаждения. Реальную мощность измеряют на вашей нагрузке, а в смету добавляют стойку, сетевое подключение и резервное питание.

Резерв на отказ зависит от требований бизнеса. Если простой на сутки допустим, можно держать договор на замену или арендовать временную мощность. Если сервис должен работать постоянно, потребуется запасной узел, дежурство или согласованный внешний резерв. Нельзя оценивать основной сервер как единственный, а аренду — как готовую отказоустойчивую платформу: сравнение должно давать одинаковый уровень сервиса.

Полная стоимость аренды

Для аренды формула другая:

`Аренда в месяц = ставка GPU-часа × оплачиваемые часы + постоянные ресурсы + хранение + трафик + резерв мощности + труд`

Оплачиваемый час и полезный час — не одно и то же. Время уходит на загрузку весов, прогрев, индексацию, простои между заданиями и ошибочные запуски. Если экземпляр работает круглосуточно ради редких запросов, аренда постепенно превращается в покупку, только без коробки.

Уточните шаг тарификации, минимальный срок, стоимость остановленного диска, исходящего трафика, снимков и статических адресов. Проверьте, гарантируется ли нужный тип GPU или он доступен только при наличии свободной ёмкости. Для конфиденциальных данных добавьте стоимость защищённого подключения, журналирования и проверок поставщика.

Selectel в документации, например, описывает фиксированные и произвольные конфигурации облачных GPU-серверов и необходимость корректных драйверов. Конкретные тарифы и доступность меняются, поэтому их нужно подставлять в модель в день решения, а не переносить из чужой статьи. То же относится к любому поставщику.

Модельная точка безубыточности

Ниже не рыночное предложение, а пример расчёта с условными допущениями.

Допустим, полный сервер стоит 2,4 млн рублей. Через 36 месяцев компания рассчитывает использовать или продать его за 300 тыс. рублей. Месячная амортизируемая часть тогда равна примерно 58,3 тыс. рублей. Размещение, электричество, поддержка, труд администратора и резерв на отказ в модели составляют ещё 82 тыс. рублей. Итого собственный контур — около 140,3 тыс. рублей в месяц.

Для аренды возьмём условные 450 рублей за GPU-час и 20 тыс. рублей постоянных расходов на хранение, сеть и сопровождение. Точка равенства:

`(140 300 − 20 000) / 450 ≈ 267 GPU-часов в месяц`

Это около 37% от 730 календарных часов. При 120 оплачиваемых часах аренда по модели стоит 74 тыс. рублей, а свой сервер — 140,3 тыс. При 400 часах аренда достигает 200 тыс. рублей, а собственный контур остаётся около 140,3 тыс., пока не требуется второй сервер или дополнительная смена поддержки.

Расчёт меняется линейно от ставки и нелинейно от требований к резервированию. Если для SLA нужно два собственных узла, фиксированная часть почти удвоится. Если арендный поставщик требует заранее резервировать ёмкость, часть эластичности исчезнет. Поэтому таблица должна показывать минимум три сценария: низкую, ожидаемую и пиковую нагрузку.

Считайте стоимость принятого результата

FinOps рекомендует связывать технологические расходы с измеримой единицей ценности: запросом, транзакцией, клиентом или завершённым процессом. Для ИИ удачной единицей может быть принятый ответ, проверенный документ, закрытое обращение или корректно выполненный шаг агента.

Формула для сравнения вариантов:

`Стоимость принятого результата = полные месячные расходы / число результатов, прошедших проверку`

Если дешёвая конфигурация генерирует больше ошибок и требует ручной переработки, её стоимость GPU-часа ничего не доказывает. Добавьте труд проверки, стоимость ложных решений и долю повторных запусков. Покупка мощного сервера также не становится выгодной от того, что он быстро производит ответы, которые никто не использует.

Затраты следует распределять по сценариям. Общая платформа может обслуживать RAG, извлечение документов и ночную классификацию. Без тегов, очередей и метрик владельцы процессов увидят один счёт и начнут оптимизировать друг друга. FinOps Foundation рекомендует назначать расходы продуктам и подразделениям через согласованную стратегию аллокации и данные об использовании.

Когда аренда обычно разумнее

Аренда чаще выигрывает, если:

  • нагрузка ещё неизвестна или быстро меняется;
  • пилот может закрыться через несколько недель;
  • работа идёт короткими пакетами;
  • нужны разные GPU для экспериментов;
  • важен быстрый запуск без закупки и монтажа;
  • компания не готова самостоятельно обеспечивать резервирование;
  • требования к данным допускают выбранный внешний контур.

Для пилота аренда покупает не только часы, но и право недорого ошибиться с размером модели. Это полезная опция: сервер, который оказался слишком маленьким, обычно не масштабируется силой презентации.

Когда покупка начинает побеждать

Собственный сервер становится кандидатом, когда нагрузка стабильна несколько месяцев, прогнозируется рост, конфигурация подтверждена тестами, данные требуют локального размещения, а команда умеет сопровождать железо и программный стек. Особенно хорошо покупка выглядит при ровной базовой загрузке, которую можно заполнять несколькими согласованными задачами.

Но высокая загрузка не должна означать бесконечную очередь. Если p95 задержки нарушает SLA, один полностью занятый GPU экономичен только на бумаге. Сначала определите допустимую задержку, затем — необходимую мощность и резерв, и лишь потом сравнивайте стоимость.

Гибридный вариант часто практичнее

Между «всё арендовать» и «купить навсегда» есть рабочая середина. Компания держит на своём сервере стабильную базовую нагрузку и использует аренду для пиков, переиндексации, экспериментов или аварийного резерва — если политика данных позволяет такой перенос.

Начать можно полностью с аренды, накопить телеметрию, зафиксировать конфигурацию и купить мощность под устойчивый минимум. Через квартал модель пересчитывают: выросли ли GPU-часы, изменилась ли доля принятых результатов, сколько стоило сопровождение и как часто использовался внешний резерв.

Что взять руководителю

Не утверждайте закупку по цене видеокарты и не продлевайте аренду по одному счёту. Попросите одну таблицу с одинаковым SLA, тремя сценариями нагрузки и стоимостью принятого бизнес-результата. Отдельно покажите точку безубыточности, резерв на отказ и часы команды.

Практичный первый шаг — четыре недели измерять оплачиваемые и полезные GPU-часы на пилоте. Если стабильная базовая нагрузка уверенно проходит точку безубыточности и не требует скрытого второго сервера, покупка получает экономический смысл. Пока профиль нагрузки прыгает, аренда остаётся платой за гибкость, а не признаком того, что компания «ещё не доросла» до собственного железа.