GPU VPS и облачные GPU: как выбрать сервер для ИИ, рендера и вычислений
Словом GPU VPS называют разные продукты: виртуальную машину с выделенной видеокартой, долю GPU через vGPU, контейнер с ускорителем или почасовой вычислительный инстанс. Сравнивать их только по названию видеокарты нельзя — важны объём видеопамяти, точность вычислений, лимиты, сеть, хранение и полная стоимость задачи.

Когда GPU действительно нужен
Графический ускоритель полезен там, где алгоритм хорошо распараллеливается и поддерживается подходящей библиотекой: обучение и инференс нейросетей, рендеринг, транскодирование видео, научные расчёты, некоторые задачи аналитики. Обычный веб-сайт, база данных, VPN или небольшой бот чаще выигрывают от более быстрого CPU, NVMe и достаточной памяти, а не от дорогой видеокарты.
Перед выбором запустите задачу на локальной или тестовой GPU и измерьте время, пиковую VRAM, загрузку ускорителя, CPU, диск и сеть. Если GPU простаивает, узким местом может быть подготовка данных, декодирование, медленное хранилище или последовательный код. Покупка более мощной карты это не исправит.
| Сценарий | Главный параметр | Типичный риск |
|---|---|---|
| Инференс языковой модели | VRAM, пропускная способность памяти, задержка | Модель не помещается или очередь нестабильна |
| Обучение | VRAM, FP16/BF16, связь между GPU | Долгий checkpoint и дорогой простой |
| Генерация изображений | VRAM и скорость конкретной модели | Сравнение по игровой производительности |
| Видеокодирование | Аппаратные кодеки и лимит сессий | Нужный профиль не поддерживается |
| 3D-рендер | Совместимость движка и VRAM | Плагин или драйвер не работает в облаке |
Выделенная карта, vGPU или контейнер
При PCI passthrough виртуальная машина получает практически целую физическую карту. Это даёт предсказуемые ресурсы и свободу драйверов, но стоит дороже и не всегда позволяет быстро менять конфигурацию. vGPU делит ускоритель между клиентами; провайдер выделяет профиль с определённой VRAM и вычислительной долей. Такой вариант экономичнее, однако реальная производительность зависит от лимитов и соседней нагрузки.
Контейнерные GPU-платформы выдают готовое окружение на общем кластере. Они удобны для эксперимента, batch-задач и ноутбуков, но могут иметь ограничения по времени жизни, входящим портам и постоянному диску. Serverless-инференс берёт плату за вызовы или время выполнения и выгоден при редких запросах, хотя холодный старт и ограниченная настройка подходят не каждому API.
- уточните, физическая карта выделена полностью или используется vGPU;
- проверьте гарантированную VRAM и вычислительную долю;
- узнайте, можно ли выбрать версию драйвера и CUDA;
- посмотрите правила долгих вычислений и загрузки GPU;
- проверьте доступность публичного IP, приватной сети и постоянного диска;
- узнайте, сохраняется ли диск после остановки инстанса.
Почему VRAM часто важнее количества ядер
Если модель, батч и рабочие буферы не помещаются в видеопамять, производительность резко падает или задача вообще не запускается. Часть данных можно выгрузить в RAM, использовать квантование, gradient checkpointing или меньший batch, но это меняет скорость и иногда качество. Поэтому сначала измеряют пиковую VRAM на близкой версии модели, затем добавляют запас.
Для инференса учитывайте не только веса. Контекст, KV-cache и параллельные запросы также занимают память. Одна модель может нормально отвечать одному пользователю и завершаться с ошибкой при десяти одновременных сессиях. Для обучения нужны параметры, градиенты, состояния оптимизатора и активации — объём может во много раз превышать размер файла модели.
Считайте стоимость результата, а не часа
Почасовой тариф легко сравнить, но итог определяется временем выполнения. GPU вдвое дороже, завершающая задачу втрое быстрее, может снизить стоимость результата. Добавьте CPU и RAM инстанса, постоянный диск, снапшоты, исходящий трафик, публичный IP, хранение датасета и время простоя между заданиями.
| Модель оплаты | Когда выгодна | Что проверить |
|---|---|---|
| Почасовая | Эксперименты и периодические batch-задачи | Минимальный шаг, оплата остановленного диска |
| Месячная | Постоянный инференс с высокой загрузкой | Срок, лимиты и цена замены карты |
| Прерываемая | Восстанавливаемое обучение и рендер | Предупреждение, частота checkpoint |
| За запрос | Редкий инференс без администрирования | Холодный старт и пределы модели |
Для обучения посчитайте цену одного успешного эксперимента, включая неудачные запуски. Настройте автоматическое выключение простаивающих инстансов и бюджетные уведомления. Но не удаляйте узел до загрузки checkpoint и логов в независимое хранилище. При месячной аренде сравните её с выделенным сервером: постоянная высокая загрузка иногда делает физическую машину выгоднее.
CPU, RAM, диск и сеть вокруг GPU
Ускоритель не работает изолированно. CPU декодирует данные, подготавливает батчи и обслуживает API; нехватка ядер оставляет GPU без работы. RAM должна вместить датасетный кэш, процессы и загрузку модели. Локальный NVMe полезен для активного набора данных, но важные результаты нужно переносить в постоянное объектное хранилище.
Если датасет загружается из сети, измерьте пропускную способность и цену трафика. Для нескольких GPU критична связь между ними: наличие карт в одном сервере ещё не означает быстрый NVLink. Распределённое обучение между узлами зависит от сети с высокой пропускной способностью и низкой задержкой; обычный гигабитный интерфейс способен свести выигрыш к нулю.
Проверьте совместимость ОС, ядра, NVIDIA-драйвера, CUDA, cuDNN, фреймворка и контейнерного runtime. Зафиксируйте рабочие версии в образе. Обновление драйвера на production без теста может остановить задачу, а слишком старый драйвер не запустит новый runtime.
Как провести честный тест до долгой аренды
- Возьмите реальную модель, размер входа и batch, а не синтетический тест.
- Прогрейте процесс, затем измерьте несколько повторов.
- Запишите скорость, p95-задержку, пиковую VRAM и загрузку GPU.
- Отдельно измерьте чтение датасета, подготовку CPU и сохранение результата.
- Для API проведите тест нужного числа параллельных запросов.
- Повторите измерение в разное время, если используется общая vGPU.
- Посчитайте стоимость одного изображения, минуты видео, тысячи запросов или обучающей эпохи.
Игровые рейтинги видеокарт плохо предсказывают машинное обучение. Важны Tensor Cores, поддерживаемые типы данных, память и оптимизация конкретного фреймворка. Для видео проверьте именно нужный кодек, глубину цвета и число аппаратных сессий. Для рендера используйте сцену со своими текстурами и плагинами.
Данные, образы и безопасность
GPU-инстанс остаётся обычным сервером с SSH, пакетами и секретами. Ограничьте сетевые порты, используйте ключи, запускайте контейнер без лишних привилегий и обновляйте базовый образ. Не помещайте ключ объектного хранилища с правом удаления всех данных внутрь ноутбука или образа. Выдавайте короткоживущие и минимальные права.
Проверьте условия обработки данных и регион хранения. Датасет, checkpoint и журнал запросов могут содержать персональную или коммерческую информацию. Шифруйте постоянные диски и бакеты, задавайте сроки хранения, очищайте временный диск при завершении. Если используется сторонний образ, изучите его источник и состав: готовый notebook может содержать устаревшие службы и открытый порт без пароля.
Типичные ошибки
- Выбор только по названию GPU. Один и тот же ускоритель может быть выделенным или разделённым и иметь разные лимиты мощности.
- Недостаток VRAM. Модель запускается на тестовом batch, но падает при параллельных запросах.
- Игнорирование CPU и диска. GPU простаивает в ожидании данных.
- Сравнение цены за час. Не учитываются скорость, трафик, хранение и простои.
- Нет checkpoint. Прерываемый инстанс уничтожает часы обучения.
- Плавающие версии CUDA. Окружение невозможно повторить или откатить.
- Постоянно включённый экспериментальный сервер. Ночная и выходная простои становятся основной статьёй расхода.
Частые вопросы
Подойдёт ли GPU VPS для размещения LLM?
Да, если модель с учётом квантования, контекста и параллельности помещается в VRAM. До аренды измерьте память и скорость на нужном сценарии.
Что выбрать: облачный GPU или физический сервер?
Облако удобно для переменной нагрузки и экспериментов. При постоянной высокой загрузке выделенная машина может быть дешевле, но требует большего обязательства и эксплуатации.
Можно ли обучать на прерываемых инстансах?
Да, если задача регулярно сохраняет checkpoint во внешнее хранилище и автоматически продолжает работу. Учтите стоимость повторных участков.
Нужен ли публичный IP?
Для batch-задачи обычно нет. Доступ через VPN, bastion или консоль уменьшает поверхность атаки. Публичный API можно вынести на отдельный обычный VPS.
Полезно рядом: деплой Node.js и Python, выделенный сервер или VPS и резервирование данных.