RTX 4090 · A6000 · H100 · CUDA 12

GPU VPS от €80/мес

Аренда сервера с NVIDIA GPU для AI, LLM inference, Stable Diffusion, video-рендера. Passthrough целиком (не share), CUDA 12 + cuDNN + Docker nvidia-toolkit из коробки. Почасовая тарификация от €0.11/час.

Разовая задача на 8 часов? Заплатите €0.88 за RTX 4090 и удалите. Не подписка, а gpu-as-a-utility.

От
€80/мес
RTX 4090 24 ГБ
Почасово
€0.11/час
тест за 12 ₽
VRAM макс
80 ГБ
H100 по запросу
CUDA
12.x
+ cuDNN, Docker

Что можно делать на GPU VPS

Обучение нейросетей

PyTorch 2.x, TensorFlow 2.x, JAX. Fine-tuning open-source LLM (Llama-3-8B на RTX 4090 через LoRA — обучение за 3-5 часов). ResNet, YOLO, Whisper, SAM — весь классический CV/NLP stack.

Inference LLM

vLLM, llama.cpp, ollama, TensorRT-LLM. Llama-3-8B на RTX 4090: 80-120 tokens/s. Llama-3-70B Q4 на A6000: 20-30 t/s. Свой ChatGPT-clone для внутренних задач без OpenAI-API.

Stable Diffusion / Flux

A1111 WebUI, ComfyUI, InvokeAI. SDXL на RTX 4090 — 20-30 картинок/мин. Flux Dev на A6000 — 40 сек/картинка. Для коммерческого генератора картинок — оптимально.

Video-рендер

Blender Cycles с OptiX (RTX-акселерация), DaVinci Resolve GPU-transcode, FFmpeg с NVENC. 4K H.264 → HEVC на RTX 4090: 200-300 fps.

AMD EPYC + GPU

Не «слабый CPU + топовый GPU» — сбалансированная сборка: EPYC 9004 8+ ядер, 64+ ГБ RAM. Data-loading не станет узким местом для тренировки.

NVMe SSD

1 ТБ NVMe на entry-tier. Датасет ImageNet (150 ГБ), COCO (25 ГБ), FineWeb (500 ГБ подсет) — влезают целиком. 100k+ IOPS = быстрый epoch.

Passthrough, не share

Ваш GPU целиком — не MIG-slice и не vGPU. Полная память, полная утилизация. Никаких соседей, дерущихся за CUDA-cores.

Готовые Docker образы

Nvidia PyTorch (nvcr.io/nvidia/pytorch), Text-Generation-WebUI, Ollama, A1111, ComfyUI, LocalAI — образы стянуты и запускаются одной командой. Не собирать окружение часами.

Тарифы GPU VPS

Цены в EUR. При оплате картой Мир — по курсу ЦБ + 2 %. GPU passthrough (не share).

ТарифGPUCPU / RAMДискЦена / месЦена / час
GPU-4090RTX 4090 24 GB8 vCPU / 64 ГБ1 ТБ NVMe€80€0.11
GPU-A6000A6000 Ada 48 GB12 vCPU / 128 ГБ2 ТБ NVMe€160€0.22
GPU-2×40902× RTX 4090 48 GB16 vCPU / 128 ГБ2 ТБ NVMe€150€0.21
GPU-H100H100 80 GB (запрос)16 vCPU / 256 ГБ4 ТБ NVMe€600€0.83

Что укладывается на какой GPU

Правило: fp16 модель занимает `размер_параметров × 2` ГБ VRAM. Плюс KV-cache (для inference) или градиенты + оптимизатор (для training).

  • Stable Diffusion 1.5 / SDXL / Flux Dev — RTX 4090 24 ГБ хватит
  • Llama-3-8B fp16 (16 ГБ) inference — RTX 4090 24 ГБ
  • Llama-3-8B fp16 fine-tune LoRA — RTX 4090 (LoRA сжимает адаптеры)
  • Llama-3-8B full-parameter fine-tune — 2× RTX 4090 с DeepSpeed ZeRO
  • Llama-3-70B Q4_K_M (40 ГБ) inference — A6000 48 ГБ
  • Llama-3-70B fp16 (140 ГБ) inference — 2× A6000 или H100 80 ГБ + INT8
  • Whisper Large-v3 (3 ГБ) — RTX 4090 real-time × 30

Что предустановлено и как запустить

Не «голая Ubuntu, ставьте драйверы сами». Шаблон «GPU AI Ready» разворачивает VPS с полным CUDA-стеком за 60 секунд.

  • Ubuntu 24.04 LTS + NVIDIA Driver 550 + CUDA 12.4 + cuDNN 8.9
  • Docker + nvidia-container-toolkit — запуск GPU-контейнеров out-of-box
  • PyTorch 2.4 + Torchvision + Transformers 4.44 (последняя стабильная)
  • vLLM 0.5+ для LLM inference (высокопроизводительный движок)
  • Jupyter Lab на порту 8888 (запаролен) — код прямо в браузере
  • SSH + tmux — сессии не рвутся при отключении RDP
  • Готовые Dockerfile для A1111, ComfyUI, LocalAI в /home/user/templates

Частые вопросы

Зачем GPU VPS и чем он отличается от обычного?
GPU VPS — виртуальный сервер с проброшенной физической видеокартой NVIDIA. Нужен для задач с CUDA / cuDNN / TensorRT: обучение нейросетей (PyTorch, TensorFlow), inference LLM (Llama, Mistral, Qwen через vLLM/llama.cpp), генерация изображений (Stable Diffusion, Flux), video-рендер (Blender Cycles, DaVinci Resolve). CPU-only VPS для этих задач в 20-100 раз медленнее.
Какие видеокарты доступны?
RTX 4090 24 ГБ (для Stable Diffusion, малых LLM 7B-13B, inference) — €80/мес. RTX A6000 48 ГБ (Ada, для средних LLM 30B-70B) — €160/мес. H100 80 ГБ (для крупных LLM 70B+, training) — €600/мес (по запросу). Passthrough (dedicated GPU целиком), не share. Почасовая тарификация: RTX 4090 = €0.11/час.
Поддерживается ли CUDA и docker-контейнеры?
Да. CUDA 12.x + cuDNN 8.9 + NCCL — предустановлены. Docker с nvidia-container-toolkit — работает из коробки, запускаете PyTorch/TensorFlow контейнеры без ручной настройки. Все популярные фреймворки: PyTorch 2.x, TensorFlow 2.x, JAX, vLLM, llama.cpp, ollama, ComfyUI, A1111 Stable Diffusion.
Хватит ли для inference LLM 70B?
Llama-3.1-70B fp16 требует 140 ГБ VRAM — нужно 2× A6000 (96 ГБ) с tensor parallelism или H100 80 ГБ + INT8/AWQ квантование (тогда влезет). Llama-3.1-70B Q4_K_M через llama.cpp — 40 ГБ, влезет на A6000. Для 7B-13B моделей — RTX 4090 хватает с большим запасом (Llama-3-8B fp16 = 16 ГБ).
Есть ли почасовая тарификация?
Да. RTX 4090 = €0.11/час, A6000 = €0.22/час. Тренируете модель ночью 8 часов — платите €0.88 за RTX 4090. Не надо арендовать GPU на месяц, если задача разовая. Autoscale через API — по запросу.
Как оплатить и есть ли рублёвая цена?
Оплата в EUR картой Мир (ЦБ + 2 %), СБП (0 % комиссии), криптой USDT/BTC/ETH (0 % маржи), безналом для юрлиц (УПД, акт). RTX 4090 за €80/мес ≈ 8000 ₽. Автосписание работает со всеми способами. Для стартапов — скидка 30 % на первый месяц по промокоду.

Готовы запустить AI-нагрузку?

RTX 4090 за 12 ₽/час. CUDA 12, PyTorch, Docker — готово из коробки. От €80/мес или €0.11/час — платите ровно за использованное время.