GPU VPS от €80/мес
Аренда сервера с NVIDIA GPU для AI, LLM inference, Stable Diffusion, video-рендера. Passthrough целиком (не share), CUDA 12 + cuDNN + Docker nvidia-toolkit из коробки. Почасовая тарификация от €0.11/час.
Разовая задача на 8 часов? Заплатите €0.88 за RTX 4090 и удалите. Не подписка, а gpu-as-a-utility.
Что можно делать на GPU VPS
Обучение нейросетей
PyTorch 2.x, TensorFlow 2.x, JAX. Fine-tuning open-source LLM (Llama-3-8B на RTX 4090 через LoRA — обучение за 3-5 часов). ResNet, YOLO, Whisper, SAM — весь классический CV/NLP stack.
Inference LLM
vLLM, llama.cpp, ollama, TensorRT-LLM. Llama-3-8B на RTX 4090: 80-120 tokens/s. Llama-3-70B Q4 на A6000: 20-30 t/s. Свой ChatGPT-clone для внутренних задач без OpenAI-API.
Stable Diffusion / Flux
A1111 WebUI, ComfyUI, InvokeAI. SDXL на RTX 4090 — 20-30 картинок/мин. Flux Dev на A6000 — 40 сек/картинка. Для коммерческого генератора картинок — оптимально.
Video-рендер
Blender Cycles с OptiX (RTX-акселерация), DaVinci Resolve GPU-transcode, FFmpeg с NVENC. 4K H.264 → HEVC на RTX 4090: 200-300 fps.
AMD EPYC + GPU
Не «слабый CPU + топовый GPU» — сбалансированная сборка: EPYC 9004 8+ ядер, 64+ ГБ RAM. Data-loading не станет узким местом для тренировки.
NVMe SSD
1 ТБ NVMe на entry-tier. Датасет ImageNet (150 ГБ), COCO (25 ГБ), FineWeb (500 ГБ подсет) — влезают целиком. 100k+ IOPS = быстрый epoch.
Passthrough, не share
Ваш GPU целиком — не MIG-slice и не vGPU. Полная память, полная утилизация. Никаких соседей, дерущихся за CUDA-cores.
Готовые Docker образы
Nvidia PyTorch (nvcr.io/nvidia/pytorch), Text-Generation-WebUI, Ollama, A1111, ComfyUI, LocalAI — образы стянуты и запускаются одной командой. Не собирать окружение часами.
Тарифы GPU VPS
Цены в EUR. При оплате картой Мир — по курсу ЦБ + 2 %. GPU passthrough (не share).
| Тариф | GPU | CPU / RAM | Диск | Цена / мес | Цена / час |
|---|---|---|---|---|---|
| GPU-4090 | RTX 4090 24 GB | 8 vCPU / 64 ГБ | 1 ТБ NVMe | €80 | €0.11 |
| GPU-A6000 | A6000 Ada 48 GB | 12 vCPU / 128 ГБ | 2 ТБ NVMe | €160 | €0.22 |
| GPU-2×4090 | 2× RTX 4090 48 GB | 16 vCPU / 128 ГБ | 2 ТБ NVMe | €150 | €0.21 |
| GPU-H100 | H100 80 GB (запрос) | 16 vCPU / 256 ГБ | 4 ТБ NVMe | €600 | €0.83 |
Что укладывается на какой GPU
Правило: fp16 модель занимает `размер_параметров × 2` ГБ VRAM. Плюс KV-cache (для inference) или градиенты + оптимизатор (для training).
- • Stable Diffusion 1.5 / SDXL / Flux Dev — RTX 4090 24 ГБ хватит
- • Llama-3-8B fp16 (16 ГБ) inference — RTX 4090 24 ГБ
- • Llama-3-8B fp16 fine-tune LoRA — RTX 4090 (LoRA сжимает адаптеры)
- • Llama-3-8B full-parameter fine-tune — 2× RTX 4090 с DeepSpeed ZeRO
- • Llama-3-70B Q4_K_M (40 ГБ) inference — A6000 48 ГБ
- • Llama-3-70B fp16 (140 ГБ) inference — 2× A6000 или H100 80 ГБ + INT8
- • Whisper Large-v3 (3 ГБ) — RTX 4090 real-time × 30
Что предустановлено и как запустить
Не «голая Ubuntu, ставьте драйверы сами». Шаблон «GPU AI Ready» разворачивает VPS с полным CUDA-стеком за 60 секунд.
- • Ubuntu 24.04 LTS + NVIDIA Driver 550 + CUDA 12.4 + cuDNN 8.9
- • Docker + nvidia-container-toolkit — запуск GPU-контейнеров out-of-box
- • PyTorch 2.4 + Torchvision + Transformers 4.44 (последняя стабильная)
- • vLLM 0.5+ для LLM inference (высокопроизводительный движок)
- • Jupyter Lab на порту 8888 (запаролен) — код прямо в браузере
- • SSH + tmux — сессии не рвутся при отключении RDP
- • Готовые Dockerfile для A1111, ComfyUI, LocalAI в /home/user/templates
Частые вопросы
- Зачем GPU VPS и чем он отличается от обычного?
- GPU VPS — виртуальный сервер с проброшенной физической видеокартой NVIDIA. Нужен для задач с CUDA / cuDNN / TensorRT: обучение нейросетей (PyTorch, TensorFlow), inference LLM (Llama, Mistral, Qwen через vLLM/llama.cpp), генерация изображений (Stable Diffusion, Flux), video-рендер (Blender Cycles, DaVinci Resolve). CPU-only VPS для этих задач в 20-100 раз медленнее.
- Какие видеокарты доступны?
- RTX 4090 24 ГБ (для Stable Diffusion, малых LLM 7B-13B, inference) — €80/мес. RTX A6000 48 ГБ (Ada, для средних LLM 30B-70B) — €160/мес. H100 80 ГБ (для крупных LLM 70B+, training) — €600/мес (по запросу). Passthrough (dedicated GPU целиком), не share. Почасовая тарификация: RTX 4090 = €0.11/час.
- Поддерживается ли CUDA и docker-контейнеры?
- Да. CUDA 12.x + cuDNN 8.9 + NCCL — предустановлены. Docker с nvidia-container-toolkit — работает из коробки, запускаете PyTorch/TensorFlow контейнеры без ручной настройки. Все популярные фреймворки: PyTorch 2.x, TensorFlow 2.x, JAX, vLLM, llama.cpp, ollama, ComfyUI, A1111 Stable Diffusion.
- Хватит ли для inference LLM 70B?
- Llama-3.1-70B fp16 требует 140 ГБ VRAM — нужно 2× A6000 (96 ГБ) с tensor parallelism или H100 80 ГБ + INT8/AWQ квантование (тогда влезет). Llama-3.1-70B Q4_K_M через llama.cpp — 40 ГБ, влезет на A6000. Для 7B-13B моделей — RTX 4090 хватает с большим запасом (Llama-3-8B fp16 = 16 ГБ).
- Есть ли почасовая тарификация?
- Да. RTX 4090 = €0.11/час, A6000 = €0.22/час. Тренируете модель ночью 8 часов — платите €0.88 за RTX 4090. Не надо арендовать GPU на месяц, если задача разовая. Autoscale через API — по запросу.
- Как оплатить и есть ли рублёвая цена?
- Оплата в EUR картой Мир (ЦБ + 2 %), СБП (0 % комиссии), криптой USDT/BTC/ETH (0 % маржи), безналом для юрлиц (УПД, акт). RTX 4090 за €80/мес ≈ 8000 ₽. Автосписание работает со всеми способами. Для стартапов — скидка 30 % на первый месяц по промокоду.
Готовы запустить AI-нагрузку?
RTX 4090 за 12 ₽/час. CUDA 12, PyTorch, Docker — готово из коробки. От €80/мес или €0.11/час — платите ровно за использованное время.