AI и LLM · MIT

Ollama на VPS

Ollama на VPS: локальный LLM-runner, Llama/Mistral/Qwen, REST API, CPU/GPU.

Официальный сайт: https://ollama.com

vCPU от
4
рекомендуется
RAM от
8 GB
минимум
Диск от
40 GB
SSD/NVMe
План
VPS-L (CPU) / VPS-GPU
оптимальный

Что такое Ollama

Ollama — самый простой способ запустить LLM локально. Одна команда — модель скачивается и запускается, REST API совместимый с OpenAI. Поддерживает Llama 3, Mistral, Qwen, Phi, Gemma, десятки других.

На VPS-M с 4 GB — Llama 3 8B (Q4 quantized). На VPS-XL с 16 GB — Llama 3 70B. С GPU (VPS-GPU) — скорость 10-100x. REST API на 11434, drop-in замена OpenAI API.

Требования и совместимость

CPU
4 vCPU
рекомендуется
RAM
8 GB
минимум
Disk
40 GB
SSD/NVMe
License
MIT
официально
Поддерживаемые ОС: Ubuntu 22.04

Установка Ollama

Быстрый снапшот команд для установки на чистом VPS. У нас доступен готовый snapshot для клика в панели — эти команды выполняются автоматически.

curl -fsSL https://ollama.com/install.sh | sh
ollama pull llama3
ollama serve  # REST API on :11434

Возможности Ollama

Ключевые фичи и характеристики, которые получаете из нашего snapshot Ollama на VPS.

  • Одна команда для запуска модели
  • REST API OpenAI-compatible
  • 100+ моделей из library
  • GPU (CUDA/ROCm) + CPU
  • Модели в GGUF-формате

Для каких задач подходит

  • Локальный ChatGPT для команды
  • AI-features в приложении без OpenAI API
  • Тесты промптов без per-token оплаты

Частые вопросы

Реально ли на CPU?
Да, но медленно: Llama 3 8B — 5-15 tok/s. С GPU — 40-100 tok/s. Для serious LLM — VPS-GPU или Dedicated GPU.
OpenAI SDK работает?
Да, drop-in: измените OPENAI_BASE_URL на http://vps:11434/v1. Модель 'llama3' вместо 'gpt-4'.
Приватные модели?
Скачивайте GGUF файл (Hugging Face), Modelfile — `FROM ./model.gguf`, `ollama create mymodel -f Modelfile`.

Развернуть Ollama за 60 секунд

Готовый снапшот с автобэкапом, TLS и systemd. От €3/мес.