Ollama на VPS
Ollama на VPS: локальный LLM-runner, Llama/Mistral/Qwen, REST API, CPU/GPU.
Официальный сайт: https://ollama.com
Что такое Ollama
Ollama — самый простой способ запустить LLM локально. Одна команда — модель скачивается и запускается, REST API совместимый с OpenAI. Поддерживает Llama 3, Mistral, Qwen, Phi, Gemma, десятки других.
На VPS-M с 4 GB — Llama 3 8B (Q4 quantized). На VPS-XL с 16 GB — Llama 3 70B. С GPU (VPS-GPU) — скорость 10-100x. REST API на 11434, drop-in замена OpenAI API.
Требования и совместимость
Установка Ollama
Быстрый снапшот команд для установки на чистом VPS. У нас доступен готовый snapshot для клика в панели — эти команды выполняются автоматически.
curl -fsSL https://ollama.com/install.sh | sh
ollama pull llama3
ollama serve # REST API on :11434Возможности Ollama
Ключевые фичи и характеристики, которые получаете из нашего snapshot Ollama на VPS.
- • Одна команда для запуска модели
- • REST API OpenAI-compatible
- • 100+ моделей из library
- • GPU (CUDA/ROCm) + CPU
- • Модели в GGUF-формате
Для каких задач подходит
- Локальный ChatGPT для команды
- AI-features в приложении без OpenAI API
- Тесты промптов без per-token оплаты
Частые вопросы
- Реально ли на CPU?
- Да, но медленно: Llama 3 8B — 5-15 tok/s. С GPU — 40-100 tok/s. Для serious LLM — VPS-GPU или Dedicated GPU.
- OpenAI SDK работает?
- Да, drop-in: измените OPENAI_BASE_URL на http://vps:11434/v1. Модель 'llama3' вместо 'gpt-4'.
- Приватные модели?
- Скачивайте GGUF файл (Hugging Face), Modelfile — `FROM ./model.gguf`, `ollama create mymodel -f Modelfile`.
Смотрите также
Open WebUI на VPS: ChatGPT-like UI для Ollama, RAG, multi-user, plugins.
LM Studio на VPS: desktop LLM app с server-mode, простой запуск моделей.
text-generation-webui на VPS: UI для LLM-inference, character chat, exllama, GGUF.
Смотреть
Категория целиком.
Подобрать план.
Развернуть Ollama за 60 секунд
Готовый снапшот с автобэкапом, TLS и systemd. От €3/мес.