Prometheus — система мониторинга и alerting, разработана SoundCloud с 2012 года, теперь под CNCF (второй graduated проект после Kubernetes). Устройство: pull-based сборщик метрик (сам ходит на HTTP-эндпоинты `/metrics` в формате Prometheus text exposition) + встроенная TSDB + язык запросов PromQL + Alertmanager.
Ключевые концепции: metric (счётчик, гистограмма, gauge), labels (dimensions: instance, job, method), scrape config (что и как часто опрашивать). Всё, что отдаёт `/metrics` — попадает в Prometheus. Экосистема exporters: node_exporter (Linux-метрики), blackbox_exporter (HTTP-пробы), postgres_exporter, redis_exporter, cAdvisor (контейнеры).
Прометей отвечает на "что происходит СЕЙЧАС", не на "почему упало вчера" (retention обычно 15-30 дней). Долгосрочное хранение — remote_write в Thanos, Cortex, VictoriaMetrics (популярный форк, быстрее и дешевле по RAM).
Практика: минимальная установка на VPS — Prometheus + node_exporter + Grafana. За 30 минут получаете дашборды CPU/RAM/диска/сети. С Alertmanager — email/Telegram-нотификации на переполнение диска или падение сервиса. Готовые dashboards — grafana.com/dashboards (ID 1860 — Node Exporter Full).