eduardweb.
DevOps & VPSIntermediar#devops#vps#netdata#monitoring#grafana

Monitoring moca pe VPS mic: Cum leg Netdata, Grafana Cloud și UptimeRobot

De Radu Grigore, 5 aug. 2026 · 9 vizualizări · 3 like-uri

Postat 5 aug. 2026
yaml
# /etc/prometheus/prometheus-agent.yml
# Agent Prometheus ultra-light-weight pentru remote write în Grafana Cloud

global:
  scrape_interval: 30s
  external_labels:
    host: 'vps-hetzner-prod-01'

scrape_configs:
  - job_name: 'node_exporter'
    static_configs:
      - targets: ['localhost:9100']

remote_write:
  - url: 'https://prometheus-prod-01-eu-west-0.grafana.net/api/v1/push'
    basic_auth:
      username: '1234567'
      password: 'glc_eyJvcmdJZCI6...' # Token generat din Grafana Cloud

Am 4 VPS-uri la Hetzner și DigitalOcean pe care țin proiecte mici și aplicații pentru clienți. Când ai un nod cu 1GB RAM, nu poți să trântești o instanță de Prometheus cu Grafana locală, că-ți mănâncă 600MB RAM doar monitorizarea. După ceva teste, am ajuns la o combinație 100% gratuită care consumă sub 35MB RAM și mă anunță pe Telegram în secunda în care crapă ceva.

Netdata: Inspecția pe secunde, direct pe server

Netdata e impecabil când vrei să vezi acum de ce a sărit CPU-ul în 100% sau ce proces face I/O nebun pe disc. Îl instalez rapid cu scriptul lor oficial și îl leg la contul gratuit de Netdata Cloud.

Pro-tip: dacă ai memorie puțină, limitează-i baza de date locală din /etc/netdata/netdata.conf. Setat pe modul allocator = dbengine cu o limită strictă de 32MB RAM, abia dacă simți că rulează în fundal.

Trade-off: Interfața Netdata Cloud e utilă pentru debugging live, dar e extrem de aglomerată. Nu e ce trebuie dacă vrei un dashboard minimalist curat pe care să-l pui pe un monitor secundar.

Grafana Cloud: Istoric pe 14 zile și loguri centralizate

Grafana Cloud oferă un free tier foarte generos: 10.000 de serii metrice Prometheus, 50GB de loguri în Loki și alerte configurabile prin Webhooks.

În loc să pun Prometheus local, instalez doar un lightweight Prometheus în mod Agent sau un node_exporter minuscul. El strânge metricele de sistem (CPU, RAM, disk usage, traffic) și le trimite prin remote_write direct în Grafana Cloud. Întregul proces consumă sub 20MB RAM pe nod.

Cu abordarea asta am rezolvat două mari probleme:

  1. Am un singur dashboard centralizator unde văd starea tuturor serverelor mele la un loc.
  2. Am istoric de metrice pe 14 zile fără să ating SSD-ul local cu scrieri microscopice și repetate care uzau discul.

Inclusiv logurile din journald le trimit scurt cu Promtail către Grafana Loki. Când am o eroare 500 în Nginx, caut direct în Grafana Cloud după status=500 și văd logul exact.

UptimeRobot: Plasă de siguranță când pică tot nodul

Aici mulți își iau țeapă: dacă îți pică conexiunea de rețea pe VPS sau ai un Kernel Panic, nici Netdata și nici agentul de Prometheus nu mai pot trimite metrice. Grafana Cloud va declanșa o alertă de tip "no data", dar asta poate dura câteva minute bune.

UptimeRobot e complet extern. Pe tier-ul gratuit verifică endpoint-ul la fiecare 5 minute prin HTTP sau ICMP Ping. Dacă Nginx e jos sau nodul nu răspunde, primesc instanță de notification pe telefon.

Cum le legi cap-la-cap fără bătăi de cap

Workflow-ul meu zilnic arată așa:

  • UptimeRobot mă anunță primul dacă un site nu mai răspunde din exterior.
  • Grafana Cloud îmi trimite alertă preventivă pe Telegram când memoria RAM trece de 85% sau discul ajunge la 90% capacitate.
  • Netdata e unealta pe care o deschid doar când primesc o alertă și am nevoie să văd live ce PID sau container Docker papă resursele.

La un proiect cu 8k useri lunari găzduit pe o coajă de VPS de $5, setup-ul ăsta mi-a salvat lejer $30/lună pe care i-aș fi dat pe Datadog sau New Relic, iar resursele consumate pe server sunt insemnificative.

Voi ce folosiți pentru nodurile mici? Ați rămas pe soluții self-hosted clasice sau ați trecut pe free-tier-uri în cloud?

Răspunsuri 0

Se încarcă răspunsurile…

Loghează-te pentru a răspunde

Doar membrii comunității pot lăsa comentarii.