Monitoring as a Service
Monitoring as a Service, altyapı ve uygulamalarınızın 7/24 izlenmesi ve eşik aşımlarında gerçek insanların — Ankara'daki NOC ekibimizin — devreye girdiği alarm, ilk müdahale ve eskalasyon hizmetidir.
Bir metrik panosu kurmak kolaydır; gece 03:00'te o panoya bakacak birini bulundurmak zordur. DataKobi NOC ekibi yılın her saati ekran başındadır: alarm üretmekle kalmaz, runbook'a göre ilk müdahaleyi yapar, gerekirse ekibinizi telefonla uyandırır. Kritik alarmda ilk müdahale taahhüdümüz 5 dakikadır.
Teknoloji yığını açık standarttır: Prometheus, Grafana, Loki ve Alertmanager. Metrikleriniz, loglarınız ve izleriniz (traces) tek çatıda birleşir; vendor lock-in yoktur ve mevcut kurulumunuzu devralabiliriz.
7/24 insanlı NOC
Alarmlar yazılıma değil, Ankara'daki vardiyalı mühendis ekibine düşer.
Uçtan uca görünürlük
Donanım sıcaklığından API yanıt süresine kadar tek pano.
Akıllı eskalasyon
Slack → SMS → telefon zinciri; çözülmeyen olay yöneticinize kadar çıkar.
Aylık sağlık raporu
Trend analizi, kapasite planı ve SLA gerçekleşme raporu.
Alarm yorgunluğu (alert fatigue) nasıl önleniyor?
İzleme projelerinin en yaygın başarısızlık nedeni teknik değil davranışsaldır: günde onlarca anlamsız alarm alan ekip, üçüncü haftada bildirimleri kapatır ve gerçek kesinti kaçar. Bizim yöntemimiz üç kuraldan oluşur. Birincisi, her alarm bir runbook'a bağlanmak zorundadır — 'ne yapılacağı belli olmayan alarm' tanımlanamaz. İkincisi, ilk 30 gün kalibrasyon dönemidir: eşikler gerçek trafiğinize göre ayarlanır, kendiliğinden düzelen durumlar bastırılır (inhibition/grouping). Üçüncüsü, semptom-bazlı alarm prensibi: 'CPU %90' değil 'API yanıt süresi SLO'yu aşıyor' alarmı kurarız. Hedef metriğimiz nettir: ayda sıfır yanlış-pozitif telefon çağrısı.
İzleme kapsamına neler girer?
Dört katmanı tek çatıda izleriz. Donanım/altyapı: sunucu kaynakları, disk sağlığı (SMART), sıcaklık, ağ cihazı portları. Platform: veritabanı replikasyon gecikmesi, kuyruk derinliği, konteyner ve pod durumları. Uygulama: HTTP uç noktası kontrolleri, sentetik işlem senaryoları (örn. 'sepete ekle-öde' akışının 30 saniyede bir koşulması), OpenTelemetry ile dağıtık izler. İş göstergeleri: SSL sertifika ve alan adı süreleri, SLA/SLO gerçekleşmeleri. Aylık raporda trend analizi ve kapasite projeksiyonu yer alır — disk doluluk krizini yaşandığında değil, üç ay önceden görürsünüz.
Teknik Özellikler
- Yığın: Prometheus, Grafana, Loki, Alertmanager, Blackbox
- Kapsam: Sunucu, ağ cihazı, veritabanı, uygulama, SSL/domain süresi
- Bildirim: E-posta, SMS, telefon, Slack/Teams, webhook
- Saklama: 13 ay metrik, 30 gün log (uzatılabilir)
- Yanıt: Kritik alarmda 5 dakika içinde ilk müdahale
Sık Sorulan Sorular
Kendi izleme sistemimiz var; farkınız ne?
Uygulama seviyesinde izleme yapıyor musunuz?
Alarm yorgunluğunu nasıl önlüyorsunuz?
Mimarınızla 30 dakikalık keşif görüşmesi
İhtiyacınızı dinleyelim, doğru mimariyi ve net bir fiyat çerçevesini aynı görüşmede çizelim. İlk danışmanlık ücretsizdir.