CLOUD · GÖZLEMLENEBİLİRLİK

Monitoring as a Service

Monitoring as a Service, altyapı ve uygulamalarınızın 7/24 izlenmesi ve eşik aşımlarında gerçek insanların — Ankara'daki NOC ekibimizin — devreye girdiği alarm, ilk müdahale ve eskalasyon hizmetidir.

12 yıl saha tecrübesiTR veri merkezleri7/24 yerinde destek

Bir metrik panosu kurmak kolaydır; gece 03:00'te o panoya bakacak birini bulundurmak zordur. DataKobi NOC ekibi yılın her saati ekran başındadır: alarm üretmekle kalmaz, runbook'a göre ilk müdahaleyi yapar, gerekirse ekibinizi telefonla uyandırır. Kritik alarmda ilk müdahale taahhüdümüz 5 dakikadır.

Teknoloji yığını açık standarttır: Prometheus, Grafana, Loki ve Alertmanager. Metrikleriniz, loglarınız ve izleriniz (traces) tek çatıda birleşir; vendor lock-in yoktur ve mevcut kurulumunuzu devralabiliriz.

7/24 insanlı NOC

Alarmlar yazılıma değil, Ankara'daki vardiyalı mühendis ekibine düşer.

Uçtan uca görünürlük

Donanım sıcaklığından API yanıt süresine kadar tek pano.

Akıllı eskalasyon

Slack → SMS → telefon zinciri; çözülmeyen olay yöneticinize kadar çıkar.

Aylık sağlık raporu

Trend analizi, kapasite planı ve SLA gerçekleşme raporu.

Alarm yorgunluğu (alert fatigue) nasıl önleniyor?

İzleme projelerinin en yaygın başarısızlık nedeni teknik değil davranışsaldır: günde onlarca anlamsız alarm alan ekip, üçüncü haftada bildirimleri kapatır ve gerçek kesinti kaçar. Bizim yöntemimiz üç kuraldan oluşur. Birincisi, her alarm bir runbook'a bağlanmak zorundadır — 'ne yapılacağı belli olmayan alarm' tanımlanamaz. İkincisi, ilk 30 gün kalibrasyon dönemidir: eşikler gerçek trafiğinize göre ayarlanır, kendiliğinden düzelen durumlar bastırılır (inhibition/grouping). Üçüncüsü, semptom-bazlı alarm prensibi: 'CPU %90' değil 'API yanıt süresi SLO'yu aşıyor' alarmı kurarız. Hedef metriğimiz nettir: ayda sıfır yanlış-pozitif telefon çağrısı.

İzleme kapsamına neler girer?

Dört katmanı tek çatıda izleriz. Donanım/altyapı: sunucu kaynakları, disk sağlığı (SMART), sıcaklık, ağ cihazı portları. Platform: veritabanı replikasyon gecikmesi, kuyruk derinliği, konteyner ve pod durumları. Uygulama: HTTP uç noktası kontrolleri, sentetik işlem senaryoları (örn. 'sepete ekle-öde' akışının 30 saniyede bir koşulması), OpenTelemetry ile dağıtık izler. İş göstergeleri: SSL sertifika ve alan adı süreleri, SLA/SLO gerçekleşmeleri. Aylık raporda trend analizi ve kapasite projeksiyonu yer alır — disk doluluk krizini yaşandığında değil, üç ay önceden görürsünüz.

Teknik Özellikler

  • Yığın: Prometheus, Grafana, Loki, Alertmanager, Blackbox
  • Kapsam: Sunucu, ağ cihazı, veritabanı, uygulama, SSL/domain süresi
  • Bildirim: E-posta, SMS, telefon, Slack/Teams, webhook
  • Saklama: 13 ay metrik, 30 gün log (uzatılabilir)
  • Yanıt: Kritik alarmda 5 dakika içinde ilk müdahale

Sık Sorulan Sorular

Kendi izleme sistemimiz var; farkınız ne?
Fark yazılım değil, operasyondur: alarmın gece yarısı bir insana ulaşması, ilk müdahalenin yapılması ve eskalasyonun işlemesi. Mevcut Prometheus/Zabbix kurulumunuzu devralıp üzerine 7/24 NOC katmanı ekleyebiliriz.
Uygulama seviyesinde izleme yapıyor musunuz?
Evet. HTTP uç noktası, sentetik işlem senaryoları, veritabanı sorgu süresi ve kuyruk derinliği gibi uygulama metriklerini izler; OpenTelemetry tabanlı APM entegrasyonları kurarız.
Alarm yorgunluğunu nasıl önlüyorsunuz?
Her alarm bir runbook'a bağlanır; eşikler ilk 30 gün kalibre edilir, kendiliğinden düzelen durumlar bastırılır. Hedefimiz ayda sıfır yanlış-pozitif telefon çağrısıdır.

Mimarınızla 30 dakikalık keşif görüşmesi

İhtiyacınızı dinleyelim, doğru mimariyi ve net bir fiyat çerçevesini aynı görüşmede çizelim. İlk danışmanlık ücretsizdir.

Görüşme Planlayın