Belbim CIO’su Ali Çakıroğlu
“İzlenebilirlik ve problem tespiti açısından en kırılgan alanımız genellikle uygulama katmanı oluyor. Altyapı bileşenleri, network cihazları veya işletim sistemi düzeyindeki sunucular, telemetri verilerinin daha standart ve öngörülebilir olmasından dolayı daha rahat izlenebiliyor. Ayrıca bu konuda yaygın olarak kullanılan olgunlaşmış çözümlerde sektörde daha fazla bulunabiliyor. Ancak kurum içinde geliştirdiğimiz veya dış kaynakla hayata geçirdiğimiz bize özel uygulamalarda resim biraz daha karmaşıklaşıyor.
Eğer şirket içinde; standartları net ve zorlayıcı bir yazılım geliştirme framework’ü kullanılmıyorsa izleme süreci daha da zorlaşıyor. Büyük ölçüde geliştiricinin hata loglarını ne kadar doğru yapılandırdığına ve exception durumlarını nasıl kodladığına bağlı kalıyor. Bu durum, zaman zaman reaktif bir yaklaşımla 'sorun çıktıkça log satırları ekleme' döngüsüne dönüşebiliyor.
İkinci kritik başlık ise uç noktaların yönetimi. Mobil ve web tabanlı mimarilerin sunucu taraflarında izlenebilirlikleri daha kolay yapılandırılabiliyor. Buna karşın, sahada konumlanan kiosk benzeri uç cihazlarımız—örneğin toplu ulaşım kart terminalleri ve yükleme otomatları—log yönetiminde ciddi operasyonel zorluklar barındırıyor. Ağ trafiğini optimize etmek adına sürekli çevrim içi log aktarımı yapmayan bu cihazlarda, logların yerel diskte kalması, dosya bozulmaları veya veri kayıpları uç nokta görünürlüğünü kısıtlıyor.
Bu noktada yapay zekâ ve otomasyon ürünlerinden temel beklentimiz, kök nedenleri hızla tespit edip mümkün olan senaryolarda otomatik aksiyon alınabilmesi ve çözüm üretebilmesidir. Özellikle L1, hatta L1 öncesi seviyede tekrarlayan ve standart çözümü olan operasyonlarda—örneğin basit bir sistemi veya servisi yeniden başlatma (restart) ile çözülebilecek aksaklıklarda—insan müdahalesine gerek kalmaksızın sistemin kendi kendini onarmasını (self-healing) hedefliyoruz.
Bir diğer stratejik alan ise anomali tespiti. Kimi zaman tüm servisler ayakta ve işlemler akıyor görünse de geçen haftanın aynı saatine göre işlem hacminin yarı yarıya düştüğünü görebiliyoruz. Standart izleme araçları servislerin çalıştığını raporlarken, asıl sorunu ancak sahadan gelen geri bildirimlerle fark edebiliyoruz. Yapay zekânın bu tip davranışsal ve hacimsel sapmaları proaktif biçimde yakalaması da bizim için kritik.
Son olarak, teknik kesintileri anlık olarak tespit edebilsek de bu kesintilerin iş sonuçlarına (business impact) yansımasını tam anlamıyla modellemekte zorlanıyoruz. Genelde kesintinin başlama ve bitiş sürelerine odaklanıyoruz; oysa kısmi bir sunucu veya ağ problemi yaşandığında hangi iş fonksiyonlarının etkilendiğini bilsek dahi, bu durumun kaç müşteri etkileşimine veya ne kadarlık finansal hacim kaybına yol açtığını anlık olarak ölçümlemek kolay olmuyor. İzlenebilirlik vizyonumuzun bir sonraki adımını da bu iş etkisinin ölçümlemesi oluşturuyor.”