Disk arızası ani görünür ama değildir. Kayıttan geriye bakıldığında neredeyse her zaman haftalar önce başlamış bir iz vardır: önce yeniden denenen okumalar, sonra ara ara donmalar, en sonda kayıp.
Fark, o izi okuyup okumadığınızdadır.
1. Olay günlüğü ilk söyleyendir
| Olay | Anlamı |
|---|---|
153 | G/Ç isteği yeniden denendi — en erken işaret |
129 | Denetleyici sıfırlandı |
7 / 55 | Kötü blok / NTFS bozulması |
51 | Sayfalama işleminde disk hatası |
157 | Disk beklenmedik biçimde kayboldu |
153 ve 129, arıza değil uyarıdır — ve tam da bu yüzden göz ardı edilirler. Sayıları artıyorsa diskin ya da yolun ömrü doluyordur.
2. Güvenilirlik sayaçları
Windows, SMART verisinin bir kısmını doğrudan verir:
Get-PhysicalDisk | Get-StorageReliabilityCounter |
Select-Object DeviceId, ReadErrorsTotal, ReadErrorsUncorrected, Temperature, PowerOnHours
- ReadErrorsUncorrected > 0 → düzeltilemeyen hata. Bu disk üretimden çıkmalı;
chkdskile uğraşmak zaman kaybıdır. - Sıcaklık 55 °C üstü → havalandırma sorunu; ömrü kısaltır.
- PowerOnHours → beş yılı geçen diskleri değişim planına alın.
Donanım RAID denetleyicisi arkasındaki diskler bu komutta görünmez; o durumda üreticinin aracıyla bakmak gerekir.
3. RAID uyarı verdiyse
Sistem çalışmaya devam ediyor olması sizi rahatlatmasın: korumasız durumdasınız. Tek eşlikli bir dizide ikinci disk gitmeden önce yeniden yapılandırmanın bitmesi gerekir ve bu, büyük disklerde günler sürebilir.
Yeniden yapılandırma süresini önceden bilmek için RAID hesaplayıcıyı kullanın: 8 TB’lık bir diskte bu süre iyimser hesapla bile bir günden uzundur.
Sıra önemli
Disk değiştirmeden önce yapılacak ilk iş yedeği doğrulamaktır. Yeniden yapılandırma sırasında diğer diskler en yoğun çalıştıkları ana girer; ikinci arıza en çok o sırada olur.
- Yedeği doğrula (yalnızca “iş başarılı” değil, geri dönüş testi)
- Diski üretimden çıkar
- Yeniden yapılandırmayı başlat ve bitene kadar başka değişiklik yapma
- Aynı partiden alınan diğer diskleri izlemeye al
Doğrulama
Değişimden sonra betiği yeniden çalıştırın: sağlık Healthy, sanal disk Healthy, olay sayacı sıfır olmalı. Olaylar devam ediyorsa sorun diskte değil yoldadır — kablo, arka panel (backplane) ya da denetleyici.
Bir daha sürpriz olmaması için
Bu betiği haftalık zamanlanmış görev olarak çalıştırıp çıktısını dosyaya yazdırın. Hata sayaçları mutlak değeriyle değil eğilimiyle anlamlıdır: geçen hafta 12, bu hafta 340 ise cevap bellidir.