|
Рубрика:
Администрирование /
Управление инцидентами
|
Facebook
Мой мир
Вконтакте
Одноклассники
Google+
|
ВИЗИТКА
Дмитрий Дякив, руководитель практики ИТ-мониторинга и технологической экспертизы НТЦ «Веллинк»
7 причин аварий в ИТ-системах и как их избежать
Почему «зеленые» дашборды не гарантируют работу сервиса, как автоскейлинг может убить базу данных и почему алерты, которые будят по ночам, опаснее их отсутствия. Разбираем 7 классических сценариев ИТ-аварий и даем рекомендации по их предотвращению.
Авария не возникает внезапно
Сбой редко начинается в тот момент, когда его заметили. Обычно авария долго «созревает» в слепых зонах инфраструктуры, неэффективных процессах и неотработанных сценариях реагирования.
ИТ-системы редко ломаются без предупреждения. Чаще всего проблемы копятся месяцами или даже годами: растет задержка, заканчивается запас ресурсов, увеличивается очередь сообщений, появляются ошибки в журналах, ухудшается качество сетевого соединения.
Однако команда может не замечать эти признаки или привыкнуть к фоновому шуму. Тогда авария проявляется в самый неподходящий момент: во время пиковых нагрузок, отчетности, критичной операции или крупной распродажи.
<...>
Ключевые слова: мониторинг, observability, отказоустойчивость, инциденты, ИТ-инфраструктура, надежность
Полную версию статьи читайте в журнале Подпишитесь на журнал
Facebook
Мой мир
Вконтакте
Одноклассники
Google+
|