#incidents

Почему злоупотребляют инцидентами и как это исправить

Когда команды объявляют ложные инциденты ради приоритизации или координации, это сигнал о сбое обычных процессов. Решение — не ужесточение контроля, а создание альтернативных путей для срочных запросов.

Героизм при инцидентах: ловушка, которую не замечают

Компании чествуют инженеров, героически спасающих системы ночью, но не замечают, что это симптом хрупкости: зависимость от «незаменимых» людей — единая точка отказа. Нужно инвестировать в системные возможности, а не в культ героизма.

ИИ-SRE для Kubernetes: команда из трёх справляется

Команда из трёх человек построила ИИ-агента SRE на базе Claude Code с паттерном делегирования субагентам: он круглосуточно разбирает алерты Kubernetes, автономно чинит безопасные инциденты и эскалирует критические в Slack — за €6,50 в месяц.

AI-агент для SRE: автодиагностика инцидентов

Автор построил ReAct-агента на GPT-4o, который сам опрашивает Splunk, AppDynamics, Kubernetes, Confluence и GitLab, чтобы за 40 секунд поставить диагноз инциденту. Статья описывает архитектуру, код инструментов, системный промпт и уроки из практики.

Исчерпание IP-адресов подов GKE: разбор инцидента

Подсеть /20 в GKE достигает жёсткого потолка в 16 узлов из-за выделения /24 на каждый узел по умолчанию. Разбираем реальный инцидент с $15 000/ч потерь и нестандартное спасение через пространство Class E.

Стихийный сбор на инцидентах: актив, а не хаос

Когда незваные специалисты стягиваются на инцидент сами по себе — это не помеха, а ценный ресурс. Статья объясняет, как поддержать и направить этот инстинкт через правильный дизайн процессов.

OpenSRE: open-source AI-агент для расследования инцидентов

OpenSRE — open-source-фреймворк с reinforcement learning для AI SRE-агентов, которые автоматически расследуют производственные инциденты, определяют корневую причину и интегрируются с 60+ инструментами.

© 2026 meganuke