#incidents

Исчерпание IP-адресов подов GKE: разбор инцидента

Подсеть /20 в GKE достигает жёсткого потолка в 16 узлов из-за выделения /24 на каждый узел по умолчанию. Разбираем реальный инцидент с $15 000/ч потерь и нестандартное спасение через пространство Class E.

Стихийный сбор на инцидентах: актив, а не хаос

Когда незваные специалисты стягиваются на инцидент сами по себе — это не помеха, а ценный ресурс. Статья объясняет, как поддержать и направить этот инстинкт через правильный дизайн процессов.

OpenSRE: open-source AI-агент для расследования инцидентов

OpenSRE — open-source-фреймворк с reinforcement learning для AI SRE-агентов, которые автоматически расследуют производственные инциденты, определяют корневую причину и интегрируются с 60+ инструментами.

Авария голосовой связи Discord: разбор каскадного сбоя

25 марта в Discord упала голосовая и видеосвязь на 3+ часа: изменение конфигурации Kubernetes уничтожило 17% сессий, что перегрузило voice syncers через узкое место в супервизорах Erlang. Команда разобрала цепочку сбоев и внедрила архитектурные улучшения.

Почему GitHub падает от ИИ-нагрузки: разбор кризиса

GitHub переживает рекордное число сбоев из-за резкого роста нагрузки от ИИ-агентов, инцидента с потерей данных в merge queue и незавершённой миграции в Azure. Конкуренты — GitLab, Bitbucket и стартапы — справляются с аналогичным ростом без таких проблем.

AI SRE: реальные отказы, затраты и риски

Разбор задокументированных режимов отказа AI SRE-агентов: 3–15% сбоев при вызовах инструментов, €8500/мес. за мультиагентную систему против €50 за одиночный LLM, инъекции запросов с успешностью 11,2% и таксономия MAST UC Berkeley с диапазоном неудачных задач 41–87%.

Поверхностная безвиновность: почему «blameless» стал ритуалом

Многие организации внедрили blameless post-mortems как обязательную практику, но превратили её в защитный ритуал: лексика без сути. Что отличает настоящую blame-awareness от поверхностного исполнения.

© 2026 meganuke