#incidents

Авария голосовой связи Discord: разбор каскадного сбоя

25 марта в Discord упала голосовая и видеосвязь на 3+ часа: изменение конфигурации Kubernetes уничтожило 17% сессий, что перегрузило voice syncers через узкое место в супервизорах Erlang. Команда разобрала цепочку сбоев и внедрила архитектурные улучшения.

Почему GitHub падает от ИИ-нагрузки: разбор кризиса

GitHub переживает рекордное число сбоев из-за резкого роста нагрузки от ИИ-агентов, инцидента с потерей данных в merge queue и незавершённой миграции в Azure. Конкуренты — GitLab, Bitbucket и стартапы — справляются с аналогичным ростом без таких проблем.

AI SRE: реальные отказы, затраты и риски

Разбор задокументированных режимов отказа AI SRE-агентов: 3–15% сбоев при вызовах инструментов, €8500/мес. за мультиагентную систему против €50 за одиночный LLM, инъекции запросов с успешностью 11,2% и таксономия MAST UC Berkeley с диапазоном неудачных задач 41–87%.

Поверхностная безвиновность: почему «blameless» стал ритуалом

Многие организации внедрили blameless post-mortems как обязательную практику, но превратили её в защитный ритуал: лексика без сути. Что отличает настоящую blame-awareness от поверхностного исполнения.

Что на самом деле означает использование AI для пост-мортемов

Все теперь используют AI для пост-мортемов, но «использовать AI» означает совершенно разные вещи — от автозаполнения до полной автогенерации. Разбор четырёх уровней с честными trade-off'ами.

Почему action items после пост-мортема умирают

Хороший пост-мортем заканчивается списком action items, но через месяц 70% из них не сделаны. Разбор причин: неправильное определение «owner», отсутствие связи с roadmap, культурная ловушка «обсудили — значит решили».

© 2026 meganuke