4 июня 2026 г.
19 мая 2026 Google Cloud ошибочно заблокировал аккаунт Railway, вызвав 8-часовой глобальный сбой. Каскадный отказ распространился за пределы GCP из-за централизованного сетевого управляющего уровня.
4 июня 2026 г.
25 марта в Discord упала голосовая и видеосвязь на 3+ часа: изменение конфигурации Kubernetes уничтожило 17% сессий, что перегрузило voice syncers через узкое место в супервизорах Erlang. Команда разобрала цепочку сбоев и внедрила архитектурные улучшения.
3 июня 2026 г.
GitHub переживает рекордное число сбоев из-за резкого роста нагрузки от ИИ-агентов, инцидента с потерей данных в merge queue и незавершённой миграции в Azure. Конкуренты — GitLab, Bitbucket и стартапы — справляются с аналогичным ростом без таких проблем.
3 июня 2026 г.
Разбор задокументированных режимов отказа AI SRE-агентов: 3–15% сбоев при вызовах инструментов, €8500/мес. за мультиагентную систему против €50 за одиночный LLM, инъекции запросов с успешностью 11,2% и таксономия MAST UC Berkeley с диапазоном неудачных задач 41–87%.
26 мая 2026 г.
Многие организации внедрили blameless post-mortems как обязательную практику, но превратили её в защитный ритуал: лексика без сути. Что отличает настоящую blame-awareness от поверхностного исполнения.
26 мая 2026 г.
Все теперь используют AI для пост-мортемов, но «использовать AI» означает совершенно разные вещи — от автозаполнения до полной автогенерации. Разбор четырёх уровней с честными trade-off'ами.
26 мая 2026 г.
Во время инцидентов один и тот же человек снова и снова «спасает день». Это удобно бизнесу, разрушительно для человека и катастрофично для устойчивости системы — как заметить и выйти из шаблона.
26 мая 2026 г.
Хороший пост-мортем заканчивается списком action items, но через месяц 70% из них не сделаны. Разбор причин: неправильное определение «owner», отсутствие связи с roadmap, культурная ловушка «обсудили — значит решили».