4 октября 2026 г.
Когда команды объявляют ложные инциденты ради приоритизации или координации, это сигнал о сбое обычных процессов. Решение — не ужесточение контроля, а создание альтернативных путей для срочных запросов.
28 сентября 2026 г.
Переход на новое место SRE — это не обучение с нуля, а «переучивание на тип»: принципы надёжности переносятся, но расположение «приборов» и числа SLO/SLO нужно изучать заново.
27 сентября 2026 г.
Компании чествуют инженеров, героически спасающих системы ночью, но не замечают, что это симптом хрупкости: зависимость от «незаменимых» людей — единая точка отказа. Нужно инвестировать в системные возможности, а не в культ героизма.
1 сентября 2026 г.
Команда из трёх человек построила ИИ-агента SRE на базе Claude Code с паттерном делегирования субагентам: он круглосуточно разбирает алерты Kubernetes, автономно чинит безопасные инциденты и эскалирует критические в Slack — за €6,50 в месяц.
29 августа 2026 г.
Автор построил ReAct-агента на GPT-4o, который сам опрашивает Splunk, AppDynamics, Kubernetes, Confluence и GitLab, чтобы за 40 секунд поставить диагноз инциденту. Статья описывает архитектуру, код инструментов, системный промпт и уроки из практики.
18 августа 2026 г.
Два production-инцидента из-за незамеченного исчерпания квот GCP привели к созданию системы автоматического мониторинга: Terraform + Python-скрипт покрывают обе системы квот для 300 проектов.
12 августа 2026 г.
Подсеть /20 в GKE достигает жёсткого потолка в 16 узлов из-за выделения /24 на каждый узел по умолчанию. Разбираем реальный инцидент с $15 000/ч потерь и нестандартное спасение через пространство Class E.
23 июня 2026 г.
Когда незваные специалисты стягиваются на инцидент сами по себе — это не помеха, а ценный ресурс. Статья объясняет, как поддержать и направить этот инстинкт через правильный дизайн процессов.
16 июня 2026 г.
OpenSRE — open-source-фреймворк с reinforcement learning для AI SRE-агентов, которые автоматически расследуют производственные инциденты, определяют корневую причину и интегрируются с 60+ инструментами.
9 июня 2026 г.
ИИ способен быстро создать красивый постмортем, но именно процесс написания даёт инженерам настоящее понимание инцидента — автоматизируя текст, вы автоматизируете исчезновение обучения.