#observability

Locust Kubernetes Operator v2.0: переписан на Go

Locust Kubernetes Operator v2.0 полностью переписан на Go: потребление памяти снижено с 256 МБ до 64 МБ, время запуска — с 60 с до менее 1 с. Добавлены нативная поддержка OpenTelemetry, внедрение Secret/ConfigMap и раздельные ресурсные спецификации для master и worker.

AI-диагностика Tekton-пайплайнов: 170k строк за 5 сек

Команда Red Hat встроила «финальную задачу» в Tekton-пайплайны платформы Konflux: она дистиллирует до 170 000 строк логов в структурированный payload и за 3–5 секунд выдаёт диагноз сбоя с конкретными шагами по устранению.

OpenSRE: open-source AI-агент для расследования инцидентов

OpenSRE — open-source-фреймворк с reinforcement learning для AI SRE-агентов, которые автоматически расследуют производственные инциденты, определяют корневую причину и интегрируются с 60+ инструментами.

AI SRE: реальные отказы, затраты и риски

Разбор задокументированных режимов отказа AI SRE-агентов: 3–15% сбоев при вызовах инструментов, €8500/мес. за мультиагентную систему против €50 за одиночный LLM, инъекции запросов с успешностью 11,2% и таксономия MAST UC Berkeley с диапазоном неудачных задач 41–87%.

Неделя вайб-кодинга с Claude Code: GitOps-медиасервер на k3s с нуля

За одну неделю вечеров автор перешёл от нулевого опыта в Kubernetes к полноценному GitOps-стеку на k3s с Argo CD, Dynatrace и OTel, используя Claude Code как агентный инструмент — но сохранив за собой все ключевые архитектурные решения.

Не все index scans равны: как мы сократили latency запросов на 99%

Datadog рассказывает: даже если запрос «использует индекс», он может быть страшно медленным — например, если планировщик выбирает индекс по слабо-селективной колонке и сканирует миллионы строк. Как Datadog Database Monitoring помогает находить такие случаи.

© 2026 meganuke