#vllm

piqc: находим утечки GPU-бюджета в Kubernetes

piqc — открытый коллектор фактов для AI-инференса на Kubernetes, который выявляет три типа GPU-расточительства: простаивающие аллокации, несоответствие уровней оборудования и тёмную ёмкость. Один запуск `piqc scan` даёт мгновенный отчёт о стоимости без внешних платформ.

Inference-aware routing в Kubernetes: мониторинг LLM

Inference Extension для Kubernetes Gateway API маршрутизирует LLM-запросы с учётом состояния KV-кэша, LoRA-адаптеров и глубины очередей бэкендов. Статья объясняет архитектуру расширения и показывает, как отслеживать эффективность маршрутизации через Datadog.

© 2026 meganuke