Развёртывание LLM на OpenShift без операторов: llama.cpp
22 июля 2026 г.
Статья показывает, как развернуть квантованную LLM на OpenShift с помощью llama.cpp и стандартных ресурсов Kubernetes — без операторов OpenShift AI и GPU.
22 июля 2026 г.
Статья показывает, как развернуть квантованную LLM на OpenShift с помощью llama.cpp и стандартных ресурсов Kubernetes — без операторов OpenShift AI и GPU.
5 июля 2026 г.
Описана production-архитектура для обслуживания нескольких LLM на Kubernetes с двухуровневой маршрутизацией: LiteLLM как единый API-шлюз, Istio Gateway API с Inference Extension и llm-d для KV-кеш-осведомлённого планирования инференса.
4 июля 2026 г.
Классические паттерны Kubernetes (Deployment, StatefulSet, DaemonSet) применимы к LLM-нагрузкам, но масштаб и параметры кардинально меняются: секунды превращаются в минуты, мегабайты — в гигабайты. Появляются и новые паттерны: Model Data Staging, Token-Aware Routing, RAG Composition.
22 июня 2026 г.
Inference Extension для Kubernetes Gateway API маршрутизирует LLM-запросы с учётом состояния KV-кэша, LoRA-адаптеров и глубины очередей бэкендов. Статья объясняет архитектуру расширения и показывает, как отслеживать эффективность маршрутизации через Datadog.