#inference

NVIDIA PAIR: локальный маршрутизатор AI-инференса

NVIDIA Personal AI Router (PAIR) — локальный маршрутизатор инференса для группы машин в одной сети, совместимый с Ollama и OpenAI API. Он распределяет запросы по узлам с учётом доступности модели и нагрузки, сохраняя данные внутри локальной сети.

Паттерны Kubernetes для LLM-нагрузок: что меняется

Классические паттерны Kubernetes (Deployment, StatefulSet, DaemonSet) применимы к LLM-нагрузкам, но масштаб и параметры кардинально меняются: секунды превращаются в минуты, мегабайты — в гигабайты. Появляются и новые паттерны: Model Data Staging, Token-Aware Routing, RAG Composition.

Inference-aware routing в Kubernetes: мониторинг LLM

Inference Extension для Kubernetes Gateway API маршрутизирует LLM-запросы с учётом состояния KV-кэша, LoRA-адаптеров и глубины очередей бэкендов. Статья объясняет архитектуру расширения и показывает, как отслеживать эффективность маршрутизации через Datadog.

© 2026 meganuke