AWS выпустила SageMaker HyperPod Inference Gateway для маршрутизации ИИ-запросов
AWS представила Amazon SageMaker HyperPod Inference Gateway — Kubernetes-нативный маршрутизатор для инференса LLM, учитывающий состояние GPU. По данным AWS, задержка первого токена снижается до 82%, а в тестах P95/P99 падают на 94–98% при смешанной нагрузке.
- Устанавливается одной командой aws eks create-addon, без сайдкаров и правок кода
- Снижение задержки первого токена до 82%: с 4,4 с до менее 800 мс
- В тестах P95/P99 упали на 94–98% для Llama-3.1-70B и Qwen3-32B
- Tier 2 Global Inference Router с межкластерным фейловером за 35 с — скоро
Читать дальше
ИИ