
Microsoft представила еталонну архітектуру для маршрутизації трафіку агентів на Azure Kubernetes Service (AKS). Ця архітектура вирішує проблему, розбиваючи її на три ключові рішення: яка модель відповідає на запит, як керується запит і яка GPU-репліка його обробляє.
Проблема агентних робочих навантажень
Архітектура розроблена спеціально для агентних робочих навантажень, а не для чатів. Одне завдання агента може генерувати сотні викликів до великих мовних моделей (LLM) у циклі «планування-дія-спостереження». Більшість цих викликів (наприклад, заповнення аргументів інструменту, відповідь «так/ні», узагальнення) не потребують використання найсучасніших моделей. Відправлення кожного виклику до топової моделі збільшує витрати та затримки, особливо при довгих циклах. Простий балансувальник навантаження типу round-robin може погіршити ситуацію, ставлячи в чергу невелике завершення за великим попереднім заповненням на зайнятому GPU-поді, тоді як інший вільний под залишається невикористаним.
Трирівнева архітектура
Запропонована архітектура поєднує три основні компоненти, які підключаються до однієї OpenAI-сумісної кінцевої точки:
- RouteLLM: Для семантичної маршрутизації, що визначає, яка модель відповідає на запит.
- agentgateway: Як AI-проксі, що керує викликами.
- Kubernetes Gateway API Inference Extension (Endpoint Picker): Для балансування навантаження та вибору GPU-репліки.
Деталі компонентів
RouteLLM перевіряє запит і прогнозує, чи може дешевша модель відповідати якості відповіді сильнішої моделі. Він використовує маршрутизатор на основі матричної факторизації, навчений на даних людських переваг. У тестуванні RouteLLM досяг близько 95% якості GPT-4 за MT-Bench, відправляючи лише близько 26% викликів до GPT-4. Це дозволило заощадити до 85% витрат порівняно з маршрутизацією всіх викликів до сильної моделі. Microsoft зазначає, що ця цифра не є універсальною і залежить від конкретної пари моделей, використаної для навчання RouteLLM. Користувачам необхідно калібрувати поріг на основі фактичного трафіку.
agentgateway — це проксі з відкритим вихідним кодом, який працює з OpenAI. Він керує політиками, такими як автентифікація, обмеження швидкості для кожного агента, відстеження витрат та захисні механізми, не перевіряючи при цьому зміст запитів. Для самостійно розміщених рішень agentgateway викликає Endpoint Picker безпосередньо через ext-proc, дозволяючи обійти окремий шлюз Gateway API. Сильний шлях маршрутизується до Azure OpenAI через AI-бек-енд в agentgateway, тоді як слабкий шлях направляється до подів, що обслуговуються KAITO, через сервісний бек-енд.
Kubernetes Gateway API Inference Extension (Endpoint Picker) перевіряє поточний стан GPU, аналізуючи заповненість KV-кешу vLLM та глибину черги. Це допомагає йому вирішити, яка репліка обраної моделі обробить запит. KAITO надає пули GPU-вузлів за потребою та запускає vLLM, надаючи метрики, такі як vllm:num_requests_waiting та vllm:kv_cache_usage_perc, які використовує Endpoint Picker.
Інфраструктура та моніторинг
Три шари з відкритим вихідним кодом працюють у кластері AKS. Обслуговування KAITO, Azure OpenAI та стек спостереження Prometheus/Grafana керуються Azure. Azure Managed Prometheus та Grafana збирають метрики маршрутизації та витрат agentgateway, а також метрики GPU vLLM для комплексного огляду.
Гнучкість та зрілість
Microsoft зазначає, що її маршрутизатор моделей Foundry є керованою версією семантичного шару RouteLLM, що зручно для команд, які не бажають самостійно керувати маршрутизатором. Однак наразі немає керованої опції для розміщення Endpoint Picker з урахуванням GPU; він повинен працювати в кластері. Компоненти архітектури є відносно новими, і назви полів можуть змінюватися між релізами. Рішення було перевірено на AKS у середині 2026 року з Inference Extension v1.0.0 та agentgateway v1.3.1. Команди можуть впроваджувати цю архітектуру поступово, обираючи лише необхідні компоненти залежно від своїх потреб.
Що це означає для розробників
Розробники можуть використовувати цю архітектуру для оптимізації витрат та продуктивності своїх AI-агентів на AKS, інтегруючи RouteLLM для семантичної маршрутизації, agentgateway для керування політиками та Inference Extension для ефективного використання GPU. Це дозволяє їм вибирати між керованими та самостійно розміщеними компонентами, адаптуючи рішення до своїх вимог.
Ключові факти
-
Microsoft випустила еталонну архітектуру для маршрутизації трафіку AI-агентів на Azure Kubernetes Service (AKS).
-
Архітектура вирішує проблему трьома ключовими виборами: яка модель відповідає, як керується виклик, яка GPU-репліка обробляє.
-
Вона поєднує Kubernetes Gateway API Inference Extension, agentgateway та RouteLLM, які підключаються до однієї OpenAI-сумісної кінцевої точки.
-
RouteLLM використовує матрично-факторизаційний маршрутизатор, навчений на даних людських переваг, для семантичної маршрутизації.
-
RouteLLM досяг ~95% якості GPT-4 за MT-Bench, відправляючи ~26% викликів до GPT-4, що дозволило заощадити до 85% витрат.
Джерела
Джерело
InfoQClaudio Masolo
Microsoft Three-Layer LLM Routing Architecture for AI Agents on AKS29 липня 2026
Попередні статті

Оновлення Ради директорів Ethereum Foundation: Приєднання pcaversaccio
pcaversaccio, відомий учасник екосистеми Ethereum та автор "The Ethereum Cypherpunk Manifesto", приєднався до Ради директорів Ethereum Foundation на однорічний термін.

Leidos представляє платформу Parcata™ для автономного усунення кіберзагроз за допомогою ШІ
Leidos представила Parcata™, нову платформу на базі ШІ, яка автономно виявляє та виправляє вразливості програмного забезпечення, включаючи нульового дня, для урядових та комерційних організацій.

Figma та Reddit: Аналіз падіння акцій після IPO на тлі сильних бізнес-показників
Акції Figma та Reddit значно впали після IPO, але їхні бізнес-показники демонструють зростання та прибутковість, що вказує на можливу розбіжність між ринковою оцінкою та фундаментальною вартістю.
Наступні статті

Новий китайський закон про «етнічну єдність» викликає побоювання у Казахстані
Новий китайський «Закон про етнічну єдність», що дозволяє переслідувати дисидентів за кордоном, викликає занепокоєння серед тюркських меншин у Казахстані та посилює тиск на них.

Precise Behavioral Залучає $14.2 Мільйона Інвестицій для Розширення Платформи
Компанія Precise Behavioral, що спеціалізується на поведінковому здоров'ї, залучила $14.2 млн венчурного фінансування. Інвестиції спрямують на масштабування операцій, розвиток SaaS та дорожньої карти ШІ.

Директор з доходів Figma продав акції компанії на $268 тис. за планом 10b5-1
Шаунт Восканян, директор з доходів Figma, продав понад 11 тисяч акцій компанії, що було здійснено в рамках заздалегідь встановленого торгового плану.