
Архітектура платформи для LLM-висновків
Netflix описала свою внутрішню платформу для висновків великих мовних моделей (LLM), яка вирішує завдання підтримки різних розмірів моделей, апаратних вимог та швидкозмінних механізмів висновків. Платформа охоплює архітектурні рішення та операційну роботу, пов'язану з виконанням робочих навантажень у реальному часі та пакетних завдань на CPU та GPU. Це включає пакування та розгортання моделей, обмежене декодування та сумісність версій.
Платформа базується на існуючому шарі обслуговування Netflix на основі JVM, який продовжує виконувати маршрутизацію, отримання функцій, генерацію кандидатів, постобробку та логування.
Обробка моделей та розподіл навантаження
Менші моделі можуть виконуватися безпосередньо на CPU. Більші запити делегуються до MSS (Model Serving System), де Triton бере на себе завантаження моделей, пакетну обробку, планування GPU та обслуговування кількох фреймворків. Це дозволяє зберегти послідовність виробничого робочого процесу, навіть коли висновки переміщуються між локальним та віддаленим обладнанням.
Для шляху GPU Netflix обрала vLLM через його операційну придатність та розширюваність, при цьому Triton зберігає відповідальність за управління моделями та планування. Triton контролює середовище обслуговування навколо моделі, тоді як vLLM виконує висновки та надає механізми розширення для власної поведінки.
Виклики сумісності та розширення
Netflix повідомляє, що несумісні версії Triton та vLLM можуть перешкоджати розгортанню, вимагаючи тестування та фіксації сумісних релізів. Власні моделі створили додаткові інтеграційні виклики. Сумісність Hugging Face у vLLM була недостатньою для деяких моделей Netflix, тому компанія використовувала точки розширення vLLM для власних архітектур та поведінки декодування.
Netflix також порівняла два підходи до пакування Triton: бекенд Python та бекенд vLLM. Компанія зазначає, що підхід з бекендом vLLM дозволяє моделям та фронтендам розвиватися більш незалежно, ніж варіант з бекендом Python. Цей вибір впливає на те, наскільки тісно модель пов'язана зі своїм середовищем обслуговування, а не на те, який механізм виконує висновки.
Обмежене декодування та управління станом
Загальний інтерфейс обслуговування не усунув відмінностей між основними механізмами. Хоча Triton надавав OpenAI-сумісний API разом з KServe HTTP та gRPC фронтендами, Netflix все ще стикалася з прогалинами в обробці деяких функцій у цих інтеграціях. Обмежене декодування є одним із прикладів. Воно дозволяє Netflix примусово формувати відповіді моделі у формати, такі як дійсний JSON, фільтруючи токени, які модель може генерувати на кожному кроці.
Оскільки ці правила залежать від усього, що було згенеровано до цього, декодер повинен підтримувати стан протягом усього запиту. Коли vLLM призупиняє, а потім відновлює запит для управління ресурсами GPU, цей стан може розсинхронізуватися з історією токенів. Тому Netflix додала логіку для виявлення зміни та його відновлення перед продовженням генерації.
Стратегії розгортання
Сумісність також вплинула на розгортання. Netflix фіксує протестовані версії Triton та vLLM разом, щоб запобігти збоям завантаження бекенду. Стратегії розгортання Red-Black та Versioned обробляють зміни на рівні моделі. Версійні розгортання зберігають старі та нові ревізії доступними окремо, дозволяючи споживачам мігрувати після адаптації до несумісних вхідних або вихідних схем.
Ширший контекст та висновки
Досвід Netflix показує, як загальний інтерфейс обслуговування може знаходитися над кількома різними шарами. Цей тип архітектури відображає ширші зусилля, спрямовані на надання командам додатків стабільної поверхні інтеграції, тоді як постачальники моделей та середовища виконання обслуговування продовжують змінюватися. Звіт Netflix також показує, що абстракція не усуває базової роботи: пакування, контроль сумісності, обмежене декодування та ізоляція розгортання все ще вимагають інженерних зусиль на кожному шарі.
Що це означає для розробників
Ця новина означає, що розробники, які працюють з LLM-платформами, стикаються зі складними викликами інтеграції та сумісності між різними інструментами, такими як Triton та vLLM. Їм потрібно враховувати необхідність фіксації сумісних версій, розробки власних розширень для специфічних моделей та управління станом при обмеженому декодуванні. Це підкреслює, що навіть при наявності абстракцій, значна інженерна робота залишається на кожному рівні системи.
Ключові факти
-
Netflix описала свою внутрішню платформу для висновків LLM, що працює на CPU та GPU.
-
Платформа використовує існуючий JVM-шар для маршрутизації та обробки, а для великих запитів делегує їх до MSS.
-
Triton відповідає за завантаження моделей, пакетну обробку та планування GPU, тоді як vLLM виконує висновки.
-
Виклики включають сумісність версій Triton/vLLM, недостатню сумісність Hugging Face для деяких моделей Netflix та управління станом при обмеженому декодуванні.
-
Netflix використовує точки розширення vLLM для власних архітектур та поведінки декодування.
Джерела
Джерело
InfoQMatt Foster
Netflix Details Its In-House LLM Serving Platform with Triton and vLLM27 липня 2026
Попередні статті

Bitcoin продовжує зростання, Ethereum ралі, XRP відстає: Технічний огляд ринку
Bitcoin утримується вище ключової EMA, Ethereum демонструє бичачий профіль, тоді як XRP стабілізується, але залишається під тиском, згідно з останнім технічним аналізом.

Аналітика вартості клінічних випробувань на пацієнта: Стратегічний інструмент для 2026 року
Аналітика вартості клінічних випробувань на пацієнта (PPC) стає ключовим стратегічним інструментом для управління витратами, ефективністю та складністю досліджень у 2026 році.

Штучний інтелект змінює розробку ПЗ та кібербезпеку: нова роль розробника
Штучний інтелект глибоко трансформує розробку програмного забезпечення, прискорюючи рутинні завдання та вимагаючи від розробників нових навичок у керуванні, валідації та забезпеченні безпеки ШІ-рішень.
Наступні статті

Cypress Capital Group Придбала Акції ACM Research, Inc. та Інші Інвестиційні Зміни
Cypress Capital Group придбала нову частку в акціях ACM Research, Inc. у першому кварталі. Інші інституційні інвестори також змінювали свої позиції, а аналітики оновили рейтинги та цільові ціни.

Entropy Technologies LP придбала значну частку акцій Figma, Inc.
Entropy Technologies LP інвестувала $2,26 млн у Figma, придбавши 107 071 акцію. Інші інституційні інвестори також збільшили свої позиції, тоді як аналітики мають переважно нейтральні оцінки.

Штучний інтелект трансформує аналітичну хімію: від синтезу спектрів до діагностики раку
ШІ, зокрема машинне навчання та генеративний ШІ, глибоко інтегрований в аналітичну хімію, розширюючи її можливості в аналізі даних, прогнозуванні структур та діагностиці, але вимагає ретельної валідації.