Штучний інтелект

Netflix деталізує свою платформу обслуговування LLM з Triton та vLLM

M

Matt Foster

3 хв читання

Абстрактна архітектурна схема внутрішньої платформи Netflix для обслуговування LLM, що показує взаємодію JVM-шару, MSS, Triton та vLLM.

Архітектура платформи для LLM-висновків

Netflix описала свою внутрішню платформу для висновків великих мовних моделей (LLM), яка вирішує завдання підтримки різних розмірів моделей, апаратних вимог та швидкозмінних механізмів висновків. Платформа охоплює архітектурні рішення та операційну роботу, пов'язану з виконанням робочих навантажень у реальному часі та пакетних завдань на CPU та GPU. Це включає пакування та розгортання моделей, обмежене декодування та сумісність версій.

Платформа базується на існуючому шарі обслуговування Netflix на основі JVM, який продовжує виконувати маршрутизацію, отримання функцій, генерацію кандидатів, постобробку та логування.

Обробка моделей та розподіл навантаження

Менші моделі можуть виконуватися безпосередньо на CPU. Більші запити делегуються до MSS (Model Serving System), де Triton бере на себе завантаження моделей, пакетну обробку, планування GPU та обслуговування кількох фреймворків. Це дозволяє зберегти послідовність виробничого робочого процесу, навіть коли висновки переміщуються між локальним та віддаленим обладнанням.

Для шляху GPU Netflix обрала vLLM через його операційну придатність та розширюваність, при цьому Triton зберігає відповідальність за управління моделями та планування. Triton контролює середовище обслуговування навколо моделі, тоді як vLLM виконує висновки та надає механізми розширення для власної поведінки.

Виклики сумісності та розширення

Netflix повідомляє, що несумісні версії Triton та vLLM можуть перешкоджати розгортанню, вимагаючи тестування та фіксації сумісних релізів. Власні моделі створили додаткові інтеграційні виклики. Сумісність Hugging Face у vLLM була недостатньою для деяких моделей Netflix, тому компанія використовувала точки розширення vLLM для власних архітектур та поведінки декодування.

Netflix також порівняла два підходи до пакування Triton: бекенд Python та бекенд vLLM. Компанія зазначає, що підхід з бекендом vLLM дозволяє моделям та фронтендам розвиватися більш незалежно, ніж варіант з бекендом Python. Цей вибір впливає на те, наскільки тісно модель пов'язана зі своїм середовищем обслуговування, а не на те, який механізм виконує висновки.

Обмежене декодування та управління станом

Загальний інтерфейс обслуговування не усунув відмінностей між основними механізмами. Хоча Triton надавав OpenAI-сумісний API разом з KServe HTTP та gRPC фронтендами, Netflix все ще стикалася з прогалинами в обробці деяких функцій у цих інтеграціях. Обмежене декодування є одним із прикладів. Воно дозволяє Netflix примусово формувати відповіді моделі у формати, такі як дійсний JSON, фільтруючи токени, які модель може генерувати на кожному кроці.

Оскільки ці правила залежать від усього, що було згенеровано до цього, декодер повинен підтримувати стан протягом усього запиту. Коли vLLM призупиняє, а потім відновлює запит для управління ресурсами GPU, цей стан може розсинхронізуватися з історією токенів. Тому Netflix додала логіку для виявлення зміни та його відновлення перед продовженням генерації.

Стратегії розгортання

Сумісність також вплинула на розгортання. Netflix фіксує протестовані версії Triton та vLLM разом, щоб запобігти збоям завантаження бекенду. Стратегії розгортання Red-Black та Versioned обробляють зміни на рівні моделі. Версійні розгортання зберігають старі та нові ревізії доступними окремо, дозволяючи споживачам мігрувати після адаптації до несумісних вхідних або вихідних схем.

Ширший контекст та висновки

Досвід Netflix показує, як загальний інтерфейс обслуговування може знаходитися над кількома різними шарами. Цей тип архітектури відображає ширші зусилля, спрямовані на надання командам додатків стабільної поверхні інтеграції, тоді як постачальники моделей та середовища виконання обслуговування продовжують змінюватися. Звіт Netflix також показує, що абстракція не усуває базової роботи: пакування, контроль сумісності, обмежене декодування та ізоляція розгортання все ще вимагають інженерних зусиль на кожному шарі.

Що це означає для розробників

Ця новина означає, що розробники, які працюють з LLM-платформами, стикаються зі складними викликами інтеграції та сумісності між різними інструментами, такими як Triton та vLLM. Їм потрібно враховувати необхідність фіксації сумісних версій, розробки власних розширень для специфічних моделей та управління станом при обмеженому декодуванні. Це підкреслює, що навіть при наявності абстракцій, значна інженерна робота залишається на кожному рівні системи.

Ключові факти

  • Netflix описала свою внутрішню платформу для висновків LLM, що працює на CPU та GPU.

  • Платформа використовує існуючий JVM-шар для маршрутизації та обробки, а для великих запитів делегує їх до MSS.

  • Triton відповідає за завантаження моделей, пакетну обробку та планування GPU, тоді як vLLM виконує висновки.

  • Виклики включають сумісність версій Triton/vLLM, недостатню сумісність Hugging Face для деяких моделей Netflix та управління станом при обмеженому декодуванні.

  • Netflix використовує точки розширення vLLM для власних архітектур та поведінки декодування.

Джерела

Штучний інтелектРозробка ПЗТехнології

Попередні статті

Концептуальна ілюстрація аналітики вартості клінічних випробувань на пацієнта

Аналітика вартості клінічних випробувань на пацієнта: Стратегічний інструмент для 2026 року

Аналітика вартості клінічних випробувань на пацієнта (PPC) стає ключовим стратегічним інструментом для управління витратами, ефективністю та складністю досліджень у 2026 році.

Команда розробників програмного забезпечення працює в сучасному офісі, використовуючи ШІ-інструменти для створення та валідації коду, з акцентом на людський нагляд та безпеку.

Штучний інтелект змінює розробку ПЗ та кібербезпеку: нова роль розробника

Штучний інтелект глибоко трансформує розробку програмного забезпечення, прискорюючи рутинні завдання та вимагаючи від розробників нових навичок у керуванні, валідації та забезпеченні безпеки ШІ-рішень.

Наступні статті

Знімок штучної нюхової системи «е-Ніс» у лабораторії, що аналізує зразок

Штучний інтелект трансформує аналітичну хімію: від синтезу спектрів до діагностики раку

ШІ, зокрема машинне навчання та генеративний ШІ, глибоко інтегрований в аналітичну хімію, розширюючи її можливості в аналізі даних, прогнозуванні структур та діагностиці, але вимагає ретельної валідації.