Штучний інтелект

Kimi K3: Розгортання 2.8-трильйонної моделі MoE на AWS

Д

Джерело: Amazon Web Services

4 хв читання

Серверна стійка з високопродуктивними GPU NVIDIA B300 Blackwell Ultra в центрі обробки даних AWS

Moonshot AI 27 липня 2026 року представила Kimi K3 — модель Mixture of Experts (MoE) з 2.8 трильйонами параметрів. Це перша відкрита система, що досягла класу 3 трильйонів параметрів, пропонуючи передовий рівень інтелекту з публічно доступними вагами для самостійного розміщення організаціями.

Про Kimi K3

Kimi K3 побудована на архітектурі, що включає Kimi Delta Attention (KDA), Gated Multi Head Latent Attention (MLA) та фреймворк Stable LatentMoE. Модель розподіляє свої 2.8 трильйона параметрів між 896 спеціалізованими експертами, активуючи лише 16 на токен. Це означає, що під час одного прямого проходу активними є приблизно 104 мільярди параметрів, що забезпечує 2.5-кратне підвищення ефективності масштабування порівняно з попередником Kimi K2.

Модель має вікно контексту в 1 мільйон токенів і є нативною мультимодальною (текст + зір). Kimi K3 відмінно справляється із завданнями довгострокового кодування, агентними робочими процесами та складними міркуваннями. Вона підтримує нативний виклик інструментів, структурований вивід та режим постійного мислення для багатоетапного вирішення проблем.

Ваги Kimi K3 доступні на Hugging Face під ідентифікатором moonshotai/Kimi-K3 у форматі MXFP4 (Microscaling Floating Point 4-bit), що забезпечує баланс між якістю моделі та ефективністю пам'яті для великомасштабних розгортань інференсу.

Інфраструктурні вимоги та обслуговування

Для обслуговування Kimi K3 потрібен контейнер інференсу vLLM day-0 для Kimi K3, який підтримує архітектури MoE, тензорний паралелізм та формат квантування MXFP4. Розгортання моделі такого масштабу вимагає значних обчислювальних ресурсів GPU, зокрема інстансу p6-b300 (ml.p6-b300.48xlarge), який надає 8 графічних процесорів NVIDIA B300 Blackwell Ultra з високошвидкісними інтерконектами.

Розгортання на AWS

AWS пропонує два основні механізми для розгортання Kimi K3:

1. Amazon SageMaker HyperPod

Цей підхід є найпростішим завдяки Inference Operator, який автоматично встановлюється під час створення кластера та абстрагує складнощі оркестрації контейнерів, завантаження моделі та керування кінцевими точками.

Ключові кроки:

  • Створення кластера SageMaker HyperPod: Необхідно створити кластер HyperPod з оркестрацією Amazon EKS, вибравши ml.p6-b300.48xlarge як тип інстансу для робочої групи. Важливо переконатися, що опція використання стандартних Helm-чартів та доповнень вибрана для автоматичної установки Inference Operator.
  • Забезпечення потужності за допомогою Flexible Training Plans (FTP): Для інстансів ml.p6-b300.48xlarge потрібна зарезервована потужність. FTP забезпечує гарантоване резервування потужності GPU для кластера.
  • Розгортання моделі: Після того, як кластер досягне активного стану, модель розгортається шляхом застосування маніфесту InferenceEndpointConfig до кластера. Inference Operator обробляє завантаження моделі з Hugging Face, планування контейнерів, перевірки стану та готовність кінцевої точки. Кінцева точка надає сумісний з OpenAI API.

2. Amazon Elastic Kubernetes Service (Amazon EKS)

Для команд, які віддають перевагу самостійному керуванню інфраструктурою Kubernetes, Kimi K3 можна розгорнути на автономному кластері Amazon EKS. Потужність GPU отримується через EC2 Capacity Blocks, що дозволяє резервувати інстанси p6-b300 на визначений період без довгострокових зобов'язань.

Ключові кроки:

  • Провидіння кластера EKS: Використання модулів Terraform для створення GPU-оптимізованого кластера EKS.
  • Резервування потужності GPU за допомогою Capacity Blocks: Створення резервування Capacity Block для інстансів p6-b300.48xlarge.
  • Встановлення драйверів GPU та плагіна пристрою: Встановлення плагіна пристрою NVIDIA та драйверів GPU.
  • Розгортання сервера інференсу vLLM: Розгортання контейнера vLLM за допомогою Helm-чарту або маніфесту Kubernetes з аргументами, специфічними для Kimi K3.
  • Виставлення кінцевої точки інференсу: Kubernetes Service або Ingress контролер виставляє сервер vLLM, надаючи сумісну з OpenAI /v1/chat/completions кінцеву точку.
  • Валідація: Перевірка розгортання шляхом надсилання тестового запиту до кінцевої точки.

Виклик кінцевої точки

Після розгортання кінцева точка Kimi K3 надає сумісний з OpenAI API для завершення чату. Її можна викликати за допомогою OpenAI Python SDK або команди curl.

Очищення ресурсів

Для уникнення постійних витрат, створені ресурси слід видалити після використання. Це включає видалення InferenceEndpointConfig, кластера HyperPod, Flexible Training Plan, розгортання vLLM, кластера EKS та Capacity Block.

Що це означає для розробників

Розробники тепер можуть розгортати Kimi K3, відкриту мультимодальну модель з 2.8 трильйонами параметрів, на AWS, використовуючи або спрощений шлях SageMaker HyperPod, або гнучкість самокерованого кластера EKS. Це дозволяє їм використовувати передові можливості моделі для складних завдань, таких як довгострокове кодування та агентні робочі процеси, з підтримкою OpenAI-сумісного API.

Ключові факти

  • Moonshot AI випустила Kimi K3 27 липня 2026 року.

  • Kimi K3 — це модель Mixture of Experts (MoE) з 2.8 трильйонами параметрів, перша відкрита система, що досягла класу 3 трильйонів параметрів.

  • Модель є відкритою (open-weight) і її ваги доступні для самостійного розміщення.

  • Kimi K3 має архітектуру з Kimi Delta Attention (KDA), Gated Multi Head Latent Attention (MLA) та Stable LatentMoE.

  • Вона розподіляє параметри між 896 експертами, активуючи 16 на токен (приблизно 104 мільярди активних параметрів за прохід).

Джерела

Штучний інтелектТехнологіїРозробка ПЗ

Джерело

Amazon Web Services

Deploying Kimi K3 on AWS | Amazon Web Services

30 липня 2026 · оновлено 30 липня 2026

Оригінал

Попередні статті

Екран комп'ютера з інтерфейсом бази даних розпізнавання номерних знаків, що відображає результати пошуку, з рукою над клавіатурою.

Офіцера поліції Шарлотт-Мекленбург звинувачують у неправомірному використанні баз даних ALPR

Офіцера CMPD заарештовано за звинуваченням у використанні технологій ALPR та інших баз даних для передачі інформації "наркоторговцю", що призвело до звинувачень у несанкціонованому доступі до урядового комп'ютера.

Наступні статті

Дослідник працює з квантовим комп'ютером у лабораторії, на задньому плані видно біологічні дані.

Квантовий ШІ прогнозує імунну відповідь на неоантигени для боротьби з раком

Дослідники Cleveland Clinic та IBM розробили квантову модель Q-CHIPP, яка точніше прогнозує імунну відповідь на пухлинні мутації, перевершуючи класичні методи за умов обмежених даних.