
Moonshot AI 27 липня 2026 року представила Kimi K3 — модель Mixture of Experts (MoE) з 2.8 трильйонами параметрів. Це перша відкрита система, що досягла класу 3 трильйонів параметрів, пропонуючи передовий рівень інтелекту з публічно доступними вагами для самостійного розміщення організаціями.
Про Kimi K3
Kimi K3 побудована на архітектурі, що включає Kimi Delta Attention (KDA), Gated Multi Head Latent Attention (MLA) та фреймворк Stable LatentMoE. Модель розподіляє свої 2.8 трильйона параметрів між 896 спеціалізованими експертами, активуючи лише 16 на токен. Це означає, що під час одного прямого проходу активними є приблизно 104 мільярди параметрів, що забезпечує 2.5-кратне підвищення ефективності масштабування порівняно з попередником Kimi K2.
Модель має вікно контексту в 1 мільйон токенів і є нативною мультимодальною (текст + зір). Kimi K3 відмінно справляється із завданнями довгострокового кодування, агентними робочими процесами та складними міркуваннями. Вона підтримує нативний виклик інструментів, структурований вивід та режим постійного мислення для багатоетапного вирішення проблем.
Ваги Kimi K3 доступні на Hugging Face під ідентифікатором moonshotai/Kimi-K3 у форматі MXFP4 (Microscaling Floating Point 4-bit), що забезпечує баланс між якістю моделі та ефективністю пам'яті для великомасштабних розгортань інференсу.
Інфраструктурні вимоги та обслуговування
Для обслуговування Kimi K3 потрібен контейнер інференсу vLLM day-0 для Kimi K3, який підтримує архітектури MoE, тензорний паралелізм та формат квантування MXFP4. Розгортання моделі такого масштабу вимагає значних обчислювальних ресурсів GPU, зокрема інстансу p6-b300 (ml.p6-b300.48xlarge), який надає 8 графічних процесорів NVIDIA B300 Blackwell Ultra з високошвидкісними інтерконектами.
Розгортання на AWS
AWS пропонує два основні механізми для розгортання Kimi K3:
1. Amazon SageMaker HyperPod
Цей підхід є найпростішим завдяки Inference Operator, який автоматично встановлюється під час створення кластера та абстрагує складнощі оркестрації контейнерів, завантаження моделі та керування кінцевими точками.
Ключові кроки:
- Створення кластера SageMaker HyperPod: Необхідно створити кластер HyperPod з оркестрацією Amazon EKS, вибравши
ml.p6-b300.48xlargeяк тип інстансу для робочої групи. Важливо переконатися, що опція використання стандартних Helm-чартів та доповнень вибрана для автоматичної установки Inference Operator. - Забезпечення потужності за допомогою Flexible Training Plans (FTP): Для інстансів
ml.p6-b300.48xlargeпотрібна зарезервована потужність. FTP забезпечує гарантоване резервування потужності GPU для кластера. - Розгортання моделі: Після того, як кластер досягне активного стану, модель розгортається шляхом застосування маніфесту
InferenceEndpointConfigдо кластера. Inference Operator обробляє завантаження моделі з Hugging Face, планування контейнерів, перевірки стану та готовність кінцевої точки. Кінцева точка надає сумісний з OpenAI API.
2. Amazon Elastic Kubernetes Service (Amazon EKS)
Для команд, які віддають перевагу самостійному керуванню інфраструктурою Kubernetes, Kimi K3 можна розгорнути на автономному кластері Amazon EKS. Потужність GPU отримується через EC2 Capacity Blocks, що дозволяє резервувати інстанси p6-b300 на визначений період без довгострокових зобов'язань.
Ключові кроки:
- Провидіння кластера EKS: Використання модулів Terraform для створення GPU-оптимізованого кластера EKS.
- Резервування потужності GPU за допомогою Capacity Blocks: Створення резервування Capacity Block для інстансів
p6-b300.48xlarge. - Встановлення драйверів GPU та плагіна пристрою: Встановлення плагіна пристрою NVIDIA та драйверів GPU.
- Розгортання сервера інференсу vLLM: Розгортання контейнера vLLM за допомогою Helm-чарту або маніфесту Kubernetes з аргументами, специфічними для Kimi K3.
- Виставлення кінцевої точки інференсу: Kubernetes Service або Ingress контролер виставляє сервер vLLM, надаючи сумісну з OpenAI
/v1/chat/completionsкінцеву точку. - Валідація: Перевірка розгортання шляхом надсилання тестового запиту до кінцевої точки.
Виклик кінцевої точки
Після розгортання кінцева точка Kimi K3 надає сумісний з OpenAI API для завершення чату. Її можна викликати за допомогою OpenAI Python SDK або команди curl.
Очищення ресурсів
Для уникнення постійних витрат, створені ресурси слід видалити після використання. Це включає видалення InferenceEndpointConfig, кластера HyperPod, Flexible Training Plan, розгортання vLLM, кластера EKS та Capacity Block.
Що це означає для розробників
Розробники тепер можуть розгортати Kimi K3, відкриту мультимодальну модель з 2.8 трильйонами параметрів, на AWS, використовуючи або спрощений шлях SageMaker HyperPod, або гнучкість самокерованого кластера EKS. Це дозволяє їм використовувати передові можливості моделі для складних завдань, таких як довгострокове кодування та агентні робочі процеси, з підтримкою OpenAI-сумісного API.
Ключові факти
-
Moonshot AI випустила Kimi K3 27 липня 2026 року.
-
Kimi K3 — це модель Mixture of Experts (MoE) з 2.8 трильйонами параметрів, перша відкрита система, що досягла класу 3 трильйонів параметрів.
-
Модель є відкритою (open-weight) і її ваги доступні для самостійного розміщення.
-
Kimi K3 має архітектуру з Kimi Delta Attention (KDA), Gated Multi Head Latent Attention (MLA) та Stable LatentMoE.
-
Вона розподіляє параметри між 896 експертами, активуючи 16 на токен (приблизно 104 мільярди активних параметрів за прохід).
Джерела
Джерело
Amazon Web Services
Deploying Kimi K3 on AWS | Amazon Web Services30 липня 2026 · оновлено 30 липня 2026
Попередні статті

Офіцера поліції Шарлотт-Мекленбург звинувачують у неправомірному використанні баз даних ALPR
Офіцера CMPD заарештовано за звинуваченням у використанні технологій ALPR та інших баз даних для передачі інформації "наркоторговцю", що призвело до звинувачень у несанкціонованому доступі до урядового комп'ютера.

MLB Network анонсує 15 годин прямого ефіру до дедлайну обмінів
MLB Network проведе 15-годинний прямий ефір 3 серпня, присвячений дедлайну обмінів MLB, за участю 21 особистості та восьми студійних шоу, доступний на кількох платформах.

ШІ-агенти змінюють кібербезпеку: від автономних атак до нових захисних систем
Штучний інтелект кардинально змінює ландшафт кібербезпеки, спричиняючи автономні атаки та вимагаючи нових підходів до захисту, що обговорюватимуть на Black Hat USA.
Наступні статті

Tyler Technologies звітує про рекордні SaaS-показники та прогрес у хмарних рішеннях
Tyler Technologies Inc. оголосила про рекордні бронювання SaaS та загальні бронювання у Q2 2026, зростання доходів від SaaS на 21.7% та активне впровадження хмарної стратегії з функціями ШІ.

Квантовий ШІ прогнозує імунну відповідь на неоантигени для боротьби з раком
Дослідники Cleveland Clinic та IBM розробили квантову модель Q-CHIPP, яка точніше прогнозує імунну відповідь на пухлинні мутації, перевершуючи класичні методи за умов обмежених даних.

Los Altos Online Деталізує Варіанти Підписки на 2026 Рік
Видання Los Altos Online представило оновлені тарифні плани на 2026 рік, що включають як комплексні пакети з друкованою версією, так і доступ лише до цифрового контенту.