
Еволюція законів масштабування LLM
Великі мовні моделі (LLM) прогнозують наступний токен на основі закономірностей, вивчених з текстових даних. Закони масштабування LLM — це емпіричні закономірності, що пов'язують продуктивність моделі з обсягом обчислювальних ресурсів, навчальних даних та кількістю параметрів моделі, використаних під час навчання.
Зміна підходів до навчання
Ранні моделі, такі як GPT-3, Gopher та MT-NLG, використовували приблизно один навчальний токен на параметр. Дослідження Chinchilla пізніше припустило, що за фіксованого бюджету обчислень близько 20 токенів на параметр можуть забезпечити кращу продуктивність. Сучасні моделі Llama значно перевищують це співвідношення; наприклад, Llama 3 8B навчалася з приблизно 1900 токенами на параметр. Це свідчить про те, що інвестування більшої кількості обчислень під час навчання може покращити можливості моделі на параметр та зменшити витрати на інференс протягом життєвого циклу моделі.
Головний висновок полягає в тому, що лише кількість параметрів не є надійним показником продуктивності моделі. Якість моделі залежить від балансу параметрів, навчальних даних та обчислювальних ресурсів.
Нові аспекти масштабування
Дослідження "Scaling Behaviors of LLM Reinforcement Learning Post-Training" вивчає масштабування навчання з підкріпленням після навчання моделі. Воно виявило, що хоча більші моделі досягають вищої ефективності навчання, віддача зменшується зі зростанням масштабу, що вказує на вбудовані обмеження, відмінні від тих, що спостерігаються під час попереднього навчання.
Інші роботи, такі як "Scaling Laws Meet Model Architecture: Toward Inference-Efficient LLMs", розширюють фреймворк Chinchilla, включаючи архітектуру моделі в обчислювально-оптимальне масштабування. Це дослідження показує, що архітектурні рішення можуть передбачувано змінювати зв'язок між розміром моделі та вартістю інференсу.
Ефективність та щільність параметрів
Робота "Densing law of LLMs" вводить концепцію щільності можливостей (capability density), яка є співвідношенням ефективної кількості параметрів моделі до її фактичної кількості. Спостерігається, що найкращі моделі з часом демонструють зростаючу щільність можливостей, що означає, що новіші моделі досягають заданої продуктивності з меншою кількістю параметрів. Ця тенденція є приблизно експоненційною. Це вказує на те, що прогрес у великих мовних моделях полягає не лише у масштабуванні розміру, але й у покращенні архітектури моделі, якості навчальних даних та алгоритмів навчання.
Фреймворк Sloth, представлений у "Sloth: Scaling laws for LLM skills to predict multi-benchmark performance across families", переносить фокус з втрат моделі на продуктивність на рівні бенчмарків. Він ідентифікує набір латентних навичок, які відображають загальні можливості, такі як міркування або пошук знань, і моделює, як ці навички масштабуються з параметрами моделі та навчальними даними. Це дозволяє прогнозувати продуктивність більших моделей без їхнього навчання.
Дослідження "Beyond Chinchilla-Optimal: Accounting for Inference in Language Model Scaling Laws" розширює фреймворк Chinchilla, враховуючи витрати на інференс. Воно оптимізує сукупну вартість навчання та інференсу протягом життєвого циклу моделі, показуючи, що в умовах інтенсивного використання менші моделі, навчені на більшій кількості даних, часто можуть відповідати продуктивності більших моделей, маючи при цьому нижчі загальні обчислювальні витрати.
Майбутнє масштабування та обмеження
Аналіз Epoch AI 2024 року оцінює, чи може поточний темп масштабування навчання ШІ (приблизно в чотири рази на рік) тривати до кінця десятиліття. Прогнозується, що навчальні запуски обсягом 2e29 FLOP, ймовірно, будуть можливими до 2030 року. Основними обмеженнями названо доступність електроенергії, виробничі потужності чипів та дефіцит даних.
Загалом, дослідження підтверджують, що закони масштабування діють у перевірених режимах, демонструючи чіткі залежності між параметрами моделі, розміром навчальних даних та обчислювальними ресурсами. Майбутні зусилля з масштабування будуть зосереджені на ефективному розподілі обчислювальних ресурсів, оптимізації розміру моделі, навчальних токенів та очікуваного обсягу інференсу. Прогрес все більше залежатиме від ефективного дизайну моделі та кращих методів навчання, а не від неконтрольованого збільшення кількості параметрів.
Що це означає для розробників
Розробникам слід враховувати, що якість моделі залежить від балансу параметрів, даних та обчислень, а не лише від кількості параметрів. Оптимізація архітектури, ефективне використання даних та врахування витрат на інференс дозволяють створювати менші, але продуктивніші моделі, що знижує загальні обчислювальні витрати. Використання законів масштабування допомагає прогнозувати продуктивність та ефективно розподіляти ресурси, уникаючи неефективних конфігурацій навчання.
Ключові факти
-
Закони масштабування LLM пов'язують продуктивність моделі з обчислювальними ресурсами, навчальними даними та кількістю параметрів.
-
Ранні LLM використовували близько 1 навчального токена на параметр, тоді як Chinchilla запропонувала 20, а Llama 3 8B — близько 1900.
-
Якість моделі залежить від балансу параметрів, навчальних даних та обчислень, а не лише від кількості параметрів.
-
Масштабування навчання з підкріпленням після навчання має обмеження, де віддача зменшується зі зростанням масштабу.
-
Нові підходи включають архітектуру моделі в обчислювально-оптимальне масштабування, впливаючи на вартість інференсу.
Джерела
Попередні статті

Зростання «Wrench» атак: фізичний примус для викрадення криптовалют
Кількість «Wrench» атак, що передбачають фізичний примус для викрадення криптовалют, зросла на 33% у першій половині 2026 року, досягнувши 124 мільйонів доларів збитків.

Прогнози для Micron, AMD та Marvell: Оцінка ринку AI-інфраструктури до 2028 року
Аналітики 24/7 Wall St. представили прогнози цін на акції Micron, AMD та Marvell до 2028 року, оцінюючи їхню роль у розвитку AI-інфраструктури та потенціал зростання.

Codeberg забороняє навчання ШІ на даних платформи та проєкти, створені переважно LLM
Члени Codeberg проголосували за офіційну заборону використання даних платформи для навчання великих мовних моделей та обмеження проєктів, створених переважно за допомогою ШІ.
Наступні статті

Уряд Індії вимагає від GitHub заблокувати Bitchat Джека Дорсі на тлі протестів
Уряд Індії звернувся до GitHub з вимогою видалити репозиторії застосунку Bitchat, розробленого Джеком Дорсі, посилаючись на його децентралізовану архітектуру та використання під час протестів.

В Azure DevOps виявлено вразливість, що дозволяє прихованим коментарям викрадати дані через ШІ-агентів
Дослідники виявили критичну вразливість у Microsoft Azure DevOps MCP, яка дозволяє зловмисникам використовувати невидимі коментарі в запитах на злиття для викрадення конфіденційних даних через ШІ-агентів.

Перший дистрибутив Linux: чому варто обрати не "дружній для новачків"
Поширена порада для новачків у Linux – встановлювати Mint. Однак, для першого досвіду краще підійдуть імутабельні атомарні дистрибутиви, що забезпечують стабільність та легкість відновлення.