Штучний інтелект

Тестування локальної LLM на повсякденних завданнях: що працює, а що ні

A

Adam Davidson

4 хв читання

M2 MacBook Air з абстрактною візуалізацією обробки даних на екрані, що символізує роботу локальної великої мовної моделі.

Обладнання та модель

Автор щоденно використовує локальні великі мовні моделі (LLM) і зазначає, що в його особистій конфігурації вони корисні лише для обмеженого набору завдань. Для тестування повсякденних завдань використовувався M2 MacBook Air з 8 ГБ оперативної пам'яті. Зазначається, що результати мають відповідати можливостям подібного обладнання, хоча потужніші системи могли б досягти більшого. Для всіх тестів використовувалася модель Qwen3.5 4B, запущена в Ollama, оскільки вона є досить потужною, але достатньо малою для роботи на обмеженому обладнанні.

Відповіді на загальні запитання

При спробі відповісти на загальні запитання, локальна LLM виявилася болісно повільною та часто неточною. На відміну від потужних хмарних моделей, таких як ChatGPT, Claude або Gemini, які працюють на надшвидкому обладнанні та надають майже миттєві відповіді, локальна модель на тестовому обладнанні поводилася інакше. Наприклад, на запитання «Поясніть IPv6» відповідь генерувалася понад 30 секунд і містила фактичні неточності, такі як твердження про 10^58 адрес IPv6 замість приблизно 10^38. Для таких завдань локальна LLM виявилася непридатною, а менші моделі, хоч і швидші, були б ще більш схильні до фактичних помилок.

Написання повних статей

Була зроблена спроба змусити локальну LLM написати повну статтю обсягом близько 800 слів на тему «5 речей, які кожен новий користувач Home Assistant повинен зробити в першу чергу», з конкретними вимогами до стилю та структури. Модель згенерувала відповідь вражаюче швидко — трохи більше ніж за хвилину, перевищивши ліміт у 800 слів приблизно на 200 слів. Однак якість була низькою: текст був занадто довгим, ігнорував деякі інструкції форматування (наприклад, повністю пропустив висновок), був дуже повторюваним і містив кілька фактичних помилок. Стиль написання був надто багатослівним і звучав так, ніби його написав ШІ. Було б швидше написати статтю з нуля, ніж виправляти всі проблеми.

Підсумовування довгих документів

Локальна LLM показала себе досить добре при підсумовуванні довгих документів. Було надано сторінку документації обсягом близько 3000 слів із запитом на створення одноабзацного резюме, п'яти ключових висновків, найважливіших попереджень про безпеку та рекомендацій, обсягом до 600 слів, базуючись виключно на наданому документі. Модель успішно виділила ключові теми, дотримувалася інструкцій та знайшла найважливіші наслідки для безпеки. Хоча відповідь була дещо багатослівною і досягла ліміту обсягу, з невеликим доопрацюванням вона могла б дати корисні результати. Основною проблемою був час генерації — трохи менше хвилини. Якщо швидкість не є критичною, навіть невелика локальна LLM може добре впоратися з підсумовуванням довгих документів.

Голосовий помічник для розумного будинку

Була надія, що локальна LLM зможе працювати як голосовий помічник для розумного будинку, конкуруючи з хмарними рішеннями, такими як Alexa, але з перевагами конфіденційності. Home Assistant має власного голосового помічника Assist, який може обробляти попередньо визначені команди майже миттєво. Однак він не може обробляти складніші запити, що вимагають контексту. Інтеграція з хмарними LLM робить Assist розумнішим, але надсилає команди на сторонні сервери, що суперечить принципам конфіденційності Home Assistant. Підключення локальної LLM до Home Assistant через інтеграцію Ollama дозволило виконати команду «Вимкни світло в кабінеті», а потім «Увімкни його знову». Світло зрештою увімкнулося, але це зайняло 21 секунду. Такий час відгуку (третина хвилини) є занадто повільним для практичного використання в розумному будинку.

Помічник з кодування

Була спроба використати локальну LLM як помічника з кодування, надавши їй вигадану помилку Python. Модель спочатку неправильно діагностувала помилку, а потім помітила, що заявлена помилка неможлива з наданим кодом. Однак замість того, щоб попросити роз'яснень або пояснити справжню помилку та спосіб її виправлення, модель застрягла в циклі самоперевірки, поки не вичерпала токени. Генерація відповіді зайняла 40 секунд, і вона виявилася абсолютно марною. Локальна LLM не буде використовуватися як помічник з кодування.

Висновок: для яких завдань підходить локальна LLM

У багатьох з наведених прикладів локальна LLM виявилася або занадто повільною, або занадто неточною, щоб бути корисною. Однак це не означає, що LLM не може виконувати свою роботу добре. Існують випадки, коли повільна швидкість не є значною проблемою, наприклад, генерація ранкового брифінгу. Для правильних завдань навіть невелика локальна LLM може бути ефективною.

Що це означає для розробників

Для розробників, які розглядають використання локальних LLM на споживчому обладнанні, важливо враховувати значні обмеження продуктивності та точності для більшості завдань. Хоча вони можуть бути корисними для підсумовування документів, їхня повільність робить їх непридатними для інтерактивних застосунків, таких як голосові помічники або інструменти для кодування. Розробникам слід ретельно обирати сценарії використання, де швидкість не є критичною, а переваги локальної обробки (наприклад, конфіденційність) переважають недоліки.

Ключові факти

  • Тестування локальної LLM проводилося на M2 MacBook Air з 8 ГБ оперативної пам'яті.

  • Використовувалася модель Qwen3.5 4B, запущена в Ollama.

  • Локальна LLM була повільною (понад 30 секунд) та неточною при відповідях на загальні запитання.

  • При написанні статті модель згенерувала текст за трохи більше хвилини, але якість була низькою, з помилками та ігноруванням інструкцій.

  • Модель "досить добре" впоралася з підсумовуванням 3000-слівного документа, хоча генерація зайняла близько хвилини.

Джерела

Штучний інтелектТехнологіїРозробка ПЗ

Джерело

How-To GeekAdam Davidson

I tested a local LLM on 5 everyday tasks—only one was actually worth doing

27 липня 2026 · оновлено 27 липня 2026

Оригінал

Попередні статті

Концептуальна ілюстрація, що зображує взаємопов'язану мережу стилізованих центрів обробки даних та фінансових символів, які формують циклічний потік капіталу в екосистемі ШІ.

Nvidia укладає угоди на $750 мільярдів, посилюючи занепокоєння щодо циклічного фінансування ШІ

Nvidia працює над новими угодами щодо інфраструктури ШІ на понад $750 мільярдів, що викликає занепокоєння щодо штучного роздування попиту та оцінок на ринку.

Наступні статті