Штучний інтелект

Експеримент з LLM на Raspberry Pi 3B+: Можливо, але безглуздо

A

Adam Davidson

3 хв читання

Raspberry Pi 3B+ на робочому столі з безглуздим текстом на екрані

Обмеження Raspberry Pi 3B+ для LLM

Експеримент з запуску локальної великої мовної моделі (LLM) на Raspberry Pi 3B+ виявив значні обмеження апаратного забезпечення. Raspberry Pi 3B+ має лише 1 ГБ оперативної пам'яті (ОЗП), що є критичним фактором для LLM, оскільки моделі завантажуються саме в ОЗП. Навіть невеликі моделі з 1 мільярдом параметрів можуть вимагати понад 2 ГБ ОЗП у 16-бітній точності, хоча квантовані версії значно зменшують ці вимоги.

Фактично, для самої LLM на Raspberry Pi 3B+ залишається ще менше пам'яті — до 600 МБ, оскільки частина ОЗП використовується мінімальною операційною системою Linux та фоновими службами. Це робить запуск навіть моделей з 0.5 мільярда параметрів складним завданням.

Вибір моделі та оптимізація

Серед розглянутих варіантів були Qwen2.5 0.5B та BitNet b1.58 2B4T від Microsoft Research. Qwen2.5 0.5B була занадто малою і мала б обмежені можливості. BitNet b1.58 2B4T, хоч і була розроблена для ефективного використання пам'яті, вимагала спеціалізованого фреймворку bitnet.cpp, який було б складно скомпілювати на Raspberry Pi 3B+.

Зрештою, для експерименту була обрана сильно квантована версія TinyLlama 1.1B. Оригінальна 16-бітна версія цієї моделі займала б понад 2 ГБ, але квантована версія мала розмір лише 637 МБ, що дозволило їй поміститися в доступну пам'ять. Для полегшення роботи з обмеженою ОЗП було налаштовано 2 ГБ файлу підкачки (swap), який використовував SD-карту як додаткову пам'ять. Це дозволило операційній системі переміщувати менш активні дані з ОЗП на SD-карту, запобігаючи збоям, хоча і значно уповільнюючи роботу.

Процес запуску та продуктивність

Замість використання Ollama, яка споживає додаткову ОЗП, модель запускалася безпосередньо через llama.cpp. Компіляція llama.cpp на Raspberry Pi 3B+ зайняла понад дві години. Після успішної компіляції та завантаження моделі, LLM почала генерувати текст.

Швидкість обробки запитів становила 4.5 токени на секунду, а генерація відповідей — 2.9 токени на секунду, що приблизно дорівнює двом словам на секунду. Ця швидкість виявилася кращою, ніж очікувалося.

Якість згенерованого тексту

Незважаючи на відносно прийнятну швидкість, якість згенерованого тексту була здебільшого безглуздою. Наприклад, LLM описала Raspberry Pi як пристрій, що включає концепцію "Prydery Pi" для створення "pydery ефекту", а також видає чутний шум і вібрацію при дотику. Інші приклади включали: Ейфелеву вежу як "Вежу кохання з першого погляду", How-To Geek як ресурс для ентузіастів домашнього благоустрою, а слово "strawberry" складається лише з двох літер "R" та "B". Рецепт яєчні-бовтанки не містив яєць.

Хоча LLM могла давати деякі точні відповіді (наприклад, що столиця Франції — Париж, а Ейфелева вежа — відома пам'ятка Парижа), вона завжди доповнювала їх принаймні однією повністю вигаданою частиною. Експеримент показав, що хоча Raspberry Pi може змусити LLM генерувати текст, зміст цього тексту здебільшого є нісенітницею. Це підтверджує, що хоча запустити LLM на такому пристрої можливо, це, ймовірно, не варто робити для практичних цілей.

Що це означає для розробників

Цей експеримент демонструє розробникам практичні виклики запуску LLM на пристроях з обмеженими ресурсами, таких як Raspberry Pi 3B+. Він підкреслює важливість оперативної пам'яті, ефективність квантування моделей для зменшення вимог до пам'яті та компроміси, пов'язані з використанням файлів підкачки. Розробники можуть врахувати ці фактори при виборі моделей та архітектур для розгортання на периферійних пристроях, а також переваги прямого використання llama.cpp для мінімізації накладних витрат.

Ключові факти

  • Raspberry Pi 3B+ з 1 ГБ оперативної пам'яті був використаний для експерименту з локальною LLM.

  • Для запуску LLM було обрано сильно квантовану версію TinyLlama 1.1B розміром 637 МБ.

  • Було налаштовано 2 ГБ файлу підкачки (swap) на SD-карті для компенсації нестачі ОЗП.

  • Процес компіляції llama.cpp на Raspberry Pi зайняв понад дві години.

  • LLM генерувала текст зі швидкістю близько 2.9 токенів на секунду (приблизно два слова на секунду).

Джерела

Штучний інтелектТехнологіїHardware та чипи

Джерело

How-To GeekAdam Davidson

I tried running a local LLM on a Raspberry Pi, and the results were hilarious

27 липня 2026 · оновлено 27 липня 2026

Оригінал

Попередні статті

Наступні статті

Промислова панель управління з цифровими елементами, що символізують безперервний кіберзахист OT

Еволюція кібербезпеки OT: від виявлення ризиків до їх безперервного зниження

Попри покращену видимість, операційні ризики зростають. Новий підхід у кібербезпеці OT фокусується на безперервному зниженні ризиків без переривання виробництва.