
Обмеження Raspberry Pi 3B+ для LLM
Експеримент з запуску локальної великої мовної моделі (LLM) на Raspberry Pi 3B+ виявив значні обмеження апаратного забезпечення. Raspberry Pi 3B+ має лише 1 ГБ оперативної пам'яті (ОЗП), що є критичним фактором для LLM, оскільки моделі завантажуються саме в ОЗП. Навіть невеликі моделі з 1 мільярдом параметрів можуть вимагати понад 2 ГБ ОЗП у 16-бітній точності, хоча квантовані версії значно зменшують ці вимоги.
Фактично, для самої LLM на Raspberry Pi 3B+ залишається ще менше пам'яті — до 600 МБ, оскільки частина ОЗП використовується мінімальною операційною системою Linux та фоновими службами. Це робить запуск навіть моделей з 0.5 мільярда параметрів складним завданням.
Вибір моделі та оптимізація
Серед розглянутих варіантів були Qwen2.5 0.5B та BitNet b1.58 2B4T від Microsoft Research. Qwen2.5 0.5B була занадто малою і мала б обмежені можливості. BitNet b1.58 2B4T, хоч і була розроблена для ефективного використання пам'яті, вимагала спеціалізованого фреймворку bitnet.cpp, який було б складно скомпілювати на Raspberry Pi 3B+.
Зрештою, для експерименту була обрана сильно квантована версія TinyLlama 1.1B. Оригінальна 16-бітна версія цієї моделі займала б понад 2 ГБ, але квантована версія мала розмір лише 637 МБ, що дозволило їй поміститися в доступну пам'ять. Для полегшення роботи з обмеженою ОЗП було налаштовано 2 ГБ файлу підкачки (swap), який використовував SD-карту як додаткову пам'ять. Це дозволило операційній системі переміщувати менш активні дані з ОЗП на SD-карту, запобігаючи збоям, хоча і значно уповільнюючи роботу.
Процес запуску та продуктивність
Замість використання Ollama, яка споживає додаткову ОЗП, модель запускалася безпосередньо через llama.cpp. Компіляція llama.cpp на Raspberry Pi 3B+ зайняла понад дві години. Після успішної компіляції та завантаження моделі, LLM почала генерувати текст.
Швидкість обробки запитів становила 4.5 токени на секунду, а генерація відповідей — 2.9 токени на секунду, що приблизно дорівнює двом словам на секунду. Ця швидкість виявилася кращою, ніж очікувалося.
Якість згенерованого тексту
Незважаючи на відносно прийнятну швидкість, якість згенерованого тексту була здебільшого безглуздою. Наприклад, LLM описала Raspberry Pi як пристрій, що включає концепцію "Prydery Pi" для створення "pydery ефекту", а також видає чутний шум і вібрацію при дотику. Інші приклади включали: Ейфелеву вежу як "Вежу кохання з першого погляду", How-To Geek як ресурс для ентузіастів домашнього благоустрою, а слово "strawberry" складається лише з двох літер "R" та "B". Рецепт яєчні-бовтанки не містив яєць.
Хоча LLM могла давати деякі точні відповіді (наприклад, що столиця Франції — Париж, а Ейфелева вежа — відома пам'ятка Парижа), вона завжди доповнювала їх принаймні однією повністю вигаданою частиною. Експеримент показав, що хоча Raspberry Pi може змусити LLM генерувати текст, зміст цього тексту здебільшого є нісенітницею. Це підтверджує, що хоча запустити LLM на такому пристрої можливо, це, ймовірно, не варто робити для практичних цілей.
Що це означає для розробників
Цей експеримент демонструє розробникам практичні виклики запуску LLM на пристроях з обмеженими ресурсами, таких як Raspberry Pi 3B+. Він підкреслює важливість оперативної пам'яті, ефективність квантування моделей для зменшення вимог до пам'яті та компроміси, пов'язані з використанням файлів підкачки. Розробники можуть врахувати ці фактори при виборі моделей та архітектур для розгортання на периферійних пристроях, а також переваги прямого використання llama.cpp для мінімізації накладних витрат.
Ключові факти
-
Raspberry Pi 3B+ з 1 ГБ оперативної пам'яті був використаний для експерименту з локальною LLM.
-
Для запуску LLM було обрано сильно квантовану версію TinyLlama 1.1B розміром 637 МБ.
-
Було налаштовано 2 ГБ файлу підкачки (swap) на SD-карті для компенсації нестачі ОЗП.
-
Процес компіляції
llama.cppна Raspberry Pi зайняв понад дві години. -
LLM генерувала текст зі швидкістю близько 2.9 токенів на секунду (приблизно два слова на секунду).
Джерела
Джерело
How-To GeekAdam Davidson
I tried running a local LLM on a Raspberry Pi, and the results were hilarious27 липня 2026 · оновлено 27 липня 2026
Попередні статті

Ethereum ETF-и Перевершують Біткойн, а Стейкінг ETH Досягає Рекордних Показників
За тиждень Ethereum ETF-и залучили майже втричі більше коштів, ніж біткойн-фонди, а ціна ETH сягнула двомісячного максимуму. Кількість ETH у стейкінгу досягла рекордних 41 млн.

JCP Investment Management LLC інвестує понад $10 мільйонів у Sempra Energy
JCP Investment Management LLC придбала значну частку акцій Sempra Energy, а інші інституційні інвестори також коригували свої позиції в енергетичній компанії.

Circle придбала патентний портфель IBM у сфері блокчейну
Circle Internet Group придбала значний патентний портфель IBM у сфері блокчейну, ставши лідером за кількістю патентів у США та зміцнюючи свою основу для ончейн-фінансової інфраструктури.
Наступні статті

Nvidia розглядає гарантію на $250 млрд для дата-центру OpenAI в Огайо
Nvidia веде переговори щодо фінансової гарантії на $250 млрд для підтримки запланованого дата-центру OpenAI в Огайо, що може стати однією з найбільших угод у секторі ШІ.

Гонконг посилює кібербезпеку фінансового сектору на тлі зростання AI-загроз
Комісія з цінних паперів та ф'ючерсів Гонконгу (SFC) випустила циркуляр, закликаючи ліцензовані фірми зміцнити кіберзахист від AI-атак, оскільки кількість інцидентів зростає.

Еволюція кібербезпеки OT: від виявлення ризиків до їх безперервного зниження
Попри покращену видимість, операційні ризики зростають. Новий підхід у кібербезпеці OT фокусується на безперервному зниженні ризиків без переривання виробництва.