Штучний інтелект

Ентузіаст додав Nvidia Tesla V100 до ігрового ПК за $266 для локальних LLM

H

https://www.tomshardware.com/author/mark-tyson

2 хв читання

Nvidia Tesla V100 SXM2, встановлена в ігровий ПК з адаптером SXM2-to-PCIe та модифікованим кулером

Оновлення ігрового ПК для LLM

Комп'ютерний ентузіаст Оскар Мольнар переобладнав гучний, але потужний корпоративний графічний процесор для локального виведення великих мовних моделей (LLM). Його система тепер має 32 ГБ загальної відеопам'яті (VRAM) завдяки інвестиції у $266 (£200).

Деталі апаратного забезпечення та витрати

Для реалізації проєкту Мольнар придбав Tesla V100 SXM2 з 16 ГБ HBM2. Ці карти, за спостереженнями, доступні на eBay US за ціною менше $140 кожна. Додатково було потрібно адаптер SXM2-to-PCIe, який обійшовся приблизно у $66, також придбаний на eBay. Для вирішення проблеми шуму від кулера, який Мольнар описав як «щось середнє між подрібнювачем сміття та газонокосаркою» (82 дБ), було застосовано PWM-модифікацію.

Вирішення проблеми шуму

Стандартний кулер Tesla V100 SXM2 був надзвичайно гучним. Мольнар вирішив цю проблему, перенаправивши дроти вентилятора до роз'єму PWM вентилятора на материнській платі. Альтернативним варіантом є використання перехідного кабелю «2.54mm male to PH2.0 female jumper cable». Зазначається, що для підтримки температури Tesla V100 нижче 50°C при повному навантаженні вентилятору достатньо працювати лише на 10% потужності.

Конфігурація системи та продуктивність

Після інтеграції та налаштування, система Мольнара отримала 32 ГБ VRAM. Вона складається з RTX 4080 (16 ГБ VRAM, архітектура Ada) та Tesla V100 (16 ГБ VRAM, архітектура Volta). Мольнар зауважує, що існують Tesla V100 з 32 ГБ VRAM, але вони коштують вдвічі дорожче. Для використання всієї VRAM для LLM, ентузіаст застосував NixOS зі застарілим драйвером Nvidia, який підтримує обидві архітектури – Volta та Ada. Тестування показало, що 27-мільярдна модель LLM працює зі швидкістю 32 токени на секунду, що, за словами Мольнара, «достатньо швидко для інтерактивного використання» і перевершує більшість хмарних API-альтернатив.

Що це означає для розробників

Ця новина демонструє, що розробники можуть значно розширити можливості своїх локальних систем для роботи з великими мовними моделями (LLM), використовуючи доступне корпоративне обладнання. Можливість запускати 27-мільярдну модель зі швидкістю 32 токени на секунду на гібридній системі з 32 ГБ VRAM відкриває шлях для більш інтерактивної та швидкої розробки LLM без залежності від хмарних сервісів.

Ключові факти

  • Ентузіаст інтегрував корпоративний GPU Nvidia Tesla V100 у свій ігровий ПК для локальних LLM.

  • Загальна VRAM системи подвоїлася до 32 ГБ за $266.

  • Використано Tesla V100 SXM2 з 16 ГБ HBM2, адаптер SXM2-to-PCIe та PWM-модифікація для кулера.

  • Шум від кулера Tesla V100 SXM2 становив 82 дБ, вирішено перенаправленням проводів вентилятора до PWM-роз'єму материнської плати.

  • Система складається з RTX 4080 (16 ГБ VRAM) та Tesla V100 (16 ГБ VRAM).

Джерела

Штучний інтелектТехнологіїHardware та чипи

Попередні статті

Наступні статті

Концептуальна ілюстрація цифрової трансформації фінансових рішень за допомогою хмарних технологій та ШІ

FICO зосереджується на SaaS та ШІ напередодні звіту про прибутки

Напередодні звіту про прибутки Fair Isaac 29 липня, увага зосереджена на переході компанії до SaaS, зростанні регулярних доходів та інтеграції ШІ-рішень, що змінює сприйняття її бізнес-моделі.

Концептуальна ілюстрація, що зображує цифровий текст, який перетворюється на "словесний фарш", символізуючи згенерований ШІ контент, що звучить правдоподібно, але не має істинного змісту.

Відкритий лист до BibleHub.com: Видаліть згенерований ШІ «словесний фарш»

Автор відкритого листа до BibleHub.com висловлює глибоке розчарування використанням генеративного ШІ для створення контенту, називаючи його «словесним фаршем», що підриває довіру до авторитетного ресурсу для вивчення Біблії.