Коротко (TL;DR)
Локальний ШІ — це нейромережа (як ChatGPT), яка працює на вашому комп’ютері, а не у хмарі. Жодної підписки, ваші дані нікуди не йдуть. Головне питання не «яку відеокарту купити потужнішу», а «що я буду на ній робити».
- Коротко (TL;DR)
- Що таке локальний ШІ і навіщо він потрібен
- Короткий словник (без нього далі буде складно)
- Під які задачі беруть локальний ШІ
- Чому краще окремий сервер, а не робочий ноутбук
- Скільки відеопам’яті потрібно під модель
- Збірки за бюджетом: чотири варіанти
- Які відеокарти NVIDIA брати: не тільки 3090
- Для просунутих: сервер на 2–4 відеокарти
- AMD дешевше за NVIDIA — але є нюанс
- Коли краще Mac чи міні-ПК, а не збірка
- Ціни на українському ринку
- Безпека і ризики
- Підсумок: що зібрати під ваш випадок
- FAQ
Запам’ятайте одне правило: спершу задача, потім залізо. Від задачі залежить, яка потрібна модель. Від розміру моделі залежить, скільки потрібно відеопам’яті. А відеопам’ять — це і є головна характеристика, на яку дивляться при виборі.
Якщо дуже коротко:
- Хочете просто спробувати (чат, легкий помічник) — вистачить відеокарти на 8–12 ГБ або навіть звичайного ноутбука.
- Серйозна робота (кодинг, документи, агенти) — одна відеокарта на 24 ГБ. Найкращий вибір за ціною — б/в RTX 3090 (близько 42 000–48 000 ₴ в Україні). Закриває майже все.
- Великі моделі чи кілька користувачів — дві відеокарти або Mac із великою пам’яттю. Це вже окрема, складніша розмова.
Нижче все по порядку і простими словами: що таке локальний ШІ, короткий словник термінів, під які задачі що потрібно, збірки за бюджетом із цінами в гривнях і доларах, і окремо — для тих, хто хоче зібрати потужний сервер. Якщо ж хочете просто порівняти готові пристрої між собою, це в нашому гіді з вибору заліза для локального ШІ.
(Дані актуальні на 23 червня 2026. Ціни й швидкості — з датами прямо в тексті. Курс для перерахунку — 44,90 ₴/$ за НБУ на 23 червня 2026.)
Що таке локальний ШІ і навіщо він потрібен
Локальний ШІ — це та сама нейромережа, що й ChatGPT чи Claude, але запущена на вашому залізі. Ви завантажуєте модель (файл із «мізками» нейромережі) і запускаєте її в себе. Інтернет для роботи не потрібен.
Навіщо це людям:
- Приватність. Ваші документи, код і листування не йдуть на чужі сервери. Для юриста, лікаря чи розробника це часто вирішальний аргумент.
- Немає підписки. Заплатили за залізо один раз — користуєтеся скільки завгодно. За великих обсягів це дешевше, ніж платити за хмарний ШІ щомісяця.
- Контроль і свобода. Жодних лімітів, цензури і «модель оновили, і вона стала гіршою». Ви обираєте модель самі.
Мінуси теж чесні. Топові хмарні моделі поки розумніші за будь-яку, що влізе в домашній комп’ютер. І залізо треба купити й налаштувати. Тому локальний ШІ беруть не «замість» хмари, а під конкретні задачі, де важливі приватність, обсяг чи незалежність.
Короткий словник (без нього далі буде складно)
Ці терміни трапляться по всій статті — розберемо їх одразу, щоб далі не спотикатися.
- Модель — сама нейромережа. Її «розмір» міряють у мільярдах параметрів і пишуть як 8B, 32B, 70B (B — billion, мільярд). Грубо: чим більше число, тим модель розумніша, але тим більше пам’яті їй потрібно.
- VRAM (відеопам’ять) — пам’ять на відеокарті. Модель має цілком поміститися в неї, щоб працювати швидко. Це головна цифра при виборі заліза.
- Токени за секунду (ток/с) — швидкість відповіді. Токен — це шматочок слова. Орієнтир: 10 ток/с — це комфортний темп читання, 40+ ток/с — швидше, ніж ви встигаєте читати.
- Квантування (Q4_K_M тощо) — стиснення моделі, щоб вона займала менше пам’яті. Схоже на стиснення фото в JPEG: трохи втрачаємо в якості, сильно виграємо в розмірі. Позначається від Q2 до Q8 — чим більше число, тим точніше і важче. Q4_K_M — робочий компроміс, його й беруть за замовчуванням.
- Контекст — скільки тексту модель «пам’ятає» в одному діалозі. Чим довший контекст, тим більше потрібно додаткової пам’яті (її називають KV-кеш).
- MoE (Mixture of Experts) — особливий тип моделі, де на кожен запит працює тільки частина «мозку». Тому велика MoE-модель працює швидко навіть на скромному залізі.
- Ollama — безкоштовна програма, яка запускає модель на вашому комп’ютері однією командою. Щось на кшталт «плеєра» для нейромереж. Поверх неї ставлять Open WebUI — це звичне вікно чату в браузері, як у ChatGPT, тільки локально. А vLLM — це рушій потужніший: він обробляє багато запитів паралельно і потрібен, коли сервером користуються кілька людей.
Тепер до справи.
Під які задачі беруть локальний ШІ
Перш ніж дивитися на залізо, знайдіть свою задачу. Ми зібрали найчастіші сценарії, під які люди ставлять локальний ШІ вдома і для роботи — за обговореннями на r/LocalLLaMA і свіжими гайдами 2026 року (Medium, на 19 червня 2026). Найімовірніше, ваш випадок тут є.
| Задача | Що це на практиці | Модель | Потрібно VRAM |
|---|---|---|---|
| Приватний чат-помічник | Заміна ChatGPT для особистих і робочих даних | 8–14B (Qwen3, Gemma 3) | 8–16 ГБ |
| Кодинг | Підказки і рефакторинг прямо в редакторі коду | Qwen2.5-Coder-32B | 24 ГБ |
| Автономні агенти | ШІ сам виконує ланцюжок дій, викликає інструменти | Qwen3-Coder 30B-A3B (MoE) | 24 ГБ |
| Тексти, копірайтинг | Чернетки, редактура, переклади | 14–32B | 12–24 ГБ |
| Робота з документами (RAG) | Питання до своїх файлів, нотаток, бази знань | 8–32B + пошук | 16–24 ГБ |
| Аналітика, data science | Обробка даних, розмітка, експерименти | 8–32B | 16–24 ГБ |
| Розшифровка мовлення (Whisper) | Голос і відео в текст, субтитри | Whisper | 6–12 ГБ |
| Генерація картинок | Stable Diffusion, Flux (це вже не текст, але та сама відеопам’ять) | SDXL / Flux | 8–16 ГБ |
Що з цього видно одразу. Більшість популярних задач закриває відеокарта на 24 ГБ — це «золота середина» 2026 року (willitrunai, на 22 квітня 2026). Легкий чат, розшифровка мовлення і картинки живуть і на 8–16 ГБ. А от по-справжньому великі моделі (70B) і кілька одночасних користувачів — це вже дві карти, про це нижче.
Окремо про дві часті пари задач. Для агентів (коли ШІ сам ходить по кроках і смикає інструменти) важливіша не швидкість, а довгий контекст і стабільність — тут гарні MoE-моделі на кшталт Qwen3-Coder 30B-A3B (близько 75 ток/с на хорошій карті). А для кодингу є жорстке правило за якістю стиснення: нижче Q4_K_M опускатися не можна. На сильно стиснутих Q2–Q3 модель починає вигадувати неіснуючі команди — для коду це не «трохи гірше», а просто неробочий варіант (craftrigs, на 27 березня 2026).
Чому краще окремий сервер, а не робочий ноутбук
Найчастіша помилка новачка — поставити ШІ на свій основний ноутбук. Для маленьких моделей це працює. Але ноутбук починає грітися, шуміти і швидко садити батарею саме тоді, коли ви працюєте. А додати йому відеопам’яті не можна.
Рішення простіше, ніж здається: окрема машина-сервер плюс легкий ноутбук як «пульт». Потужний комп’ютер із відеокартою стоїть десь у кутку чи в комірчині. Ви до нього підключаєтеся по домашній мережі з будь-якого пристрою — ноутбука, телефона, другого ПК.
Як це працює:
- На сервері запускаєте модель через Ollama (одна команда).
- Поверх ставите Open WebUI — щоб був звичний чат у браузері. Виходить ваш особистий «ChatGPT», доступний усім пристроям у домі.
- Щоб користуватися ним і поза домом, підключаєте Tailscale — це безкоштовна програма, яка створює захищену особисту мережу між вашими пристроями. Не треба нічого «прокидати» в інтернет і розбиратися з налаштуваннями роутера.
Що це дає:
- Ноутбук лишається легким і тихим. Рахує сервер, а на ноутбуці просто відкритий чат. Батарея і кулери не страждають.
- Доступ звідусіль. Один сервер обслуговує робочий ноут, домашній ПК і телефон.
- Апгрейд не чіпає робоче місце. Додати пам’ять чи другу карту можна на сервері, ноутбук при цьому не змінюється.
Мінуси чесні. Треба один раз налаштувати мережу. І сервер витрачає електрику, поки ввімкнений. Але для регулярної роботи це окупається зручністю.
Скільки відеопам’яті потрібно під модель
Головне число при виборі — скільки відеопам’яті займе ваша модель. Рахується просто. Беремо вагу моделі у стисненні Q4_K_M і додаємо трохи на контекст. Ось орієнтир:Розмір моделі Скільки важить (Q4_K_M) Запас на контекст Разом потрібно VRAM 7–8B ~5 ГБ +1 ГБ 8 ГБ 13–14B ~8 ГБ +1,5 ГБ 12 ГБ 32–34B ~20 ГБ +3–4 ГБ 24 ГБ 70B ~40 ГБ +6–8 ГБ 48 ГБ (або 2 карти по 24 ГБ)
Чому так важливо, щоб модель влізла цілком. Якщо пам’яті не вистачає, комп’ютер починає використовувати звичайну системну пам’ять замість відеопам’яті. Вона в рази повільніша. Швидкість падає з комфортних 50–100 ток/с до 2–5 ток/с — це повільніше, ніж друкує людина (computingforgeeks, на 20 червня 2026). Тому брати пам’ять треба із запасом, а не впритул.
Маленька, але важлива порада про звичайну оперативну пам’ять (RAM): її ставте не менше, ніж відеопам’яті, а краще вдвічі більше. Під одну карту на 24 ГБ — 64 ГБ RAM (computingforgeeks, на 20 червня 2026).
Збірки за бюджетом: чотири варіанти
Нижче чотири рівні — від «спробувати» до «домашній сервер». Ціни на відеокарти реальні, з датами. Ціни на решту деталей — приблизний орієнтир роздрібу на червень 2026 (вважайте вилкою ±15%). Гривні пораховані за курсом 44,90 ₴/$.
1. Спробувати — до $500 (до ~22 000 ₴)
Якщо у вас уже є ігровий ПК чи ноутбук із відеокартою на 8–12 ГБ — ви вже готові. Запускайте Ollama і пробуйте моделі 7–14B: чат, легкий кодинг, розшифровку мовлення. Купувати нічого не треба. Це найкращий спосіб зрозуміти, чи потрібен вам локальний ШІ взагалі, перш ніж вкладатися.
2. Одна RTX 3090 — робоча конячка ($1 600–2 100 / 72 000–94 000 ₴)
Найрозумніший вибір для серйозної роботи однієї людини. Одна б/в RTX 3090 на 24 ГБ закриває майже все з таблиці задач: кодинг, агентів, документи, аналітику. Швидкість: легка 8B — близько 119 ток/с, робоча 32B — близько 37–38 ток/с (computingforgeeks, на 20 червня 2026). Якщо ПК уже є і в ньому хороший блок живлення — потрібна тільки сама карта (~$1 000).Що Вибір Ціна ($) Ціна (₴) Відеокарта б/в RTX 3090 24 ГБ 900–1 250 41 500–48 000 Процесор Ryzen 5 7600 ~180 ~8 100 Плата B650 (AM5) ~150 ~6 700 Оперативна пам’ять 64 ГБ DDR5 (2×32) ~160 ~7 200 Блок живлення 850 Вт, 80+ Gold ~110 ~4 900 Накопичувач SSD 1 ТБ NVMe ~70 ~3 100 Корпус + охолодження ATX із хорошим продувом ~120 ~5 400 Разом ~1 690–2 040 ~76 000–92 000
3. Потужніше — дві RTX 3090 або одна RTX 5090 ($2 500–4 500)
Тут розвилка. Потрібна велика модель 70B — берете другу б/в 3090, отримуєте 48 ГБ і тягнете її цілком. Потрібна максимальна швидкість на середніх моделях — одна нова RTX 5090 (32 ГБ): 8B близько 250 ток/с, 32B близько 71 ток/с. У неї два нюанси: ціна кусається через дефіцит пам’яті ($2 900–4 300 за карту), і під неї потрібен новий блок живлення — 575 Вт із роз’ємом 12V-2×6 (computingforgeeks, на 20 червня 2026).
4. Домашній сервер — 4 карти або великий Mac ($5 000+ / від 225 000 ₴)
Для кількох користувачів одразу чи дуже великих моделей. Це чотири відеокарти на серверній платформі, професійна карта на 96 ГБ або Mac Studio з великою пам’яттю. Збірка з кількох карт — окрема тема, вона нижче (і більшості читачів вона не знадобиться).
Які відеокарти NVIDIA брати: не тільки 3090
RTX 3090 звучить найчастіше, бо в неї найкраща ціна за 24 ГБ. Але це не єдиний варіант — у NVIDIA є карти під кожен бюджет. Ось драбина за обсягом пам’яті, щоб було куди маневрувати (ціни — орієнтир на 2026 рік, перед покупкою перевіряйте роздріб).Карта VRAM Під що Орієнтир ціни RTX 4060 Ti 16 ГБ 16 ГБ дешевий вхід, моделі 7–14B ~$400 RTX 5070 Ti 16 ГБ швидкий 16 ГБ нового покоління ~$750 RTX 5080 16 ГБ 16 ГБ + швидкість, дешевше за 4090 ~$1 000 RTX 3090 (б/в) 24 ГБ найкраща ціна за 24 ГБ, є NVLink ~$900–1 250 RTX 4090 24 ГБ ті самі 24 ГБ, але помітно швидше; без NVLink ~$1 400–1 800 RTX 5090 32 ГБ максимум швидкості, 32 ГБ ~$2 900–4 300 NVIDIA RTX A6000 48 ГБ модель 70B на одній карті, пам’ять із захистом ECC ~$2 500–3 500 RTX PRO 6000 96 ГБ 70B із великим запасом, профі-рівень $8 500+
(ціни: bestgpuforllm і craftrigs, 2026)
Що з цього обрати:
- Для входу (7–14B) необов’язково шукати б/в 3090 — підійде нова RTX 4060 Ti 16 ГБ або 5070 Ti. Карта з гарантією і без історії майнінгу.
- У класі 24 ГБ вибір між 3090 (дешевше, є міст NVLink) і 4090 (дорожче, але швидше). Якщо важлива ціна за гігабайт — 3090, якщо швидкість — 4090.
- Для моделі 70B на одній карті є окремий прийом: RTX A6000 з 48 ГБ тримає її цілком, ще й з пам’яттю ECC (пам’ять із корекцією помилок — корисна для довгих обчислень без збоїв). Це альтернатива збірці з двох 3090 — дорожче, зате без мороки з двома картами та їхнім охолодженням.
Для просунутих: сервер на 2–4 відеокарти
Цей розділ можна сміливо пропустити, якщо вам вистачає однієї карти. Він для тих, хто хоче зібрати потужний сервер. Тут же — головна помилка, на якій втрачають гроші.
Головне: друга карта додає пам’ять, а не швидкість
Звучить логічно: «поставлю чотири карти — буде вчетверо швидше». Насправді ні. У звичайному режимі (через llama.cpp — це рушій запуску моделей, на якому працює в тому числі Ollama) модель просто ділиться між картами, і вони працюють по черзі, а не разом. Заміри це підтверджують: велика модель 70B видає одні й ті самі 16–17 ток/с хоч на двох, хоч на чотирьох, хоч на шести картах (craftrigs, на 29 березня 2026).
Тобто зайві карти дають більше пам’яті (можна завантажити модель більшу), але не прискорюють відповідь для однієї людини. Реальний сенс у кількох картах є тільки у двох випадках:
- Кілька користувачів одночасно. Якщо сервером користується команда, рушій vLLM роздає запити по картах паралельно. На чотирьох користувачах він видає 28 ток/с проти 12 у звичайної Ollama — майже в 2,3 раза більше (craftrigs, на 19 квітня 2026).
- Дуже велика модель, яка не влазить в одну карту. Тоді кілька карт потрібні просто щоб її вмістити.
Висновок: беріть другу карту заради пам’яті під 70B або заради команди. Але не чекайте, що особисто ваш чат стане вдвічі швидшим.
Живлення й електрика
Відеокарта RTX 3090 на папері споживає 350 Вт, але в реальності під навантаженням бере 380–420 Вт. Звідси вимоги до блока живлення:Скільки карт Реальне споживання Потрібен блок живлення 1× RTX 3090 ~750–850 Вт 850 Вт 2× RTX 3090 ~1 100–1 300 Вт 1 200–1 500 Вт 4× RTX 3090 ~1 750–2 100 Вт 2 000 Вт
(craftrigs + computingforgeeks, на 20–29 червня 2026)
Є чудовий прийом — андервольт, тобто м’яке зниження напруги і споживання карти. Якщо обмежити кожну 3090 до 220 Вт, чотири карти разом їстимуть близько 880 Вт замість 1 750, а швидкість майже не впаде (craftrigs, на 29 березня 2026). Це одразу вирішує три проблеми: менший рахунок за електрику, менше спеки в кімнаті, і вистачає одного блока живлення. Андервольт під кілька карт роблять одразу, це нормальна практика.
Корпус і охолодження
Межа проходить між трьома і чотирма картами. Три RTX 3090 ще вміщуються у великий звичайний корпус за хорошого продуву (щонайменше три вентилятори на вдув). Чотири — це вже або відкрита рама (як у майнерів), або обов’язковий андервольт, інакше карти перегріваються (craftrigs, на 29 березня 2026).
Окрема проблема — товщина карт. Сучасні 3090 займають по 2,5–3 слоти і, поставлені впритул, «варять» одна одну. Тому карти розносять на подовжувачах PCIe (райзерах) або ставлять у відкриту раму. Важлива відмінність від майнінгу: для ШІ не можна економити на швидкості роз’єму. Майнерські райзери на одну лінію тут не годяться — картам потрібна повна швидкість лінії PCIe (x8 або x16), інакше обмін даними між ними стане вузьким місцем.
Докладний розбір саме пари карт із мостом NVLink — у нашому огляді збірки на 2× RTX 3090.
AMD дешевше за NVIDIA — але є нюанс
Карти AMD дають стільки ж відеопам’яті помітно дешевше. Але ви платите за це часом на налаштування. У NVIDIA весь софт для ШІ працює одразу «з коробки» (технологія називається CUDA). У AMD аналог (ROCm) теж працює, але налаштовується довше і переважно на Linux.
Два варіанти:
- RX 7900 XTX — 24 ГБ, дешевша за нову NVIDIA того ж класу. За швидкістю на невеликих моделях тримається в одному класі з б/в 3090. Мінус — морока з налаштуванням під Linux. Докладно цей шлях ми розібрали в огляді RX 7900 XTX для локального ШІ.
- AMD Instinct MI50 на 32 ГБ — найдешевший спосіб отримати аж 32 ГБ відеопам’яті, близько $210 за карту (eBay, на 22 жовтня 2025; ціну варто перевірити — дані старі). Але це серверна карта без нормального охолодження для домашнього ПК. Без саморобного обдуву вона перегрівається. Варіант для ентузіаста, який любить повозитися.
Просте правило: дорогий час — беріть NVIDIA, дорогий бюджет і не лякає вечір налаштування — дивіться на AMD.
Коли краще Mac чи міні-ПК, а не збірка
Іноді збирати ПК взагалі не потрібно. Є готові компактні пристрої з великою спільною пам’яттю (її називають unified memory — це пам’ять, яку ділять процесор і графіка).
Mac із чипом M4 Max і 128 ГБ пам’яті (MacBook Pro або Mac Studio) вміщує навіть модель 70B. Швидкість на ній скромна (близько 10 ток/с), зате на середніх моделях усе жваво: 30B — близько 28 ток/с. Але головний козир — споживання: 30–50 Вт проти 600–900 Вт у збірки на відеокартах (astrolexis, на 21 травня 2026). Для фрилансера, у якого машина працює цілими днями, це серйозна економія на електриці. Мінус — Mac дорогий, і на однаковій моделі збірка на NVIDIA все ж швидша.
Strix Halo (міні-ПК на чипі Ryzen AI Max+ 395, 128 ГБ) — тиха компактна коробка. На легких MoE-моделях швидка, пам’яті вистачає на великий контекст. На щільній 70B повільна — це покупка заради обсягу, а не швидкості. Важливо про ціну. Флагманські бокси Strix Halo коштували близько $2 000 на старті у 2025-му, але до травня 2026 подорожчали приблизно до $3 300 через дефіцит пам’яті. Якщо бюджет обмежений, найдешевший вхід у платформу — Framework Desktop від ~$2 000. Докладно, з цифрами швидкості — у нашому огляді Ryzen AI Max+ 395.
Просте правило: велика спільна пам’ять (Mac, Strix Halo) — це про обсяг і тишу, окрема відеокарта — про швидкість.
Ціни на українському ринку
Раз героїня більшості збірок — б/в RTX 3090, на неї і подивимося. За даними на червень 2026:
- У магазині з гарантією (serverparts.com.ua) б/в RTX 3090 на 24 ГБ коштує 41 500–48 000 ₴ (на 6–11 червня 2026). Це приблизно $925–1 070.
- З рук на OLX можна знайти від 26 500 ₴ — дешевше за магазин на 40% і більше. Але й ризик інший: немає гарантії, невідома історія карти.
- Для порівняння, у США така карта коштує $900–1 250. Тобто український магазинний цінник приблизно збігається з американським.
Курс для перерахунку — 44,90 ₴/$ (НБУ, на 23 червня 2026). Ціни на б/в відеокарти скачуть: навесні 2026 був дефіцит пам’яті, і 3090 помітно подорожчали. Тому завжди перевіряйте цінник на день покупки.
Безпека і ризики
Короткий, але важливий розділ — про гроші і про чужий доступ до вашої машини.
- Не відкривайте Ollama в інтернет без захисту. Якщо виставити сервер назовні без пароля, будь-хто зможе безкоштовно ганяти на вашій відеокарті свої запити. Звучить як рідкість, але це масово: дослідники нарахували 175 108 відкритих Ollama-серверів по всьому світу (SentinelLABS і Censys, на 29 січня 2026). Рішення просте — не «прокидати» порт в інтернет, а користуватися Tailscale (див. розділ про сервер вище).
- Не беріть пам’ять впритул. Якщо модель не влізла, швидкість падає в десятки разів. Завжди лишайте запас.
- Не чекайте від кількох карт прискорення. Зайві карти дають пам’ять, а не швидкість одного запиту. Це головна помилка при дорогих збірках.
- Перевіряйте б/в відеокарту. Багато 3090 пройшли роки майнінгу. Дивіться температури під навантаженням, стан термопрокладок, відсутність слідів ремонту. Магазинна гарантія на три місяці тут не зайва.
- Для коду не беріть надто стиснуті моделі. Нижче Q4_K_M якість коду руйнується — модель починає вигадувати команди.
Підсумок: що зібрати під ваш випадок
Щоб не ламати голову — ось готові рецепти. Логіка завжди одна: задача → розмір моделі → відеопам’ять → залізо. Знайдіть свій випадок і беріть.
- «Хочу просто спробувати, без витрат». Поставте Ollama на той ПК чи ноутбук, що вже є. Якщо відеокарта на 8 ГБ і більше — запускайте модель 7–14B (чат, легкий кодинг). Так ви зрозумієте, чи потрібен вам локальний ШІ, перш ніж вкладати гроші. Безкоштовно.
- «Кодинг або тексти, один користувач». Одна б/в RTX 3090 на 24 ГБ (~$1 000 / 42 000–48 000 ₴). Запускаєте Qwen2.5-Coder-32B через Ollama — цього вистачає на кодинг, тексти і документи. Хочете карту з гарантією і без майнінг-історії — візьміть нову RTX 5070 Ti або 4060 Ti на 16 ГБ під моделі менші.
- «Автономні агенти, довгі задачі». Та сама RTX 3090 на 24 ГБ, але модель беріть MoE — наприклад, Qwen3-Coder 30B-A3B, і піднімайте сервер на vLLM (він краще тримає ланцюжки і кілька запитів).
- «Потрібна велика модель 70B». Два шляхи. Простіше — одна RTX A6000 на 48 ГБ: тримає 70B цілком, без мороки з двома картами (~$2 500–3 500). Дешевше — дві б/в RTX 3090 (48 ГБ), але налаштування складніше. Деталі пари карт — в огляді збірки на 2× 3090 вище.
- «Кілька людей або невелика команда». Кілька карт плюс сервер на vLLM — він роздає запити паралельно. Ось тут зайві карти реально працюють (на відміну від одиночного чату). Не забудьте про андервольт і живлення.
- «Важлива тиша, мало місця чи дорога електроенергія». Mac з M4 Max і 128 ГБ або міні-ПК Strix Halo. Дорожче за збірку, зате 30–50 Вт замість 600–900 і жодного шуму. Для того, хто працює цілими днями, економія на електриці відчутна.
- «Мінімум грошей, готовий повозитися». AMD: RX 7900 XTX (24 ГБ) або MI50 (32 ГБ). Та сама пам’ять дешевше, але закладіть вечір на налаштування під Linux.
І одна загальна порада для всіх. Піднімайте ШІ як окремий сервер (Ollama + Open WebUI + Tailscale), а не на робочому ноутбуці. Тоді машина рахує десь у кутку, а ви підключаєтеся до неї з будь-якого легкого пристрою. І одразу налаштуйте доступ через Tailscale — не відкривайте сервер в інтернет напряму.
Якщо ж вибір між готовими пристроями все ще не очевидний, порівняйте їх за пам’яттю і швидкістю в окремому гіді (посилання на початку статті), а потім повертайтеся до збірки.
FAQ
Чи можна запустити локальний ШІ на ігровому ноутбуці? Так. Ноутбук із відеокартою на 8–16 ГБ потягне моделі 7–14B — цього вистачає для чату і легкого кодингу. Проблема не в тому, що «не запуститься», а в зручності: під навантаженням ноутбук гріється, шумить і садить батарею. Для регулярної роботи краще винести модель на окремий сервер і підключатися до нього з того ж ноутбука.
Який мінімальний бюджет, щоб кодити локально майже як у хмарі? Одна б/в RTX 3090 на 24 ГБ (близько $1 000, або 41 500–48 000 ₴ в Україні на червень 2026) запускає сильну модель для коду Qwen2.5-Coder-32B зі швидкістю близько 37–38 ток/с (Ollama, на березень 2026). За якістю вона близька до хмарних помічників для більшості повсякденних задач. Якщо ПК уже є, потрібна тільки карта.
Чим локальний ШІ кращий за ChatGPT? Головне — приватність і відсутність підписки. Дані не йдуть на чужі сервери, і немає щомісячної плати. Мінус — топові хмарні моделі поки розумніші. Тому локальний ШІ беруть там, де важливі конфіденційність, великий обсяг роботи чи незалежність від сервісу, а не заради «обігнати ChatGPT за розумом».
Скільки електрики з’їсть збірка на 4 відеокарти? Без оптимізації — близько 1 750–2 100 Вт під навантаженням, це помітний рахунок за роботи цілими днями. Якщо застосувати андервольт (обмежити кожну карту до 220 Вт), споживання падає приблизно до 880 Вт, а швидкість майже не страждає. Тому андервольт на багатокарткових збірках роблять одразу.
Чи вистачить 12 ГБ відеопам’яті? Для старту — так. На 12 ГБ працюють моделі 7–14B: чат, легкий кодинг, розшифровка мовлення, картинки. Але робочі моделі для коду (32B) уже не влізуть — їм потрібна карта на 24 ГБ. Якщо плануєте серйозний кодинг чи агентів, 12 ГБ стануть тісними швидко.



