Как выбрать железо для локального ИИ в 2026: гид по GPU, Mac и мини-ПК

16 мин. чтения
Bybit
SpaceX за крипту
Дробные доли · 24/7
Открыть рынок →

Коротко (TL;DR)

Железо для локального ИИ выбирается не «какая видеокарта мощнее», а по простому алгоритму: сначала модель — потом железо. Определите, какие модели вам нужны (7–14B / 32B / 70B / 200B+) и какой контекст — это задаёт минимум памяти. Затем в рамках бюджета берите максимум пропускной способности под этот объём. И только потом выбирайте экосистему (NVIDIA/CUDA против альтернатив) — по готовности возиться с софтом.

Две вещи путают чаще всего. Ёмкость памяти решает, что вообще влезет; пропускная способность — как быстро пойдут токены. Это разные оси: 128 ГБ unified-памяти вмещают огромную модель, но на скромной пропускной способности плотная 70B будет ползти. А если модель не влезла и «потекла» в системную RAM — скорость обваливается с комфортных 50–100 до 2–5 токенов/с.

Ниже — этот алгоритм по шагам, мастер-таблица всех актуальных решений 2026 (от $250 до $8 500+) и конкретные рекомендации по бюджету и задаче. Каждое решение — со ссылкой на детальный разбор серии, если захотите углубиться.

(Данные актуальны на 16 июня 2026; цены и характеристики — с датами в тексте.)

SpaceX · xStockSpaceX — частная компания. Торгуй её токеном на Bybit за крипту.Торговать SpaceX →

С чего начать: алгоритм выбора

Не начинайте с бренда или «топовой» карты. Начните с трёх вопросов по порядку — они отсекают лишнее быстрее всего.

  1. Какие модели и какой контекст? Это определяет минимум памяти. Грубый ориентир: 7–8B комфортно живут в 12 ГБ, 14B — в 16–24 ГБ, 32B в квантовании — в 24 ГБ, плотная 70B в 4-бит просит ~40–48 ГБ, а frontier-модели 200B–671B требуют unified-память на 128–512 ГБ. Учтите контекст: у 8B-модели каждые 1000 токенов диалога — это ещё ~134 МБ памяти под KV-кэш, а окно 32K добавляет почти полгигабайта сверх весов.
  2. Сколько пропускной способности даёт бюджет под этот объём? Когда модель уже влезла, именно пропускная способность памяти определяет скорость генерации. Берите максимум ПС, который позволяет бюджет при нужной ёмкости.
  3. Готовы ли вы к экосистеме без CUDA? NVIDIA работает «из коробки» везде; Apple (MLX/Metal), AMD (ROCm) и Intel (Vulkan/SYCL) дают ёмкость или цену, но требуют усилий по настройке.

Пример. Цель — приватный кодинг-ассистент на Qwen 32B с контекстом 16K. Шаг 1: 32B в квантовании просит ~24 ГБ плюс запас под контекст — значит, минимум 24 ГБ. Шаг 2: в бюджете до $900 максимум пропускной способности при 24 ГБ даёт б/у RTX 3090 (936 ГБ/с) — она быстрее, чем мини-бокс на 128 ГБ, которого тут и не нужно. Шаг 3: на NVIDIA весь софт заведётся сразу. Итог — RTX 3090, а не «самая дорогая» карта и не «самый вместительный» бокс. Тот же алгоритм одинаково отсекает лишнее и для 8B-чата, и для frontier-модели.

Этот порядок — память → скорость → экосистема — экономит и деньги, и нервы: он не даёт купить быстрый, но маловместительный GPU под большую модель или вместительный, но медленный бокс под скоростную задачу.

Две оси: ёмкость и скорость

Главная путаница новичка — мерить железо «мощностью чипа». Для текстовой генерации это вторично. Работают две независимые оси.

Ёмкость (что влезет). Веса модели, KV-кэш контекста и промежуточные вычисления должны целиком поместиться в быструю память — видеопамять GPU или unified-память. Не поместились — система выгружает часть в медленную системную RAM, и наступает «обрыв»: скорость падает с 50–100 до 2–5 токенов/с, медленнее, чем печатает человек. Именно поэтому «впритык» по памяти хуже, чем кажется: один шаг за лимит — и производительность рушится.

Скорость (как быстро). Когда модель загружена, генерация каждого токена — это прокачка всех нужных весов из памяти в вычислительные ядра. Поэтому скорость почти линейно зависит от пропускной способности памяти, а не от «силы» чипа. Условная лестница ПС: Strix Halo и DGX Spark — ~256–273 ГБ/с, Intel Arc B580 — 456, Mac M4 Max — 546, Mac M3 Ultra — 819, б/у RTX 3090 — 936, RX 7900 XTX — 960, RTX 5090 и RTX PRO 6000 — 1 792 ГБ/с. Чем выше — тем быстрее идут токены на влезающей модели.

Отсюда практическое следствие: unified-память — это про ёмкость, дискретный GPU с высокой ПС — про скорость. 128 ГБ в мини-боксе позволяют загрузить модель, которую не вместит ни одна потребительская видеокарта, — но плотная 70B на 256 ГБ/с пойдёт ~2–4 ток/с. Зато MoE-модели (где на каждый токен активна лишь часть параметров) на той же машине летают: gpt-oss-120B выдаёт ~30 ток/с. Это и есть «MoE-разворот», который меняет расчёт для unified-боксов.

SpaceX · xStockSpaceX — частная компания. Торгуй её токеном на Bybit за крипту.Торговать SpaceX →

Мастер-таблица: решения 2026

Все актуальные пути для домашнего инференса, от самого дешёвого входа до frontier-ёмкости. Цены и характеристики — на июнь 2026; по клику на решение — детальный разбор.

РешениеПамятьПС, ГБ/сЦенаПод что
Intel Arc B58012 ГБ456$250самый дешёвый вход, 7–14B
б/у RTX 309024 ГБ936~$70024-ГБ sweet spot, есть NVLink
AMD RX 7900 XTX24 ГБ960~$80024 ГБ на AMD/ROCm, Linux
Сборка 2× RTX 309048 ГБ936~$2 50070B бюджетно через NVLink
Mac Mini M4 Proдо 64 ГБ273$1 400–2 400дешёвый вход в unified
Framework Desktop128 ГБ256~$2 000MoE + контекст, DIY/кластер
NVIDIA DGX Spark128 ГБ273$4 699CUDA-стек на 128 ГБ
Сборка на RTX 509032 ГБ1 792~$4 500максимум скорости ≤32 ГБ
Воркстейшн RTX PRO 600096 ГБ1 792$8 500+70B в FP8 на одной карте
Mac Studio M3 Ultraдо 512 ГБ819от $4 000200B–671B дома

База всех мини-боксов на 128 ГБ — чип AMD Ryzen AI Max+ 395 (Strix Halo); как он работает и что тянет, разобрано в базовой статье серии.

Каждая строка таблицы — это отдельный детальный обзор серии: токеномика скорости, BOM сборки, реальные бенчмарки и честные риски конкретного решения. Этот гид — карта, по которой выбираете направление; обзор устройства — глубокое погружение в выбранное. Если уже знаете свой бюджет и задачу, переходите сразу в нужный разбор; если нет — пройдите два раздела ниже.

Видеопамять/ёмкость по решениям 2026, ГБ

Выбор по бюджету

До $300 — попробовать. Intel Arc B580 (12 ГБ, $250) — самый дешёвый серьёзный вход: тянет 7–8B и 14B в квантовании на уровне RTX 3060. Главная сложность не в карте, а в софте Intel (стандартный Ollama не ускоряет Arc). Альтернатива — б/у RTX 3060 12 ГБ с зрелой CUDA.

$700–900 — золотая середина. Класс 24 ГБ: б/у RTX 3090 (с NVLink) или новая RX 7900 XTX. 24 ГБ стали «магической цифрой» сегмента — держат 13B целиком, 32B в квантовании и 70B в 4-бит с частичной выгрузкой. NVIDIA проще в софте, AMD дешевле и новее, но на Linux и ROCm.

$2 000–2 800 — ёмкость или мощная одиночная карта. Здесь развилка. Нужна ёмкость под MoE и большой контекст — мини-бокс на 128 ГБ (Framework Desktop, ~$2 000) или Mac Mini M4 Pro (до 64 ГБ unified, $1 400–2 400) как мягкий вход в экосистему Apple. Нужна скорость — в этот бюджет влезает одиночная RTX 5090 (~$2 200–2 500), если есть куда её поставить; полная сборка на ней — уже следующий тир.

$4 000+ — профессиональный уровень. Mac Studio M3 Ultra (до 512 ГБ) — единственный готовый домашний путь к моделям 200B–671B (альтернатива — кластер мини-боксов). DGX Spark ($4 699) — те же 128 ГБ, но с полным стеком CUDA. Полная сборка на RTX 5090 (~$4 500) даёт максимум скорости на моделях ≤32 ГБ. А RTX PRO 6000 (96 ГБ ECC, $8 500+) грузит 70B в высокой точности на одной карте без мультикарты.

Когда покупка не нужна. Если тяжёлые модели нужны лишь изредка, железо дешевле арендовать в облаке, чем покупать: дорогая карта «отбивается» только при постоянной загрузке. Покупка локального железа оправдана приватностью данных, отсутствием абонентской платы и регулярным использованием — для разовых прогонов почасовая аренда GPU почти всегда выгоднее.

Выбор по задаче

Бюджет — половина решения; вторая половина — что именно вы будете запускать.

  • Чат и кодинг на 7–14B. Хватит 12–24 ГБ: Arc B580 для минимума, 24-ГБ карта для запаса. Скорость тут высокая на любой из них.
  • Модели 32B. Нужны 24 ГБ (в квантовании) — RTX 3090/4090 или RX 7900 XTX; для максимума скорости — RTX 5090.
  • Плотная 70B в высокой точности. Либо 96-ГБ RTX PRO 6000 на одной карте, либо сборка 2× RTX 3090 (48 ГБ, бюджетно), либо Mac Studio (медленнее, но проще).
  • Frontier-модели 200B–671B. Только unified-память: Mac Studio M3 Ultra (512 ГБ) или кластер из мини-боксов.
  • MoE-модели и длинный контекст. Мини-боксы на 128 ГБ (Framework/DGX Spark): на MoE они быстры, а ёмкости хватает под большой контекст.
  • Нужен CUDA и зрелый софт. NVIDIA в любом виде (5090, PRO 6000, DGX Spark) — всё «просто работает»; альтернативы дешевле, но с настройкой.

Определились с железом, но хотите не просто купить устройство, а собрать машину и поднять домашний ИИ-сервер под свой рабочий процесс — с разбором многокарточной сборки, охлаждения, питания и цен украинского рынка? Это в отдельном разборе: как собрать локальный ИИ-ПК под задачу и бюджет.

Софт и экосистема: скрытая цена альтернатив

Характеристики — половина дела; вторая половина — стек инференса. Здесь NVIDIA берёт зрелостью, а альтернативы — ценой и ёмкостью.

  • NVIDIA / CUDA — золотой стандарт: llama.cpp, Ollama, vLLM, LM Studio работают из коробки и на Windows, и на Linux. Платите за это ценой карты, зато софт предсказуем.
  • Apple / MLX и Metal — зрело и энергоэффективно; unified-память убирает «налог» на копирование тензоров по PCIe. Но на равном размере модели NVIDIA быстрее в сыром throughput, а часть инструментов под Apple адаптируют позже.
  • AMD / ROCm — догнал в ветке 6.x: Ollama, llama.cpp, vLLM заводятся, но чистая установка занимает часы против минут на CUDA, а Windows-поддержка ещё сырая — Linux де-факто обязателен.
  • Intel Arc / Vulkan, SYCL — самый дешёвый вход, но главная ловушка именно в софте: стандартный Ollama не ускоряет Arc (молча считает на CPU), нужен llama.cpp с Vulkan/SYCL или LM Studio.

Вывод простой: если время дороже денег и нужен предсказуемый софт — переплата за NVIDIA окупается. Если бюджет жёсткий и не пугает вечер настройки — альтернативы дают ту же память заметно дешевле.

Частые ошибки и риски

Чего стоит избегать при выборе (с датами):

  • Недокупить память. Если модель или контекст не влезают, данные уходят в системную RAM, и скорость падает с 50–100 до 2–5 ток/с — медленнее процессора. Берите объём с запасом под контекст (vc.ru/decodesfuture, 2026).
  • Перепутать ёмкость и скорость. 128 ГБ unified не значит «быстро»: на плотных моделях решает пропускная способность, а у мини-боксов она втрое-всемеро ниже, чем у дискретных GPU (terminalbytes, 2026).
  • Забыть про экосистему. Дешёвая ёмкость на AMD/Intel/Apple идёт с возней по софту: нет CUDA, а ROCm/SYCL/MLX требуют настройки. Заложите на это время (sitepoint, 2026).
  • Игнорировать тип модели. Под unified-бокс берите MoE-модели (быстры), а не плотные 70B (медленны ~2–4 ток/с); для плотных нужна высокая ПС (r/LocalLLaMA, 2026).
  • Купить «на вырост» не туда. Вместительный, но медленный бокс не станет быстрым GPU, а быстрый 32-ГБ GPU не вместит 70B. Сначала задача — потом железо.

FAQ

Сколько видеопамяти нужно для локального LLM? Зависит от модели: 7–8B комфортно в 12 ГБ, 14B — в 16–24 ГБ, 32B в квантовании — в 24 ГБ, плотная 70B в 4-бит — ~40–48 ГБ, frontier-модели 200B+ — 128–512 ГБ unified. Плюс запас под контекст: длинные сессии съедают память KV-кэшем. Брать стоит с запасом — выход за лимит обваливает скорость.

Что важнее для скорости — мощность чипа или память? Пропускная способность памяти. После загрузки модели генерация каждого токена — это прокачка весов из памяти, поэтому скорость почти линейно зависит от ПС, а не от «силы» чипа. Поэтому б/у RTX 3090 (936 ГБ/с) на влезающей модели часто быстрее, чем мини-бокс на 128 ГБ (256 ГБ/с).

GPU или Mac для локального ИИ? Mac (unified-память) берут ради ёмкости задёшево — он вмещает большие модели, которые не влезут в потребительскую видеокарту. Дискретный NVIDIA-GPU берут ради скорости и зрелого CUDA. Грубо: нужна ёмкость под крупные/MoE-модели — Mac или мини-бокс; нужна максимальная скорость на моделях ≤32 ГБ — RTX.

Можно ли запускать 70B локально и на чём? Да. Варианты: RTX PRO 6000 (96 ГБ, плотная 70B в FP8 на одной карте), сборка 2× RTX 3090 (48 ГБ, бюджетно через NVLink), мини-бокс на 128 ГБ или Mac Studio (вместят, но плотная генерация медленнее). Одна карта на 24 ГБ 70B целиком не держит — только с частичной выгрузкой и падением скорости.

Стоит ли брать мини-ПК на 128 ГБ (Strix Halo) под ИИ? Да, если вам нужны MoE-модели и большой контекст за разумные деньги. На MoE такие боксы быстры (gpt-oss-120B ~30 ток/с), а 128 ГБ дают ёмкость, недоступную видеокартам. Но плотные 70B на них медленные (~2–4 ток/с): это покупка ради вместимости, а не скорости.

Bybit
SpaceX за крипту
Дробные доли · 24/7
Открыть рынок →
Поделиться
Связаться:
Крипто- и data-аналитик, инженер-программист (факультет компьютерных наук ХНУРЭ). В IT с 2008 года: администрировал корпоративный мониторинг в «Vodafone Украина», семь лет разрабатывал и продвигал веб-проекты, пять лет руководил маркетингом на метриках — конверсия, CTR, ROI, LTV.Криптовалютными рынками занимаюсь с 2021 года: ончейн-метрики, токеномика, макроэкономические индикаторы. Разработал собственную data-driven модель анализа рынка на 30+ метрик. Стек — Python (pandas, NumPy, SciPy, matplotlib), математическая статистика и EDA; сбор и сверку данных автоматизирую AI-агентами.Принцип — «Don't trust, verify»: каждая цифра проверена по первоисточнику, ключевые — минимум по двум независимым; прогнозы — только сценарии с условиями. Тезис без данных не публикуется.