Коротко (TL;DR)
Железо для локального ИИ выбирается не «какая видеокарта мощнее», а по простому алгоритму: сначала модель — потом железо. Определите, какие модели вам нужны (7–14B / 32B / 70B / 200B+) и какой контекст — это задаёт минимум памяти. Затем в рамках бюджета берите максимум пропускной способности под этот объём. И только потом выбирайте экосистему (NVIDIA/CUDA против альтернатив) — по готовности возиться с софтом.
Две вещи путают чаще всего. Ёмкость памяти решает, что вообще влезет; пропускная способность — как быстро пойдут токены. Это разные оси: 128 ГБ unified-памяти вмещают огромную модель, но на скромной пропускной способности плотная 70B будет ползти. А если модель не влезла и «потекла» в системную RAM — скорость обваливается с комфортных 50–100 до 2–5 токенов/с.
Ниже — этот алгоритм по шагам, мастер-таблица всех актуальных решений 2026 (от $250 до $8 500+) и конкретные рекомендации по бюджету и задаче. Каждое решение — со ссылкой на детальный разбор серии, если захотите углубиться.
(Данные актуальны на 16 июня 2026; цены и характеристики — с датами в тексте.)
С чего начать: алгоритм выбора
Не начинайте с бренда или «топовой» карты. Начните с трёх вопросов по порядку — они отсекают лишнее быстрее всего.
- Какие модели и какой контекст? Это определяет минимум памяти. Грубый ориентир: 7–8B комфортно живут в 12 ГБ, 14B — в 16–24 ГБ, 32B в квантовании — в 24 ГБ, плотная 70B в 4-бит просит ~40–48 ГБ, а frontier-модели 200B–671B требуют unified-память на 128–512 ГБ. Учтите контекст: у 8B-модели каждые 1000 токенов диалога — это ещё ~134 МБ памяти под KV-кэш, а окно 32K добавляет почти полгигабайта сверх весов.
- Сколько пропускной способности даёт бюджет под этот объём? Когда модель уже влезла, именно пропускная способность памяти определяет скорость генерации. Берите максимум ПС, который позволяет бюджет при нужной ёмкости.
- Готовы ли вы к экосистеме без CUDA? NVIDIA работает «из коробки» везде; Apple (MLX/Metal), AMD (ROCm) и Intel (Vulkan/SYCL) дают ёмкость или цену, но требуют усилий по настройке.
Пример. Цель — приватный кодинг-ассистент на Qwen 32B с контекстом 16K. Шаг 1: 32B в квантовании просит ~24 ГБ плюс запас под контекст — значит, минимум 24 ГБ. Шаг 2: в бюджете до $900 максимум пропускной способности при 24 ГБ даёт б/у RTX 3090 (936 ГБ/с) — она быстрее, чем мини-бокс на 128 ГБ, которого тут и не нужно. Шаг 3: на NVIDIA весь софт заведётся сразу. Итог — RTX 3090, а не «самая дорогая» карта и не «самый вместительный» бокс. Тот же алгоритм одинаково отсекает лишнее и для 8B-чата, и для frontier-модели.
Этот порядок — память → скорость → экосистема — экономит и деньги, и нервы: он не даёт купить быстрый, но маловместительный GPU под большую модель или вместительный, но медленный бокс под скоростную задачу.
Две оси: ёмкость и скорость
Главная путаница новичка — мерить железо «мощностью чипа». Для текстовой генерации это вторично. Работают две независимые оси.
Ёмкость (что влезет). Веса модели, KV-кэш контекста и промежуточные вычисления должны целиком поместиться в быструю память — видеопамять GPU или unified-память. Не поместились — система выгружает часть в медленную системную RAM, и наступает «обрыв»: скорость падает с 50–100 до 2–5 токенов/с, медленнее, чем печатает человек. Именно поэтому «впритык» по памяти хуже, чем кажется: один шаг за лимит — и производительность рушится.
Скорость (как быстро). Когда модель загружена, генерация каждого токена — это прокачка всех нужных весов из памяти в вычислительные ядра. Поэтому скорость почти линейно зависит от пропускной способности памяти, а не от «силы» чипа. Условная лестница ПС: Strix Halo и DGX Spark — ~256–273 ГБ/с, Intel Arc B580 — 456, Mac M4 Max — 546, Mac M3 Ultra — 819, б/у RTX 3090 — 936, RX 7900 XTX — 960, RTX 5090 и RTX PRO 6000 — 1 792 ГБ/с. Чем выше — тем быстрее идут токены на влезающей модели.
Отсюда практическое следствие: unified-память — это про ёмкость, дискретный GPU с высокой ПС — про скорость. 128 ГБ в мини-боксе позволяют загрузить модель, которую не вместит ни одна потребительская видеокарта, — но плотная 70B на 256 ГБ/с пойдёт ~2–4 ток/с. Зато MoE-модели (где на каждый токен активна лишь часть параметров) на той же машине летают: gpt-oss-120B выдаёт ~30 ток/с. Это и есть «MoE-разворот», который меняет расчёт для unified-боксов.
Мастер-таблица: решения 2026
Все актуальные пути для домашнего инференса, от самого дешёвого входа до frontier-ёмкости. Цены и характеристики — на июнь 2026; по клику на решение — детальный разбор.Решение Память ПС, ГБ/с Цена Под что Intel Arc B580 12 ГБ 456 $250 самый дешёвый вход, 7–14B б/у RTX 3090 24 ГБ 936 ~$700 24-ГБ sweet spot, есть NVLink AMD RX 7900 XTX 24 ГБ 960 ~$800 24 ГБ на AMD/ROCm, Linux Сборка 2× RTX 3090 48 ГБ 936 ~$2 500 70B бюджетно через NVLink Mac Mini M4 Pro до 64 ГБ 273 $1 400–2 400 дешёвый вход в unified Framework Desktop 128 ГБ 256 ~$2 000 MoE + контекст, DIY/кластер NVIDIA DGX Spark 128 ГБ 273 $4 699 CUDA-стек на 128 ГБ Сборка на RTX 5090 32 ГБ 1 792 ~$4 500 максимум скорости ≤32 ГБ Воркстейшн RTX PRO 6000 96 ГБ 1 792 $8 500+ 70B в FP8 на одной карте Mac Studio M3 Ultra до 512 ГБ 819 от $4 000 200B–671B дома
База всех мини-боксов на 128 ГБ — чип AMD Ryzen AI Max+ 395 (Strix Halo); как он работает и что тянет, разобрано в базовой статье серии.
Каждая строка таблицы — это отдельный детальный обзор серии: токеномика скорости, BOM сборки, реальные бенчмарки и честные риски конкретного решения. Этот гид — карта, по которой выбираете направление; обзор устройства — глубокое погружение в выбранное. Если уже знаете свой бюджет и задачу, переходите сразу в нужный разбор; если нет — пройдите два раздела ниже.
Выбор по бюджету
До $300 — попробовать. Intel Arc B580 (12 ГБ, $250) — самый дешёвый серьёзный вход: тянет 7–8B и 14B в квантовании на уровне RTX 3060. Главная сложность не в карте, а в софте Intel (стандартный Ollama не ускоряет Arc). Альтернатива — б/у RTX 3060 12 ГБ с зрелой CUDA.
$700–900 — золотая середина. Класс 24 ГБ: б/у RTX 3090 (с NVLink) или новая RX 7900 XTX. 24 ГБ стали «магической цифрой» сегмента — держат 13B целиком, 32B в квантовании и 70B в 4-бит с частичной выгрузкой. NVIDIA проще в софте, AMD дешевле и новее, но на Linux и ROCm.
$2 000–2 800 — ёмкость или мощная одиночная карта. Здесь развилка. Нужна ёмкость под MoE и большой контекст — мини-бокс на 128 ГБ (Framework Desktop, ~$2 000) или Mac Mini M4 Pro (до 64 ГБ unified, $1 400–2 400) как мягкий вход в экосистему Apple. Нужна скорость — в этот бюджет влезает одиночная RTX 5090 (~$2 200–2 500), если есть куда её поставить; полная сборка на ней — уже следующий тир.
$4 000+ — профессиональный уровень. Mac Studio M3 Ultra (до 512 ГБ) — единственный готовый домашний путь к моделям 200B–671B (альтернатива — кластер мини-боксов). DGX Spark ($4 699) — те же 128 ГБ, но с полным стеком CUDA. Полная сборка на RTX 5090 (~$4 500) даёт максимум скорости на моделях ≤32 ГБ. А RTX PRO 6000 (96 ГБ ECC, $8 500+) грузит 70B в высокой точности на одной карте без мультикарты.
Когда покупка не нужна. Если тяжёлые модели нужны лишь изредка, железо дешевле арендовать в облаке, чем покупать: дорогая карта «отбивается» только при постоянной загрузке. Покупка локального железа оправдана приватностью данных, отсутствием абонентской платы и регулярным использованием — для разовых прогонов почасовая аренда GPU почти всегда выгоднее.
Выбор по задаче
Бюджет — половина решения; вторая половина — что именно вы будете запускать.
- Чат и кодинг на 7–14B. Хватит 12–24 ГБ: Arc B580 для минимума, 24-ГБ карта для запаса. Скорость тут высокая на любой из них.
- Модели 32B. Нужны 24 ГБ (в квантовании) — RTX 3090/4090 или RX 7900 XTX; для максимума скорости — RTX 5090.
- Плотная 70B в высокой точности. Либо 96-ГБ RTX PRO 6000 на одной карте, либо сборка 2× RTX 3090 (48 ГБ, бюджетно), либо Mac Studio (медленнее, но проще).
- Frontier-модели 200B–671B. Только unified-память: Mac Studio M3 Ultra (512 ГБ) или кластер из мини-боксов.
- MoE-модели и длинный контекст. Мини-боксы на 128 ГБ (Framework/DGX Spark): на MoE они быстры, а ёмкости хватает под большой контекст.
- Нужен CUDA и зрелый софт. NVIDIA в любом виде (5090, PRO 6000, DGX Spark) — всё «просто работает»; альтернативы дешевле, но с настройкой.
Определились с железом, но хотите не просто купить устройство, а собрать машину и поднять домашний ИИ-сервер под свой рабочий процесс — с разбором многокарточной сборки, охлаждения, питания и цен украинского рынка? Это в отдельном разборе: как собрать локальный ИИ-ПК под задачу и бюджет.
Софт и экосистема: скрытая цена альтернатив
Характеристики — половина дела; вторая половина — стек инференса. Здесь NVIDIA берёт зрелостью, а альтернативы — ценой и ёмкостью.
- NVIDIA / CUDA — золотой стандарт: llama.cpp, Ollama, vLLM, LM Studio работают из коробки и на Windows, и на Linux. Платите за это ценой карты, зато софт предсказуем.
- Apple / MLX и Metal — зрело и энергоэффективно; unified-память убирает «налог» на копирование тензоров по PCIe. Но на равном размере модели NVIDIA быстрее в сыром throughput, а часть инструментов под Apple адаптируют позже.
- AMD / ROCm — догнал в ветке 6.x: Ollama, llama.cpp, vLLM заводятся, но чистая установка занимает часы против минут на CUDA, а Windows-поддержка ещё сырая — Linux де-факто обязателен.
- Intel Arc / Vulkan, SYCL — самый дешёвый вход, но главная ловушка именно в софте: стандартный Ollama не ускоряет Arc (молча считает на CPU), нужен llama.cpp с Vulkan/SYCL или LM Studio.
Вывод простой: если время дороже денег и нужен предсказуемый софт — переплата за NVIDIA окупается. Если бюджет жёсткий и не пугает вечер настройки — альтернативы дают ту же память заметно дешевле.
Частые ошибки и риски
Чего стоит избегать при выборе (с датами):
- Недокупить память. Если модель или контекст не влезают, данные уходят в системную RAM, и скорость падает с 50–100 до 2–5 ток/с — медленнее процессора. Берите объём с запасом под контекст (vc.ru/decodesfuture, 2026).
- Перепутать ёмкость и скорость. 128 ГБ unified не значит «быстро»: на плотных моделях решает пропускная способность, а у мини-боксов она втрое-всемеро ниже, чем у дискретных GPU (terminalbytes, 2026).
- Забыть про экосистему. Дешёвая ёмкость на AMD/Intel/Apple идёт с возней по софту: нет CUDA, а ROCm/SYCL/MLX требуют настройки. Заложите на это время (sitepoint, 2026).
- Игнорировать тип модели. Под unified-бокс берите MoE-модели (быстры), а не плотные 70B (медленны ~2–4 ток/с); для плотных нужна высокая ПС (r/LocalLLaMA, 2026).
- Купить «на вырост» не туда. Вместительный, но медленный бокс не станет быстрым GPU, а быстрый 32-ГБ GPU не вместит 70B. Сначала задача — потом железо.
FAQ
Сколько видеопамяти нужно для локального LLM? Зависит от модели: 7–8B комфортно в 12 ГБ, 14B — в 16–24 ГБ, 32B в квантовании — в 24 ГБ, плотная 70B в 4-бит — ~40–48 ГБ, frontier-модели 200B+ — 128–512 ГБ unified. Плюс запас под контекст: длинные сессии съедают память KV-кэшем. Брать стоит с запасом — выход за лимит обваливает скорость.
Что важнее для скорости — мощность чипа или память? Пропускная способность памяти. После загрузки модели генерация каждого токена — это прокачка весов из памяти, поэтому скорость почти линейно зависит от ПС, а не от «силы» чипа. Поэтому б/у RTX 3090 (936 ГБ/с) на влезающей модели часто быстрее, чем мини-бокс на 128 ГБ (256 ГБ/с).
GPU или Mac для локального ИИ? Mac (unified-память) берут ради ёмкости задёшево — он вмещает большие модели, которые не влезут в потребительскую видеокарту. Дискретный NVIDIA-GPU берут ради скорости и зрелого CUDA. Грубо: нужна ёмкость под крупные/MoE-модели — Mac или мини-бокс; нужна максимальная скорость на моделях ≤32 ГБ — RTX.
Можно ли запускать 70B локально и на чём? Да. Варианты: RTX PRO 6000 (96 ГБ, плотная 70B в FP8 на одной карте), сборка 2× RTX 3090 (48 ГБ, бюджетно через NVLink), мини-бокс на 128 ГБ или Mac Studio (вместят, но плотная генерация медленнее). Одна карта на 24 ГБ 70B целиком не держит — только с частичной выгрузкой и падением скорости.
Стоит ли брать мини-ПК на 128 ГБ (Strix Halo) под ИИ? Да, если вам нужны MoE-модели и большой контекст за разумные деньги. На MoE такие боксы быстры (gpt-oss-120B ~30 ток/с), а 128 ГБ дают ёмкость, недоступную видеокартам. Но плотные 70B на них медленные (~2–4 ток/с): это покупка ради вместимости, а не скорости.




